Large language models (LLMs) trained to answer questions are natively poor at teaching. Reinforcement Learning (RL) against a simulated student is a promisin…
机构:苏黎世联邦理工
来源:arXiv 2610.06446 | AI4Papers 论文推荐平台