从完成任务到学会学习:meta learning 视角下的持续学习
讨论 LLM Agent 如何把长期经验转化为未来能力,并进一步改进自身的学习机制。
讨论 LLM Agent 如何把长期经验转化为未来能力,并进一步改进自身的学习机制。
探索如何在陌生但简单的任务上进行高效训练,并且不损失原模型的基础能力
KV Cache的一些笔记
现在各个训练框架中的KL散度计算都参考了John Schulman的博客。
PPO训练LLM的一些理解
从策略网络、价值网络到 MCTS,这篇长文按训练流程和搜索流程拆开讲 AlphaGO 的核心思路。