TOO FAST / PERSONAL RESEARCH ARCHIVE
记录 RL 后训练、RL Infra 与训练—系统 Co-design 中的问题、实验和工程判断。
- ESTABLISHED
- 2026
- RECORDS
- 002
- LANG
- ZH-CN
- STATUS
- ACTIVE
RECORD INDEX
文章
按发布日期排列的研究随笔与工程判断。
ESSAY-002 LATEST
Attention Residuals 阅读补充
围绕 Attention Residuals 整理相关知识、数学推导与系统分析,包括 RMSNorm 的数学原理,以及 Full 与 Block AttnRes 的推理和训练开销。
MODEL ARCHITECTURENORMALIZATIONINFRA CO-DESIGN
ESSAY-001
用 AI 把模糊研究想法整理成路线图
从“我想让 GRPO 训练更稳定”出发,让 AI 追问目标、约束、变量和停止条件,直到一句直觉变成可以检查、执行和修订的研究计划。
RL POST-TRAININGRESEARCH WORKFLOW
ROADMAP OUTPUT
一句模糊想法,怎样变成研究路线图
我想让 GRPO 训练更稳定。
- 01 DEFINE
把“稳定”改写成可观测信号与反证条件。
- 02 BASELINE
固定模型、数据、奖励与预算,复现当前行为。
- 03 PROBE
一次改变一个变量,记录收益与护栏指标。
- 04 VERIFY
用独立运行确认结果,并作出继续、修订或停止决定。