
《Pretraining a Mini Kimi K3》是一本免费电子书,作者 Dr. Raj Dandekar 是 Vizuara AI Labs 的联合创始人,专门教人从第一性原理构建 LLM。全书是一份完整的预训练工作日志:单张 H200 上花 252.35 美元、喂 50 亿 token,从零预训练出一个 10.2 亿参数的 Kimi K3 复刻版(激活参数 1.45 亿)。
全书 30 个章节、179 张图,约 5 小时读完。开篇把 Moonshot 官方 K3 的配置逐行拆解,再讲缩小的算术:怎么把一个 2.8 万亿参数的模型缩到一张卡能训,而不缩成另一个模型。注意力堆栈(9 层 KDA + 3 层 MLA)、top-6 路由的 MoE、参数计数都单独成章。
数据部分也不省:1048 亿 token、六个来源的语料,训练前用 13-gram 匹配对 8 个 benchmark 做去污染,shard 格式支持中断后从断点续训。
最值钱的是它记录失败。Moonshot 发布的代码有 4 个未文档化的问题,直接跑不起来,作者写了一个绕开它们的训练循环;MoE 的 router 到第 20 步已经杀掉了 94.5% 的专家;跨卡训练还有 3 个不崩溃但悄悄出错的分布式 bug。
提速部分像一份实验笔记:16 次提高 MFU 的尝试只有 3 次成功,失败的那 13 次也原样写下,包括两个反直觉的结果——FP8 和换更大的 GPU 得分反而更差(0.19x)。
全程有数字:loss 从 12.10 降到 2.62,24 次跨训练过程的 benchmark 评测,最后一章直接回答”252 美元到底买到什么”。
适合想自己预训练 MoE 模型、或想弄懂 K3 / DeepSeek 这类架构的人。免费在线阅读,无需付费:
文档地址:https://books.vizuara.ai/book/pretraining-a-mini-k3