一个人 998 美元,训出一个自己的大模型

"训练大模型"这四个字,听起来像某个大厂研究部门才能干的事——几亿美元、几百个工程师、成排的机柜。
但有个人下班后自己试了一把,结果重新定义了这条门槛。
他叫 Hugo Vergnes,一个普通工程师。花 998 美元租云显卡、43 个小时,一个人,训出一个 3.8B 参数的模型,成绩超过了 2019 年的 GPT-2。
不是概念,是真实跑完的数字(他写成了带完整实验记录的长文,HN 上也热了一轮)。
一个人花了多少本钱
| 项 | 数字 |
|---|---|
| 成本 | $998(约 7000 元人民币) |
| 用时 | 43 小时(就是下班+周末的时间) |
| 显卡 | 租的 8×B200,按小时计费,不是自己买 |
| 模型规模 | 3.8B 参数(约 38 亿) |
| 成绩 | CORE 0.384,超过 GPT-2 的 0.2565 |
这是一个人、一笔个人预算、一段业余时间能干出来的事。
四年前 GPT-2 还是"业界最强";今天一个周末就能训练出超越它的模型。硬件不用自己买,按小时租——个人和实验室之间的那条壕沟,正在被"租卡"这种模式一点点抹平。
他是怎么做到的(几条能带走的心得)
作者反复折腾后总结出几条朴素经验,普通人也能看懂、也有用:
1. 好数据,比堆参数量管用。 他换成 ClimbMix 数据集后,收敛速度"飙升"——和社区大佬 Karpathy 的发现一模一样。数据选对了,比一味加参数见效快得多。
2. 学习率别早早压到底。 第一版他把学习率一路衰减到零,结果后 30% 的计算时间几乎白烧,曲线平得像条直线。改成"稳住再收尾",模型就能学到最后一刻。众笑说,这像跑步别太早泄气。
3. 半精度真香。 FP8 低精度训练让吞吐高了 33%——同一笔钱,能多练三分之一的量。
4. 把实验写成配置,而不是代码。 他做了个框架,每个实验就是一份 YAML 配置,换数据集、换优化器只改一行。好基础设施,是那种"几乎不用你手动改代码"的东西——这经验对任何搞重复实验的人都通用。
门槛塌了,意味着什么
不是说让你明天就去租卡训个大模型(毕竟还是要几千块)。而是把一件事说透:
你花钱能买到的"训练能力",一年比一年便宜、一年比一年强。
随着前沿不断前进,$1000 能带你走得更远。这句话是作者自己写的,也是这轮真正让我豁开的点——训练一个"自己的模型"这件听起来很科研的事,正在变成愿意折腾的人够得着的活。
这大概就是"毛坯解锁":从前是大厂专用,现在普通人也能玩。门槛塌下来的速度,常常比我们以为的快得多。
参考:作者博客原文 Training a 3.8B LLM to 0.384 CORE for $998、HN 讨论。
注:本文为个人视角观察稿,不构成任何训练/购买建议。