一个人 998 美元,训出一个自己的大模型

更新于 2026-09-10 16:03# AI# 硬件

"训练大模型"这四个字,听起来像某个大厂研究部门才能干的事——几亿美元、几百个工程师、成排的机柜。

但有个人下班后自己试了一把,结果重新定义了这条门槛。

他叫 Hugo Vergnes,一个普通工程师。花 998 美元租云显卡、43 个小时,一个人,训出一个 3.8B 参数的模型,成绩超过了 2019 年的 GPT-2。

不是概念,是真实跑完的数字(他写成了带完整实验记录的长文,HN 上也热了一轮)。

一个人花了多少本钱

数字
成本$998(约 7000 元人民币)
用时43 小时(就是下班+周末的时间)
显卡租的 8×B200,按小时计费,不是自己买
模型规模3.8B 参数(约 38 亿)
成绩CORE 0.384,超过 GPT-2 的 0.2565

这是一个人、一笔个人预算、一段业余时间能干出来的事。

四年前 GPT-2 还是"业界最强";今天一个周末就能训练出超越它的模型。硬件不用自己买,按小时租——个人和实验室之间的那条壕沟,正在被"租卡"这种模式一点点抹平。

他是怎么做到的(几条能带走的心得)

作者反复折腾后总结出几条朴素经验,普通人也能看懂、也有用:

1. 好数据,比堆参数量管用。 他换成 ClimbMix 数据集后,收敛速度"飙升"——和社区大佬 Karpathy 的发现一模一样。数据选对了,比一味加参数见效快得多。

2. 学习率别早早压到底。 第一版他把学习率一路衰减到零,结果后 30% 的计算时间几乎白烧,曲线平得像条直线。改成"稳住再收尾",模型就能学到最后一刻。众笑说,这像跑步别太早泄气。

3. 半精度真香。 FP8 低精度训练让吞吐高了 33%——同一笔钱,能多练三分之一的量。

4. 把实验写成配置,而不是代码。 他做了个框架,每个实验就是一份 YAML 配置,换数据集、换优化器只改一行。好基础设施,是那种"几乎不用你手动改代码"的东西——这经验对任何搞重复实验的人都通用。

门槛塌了,意味着什么

不是说让你明天就去租卡训个大模型(毕竟还是要几千块)。而是把一件事说透:

你花钱能买到的"训练能力",一年比一年便宜、一年比一年强。

随着前沿不断前进,$1000 能带你走得更远。这句话是作者自己写的,也是这轮真正让我豁开的点——训练一个"自己的模型"这件听起来很科研的事,正在变成愿意折腾的人够得着的活。

这大概就是"毛坯解锁":从前是大厂专用,现在普通人也能玩。门槛塌下来的速度,常常比我们以为的快得多。

参考:作者博客原文 Training a 3.8B LLM to 0.384 CORE for $998、HN 讨论。

注:本文为个人视角观察稿,不构成任何训练/购买建议。