小模型崛起:为什么你的下一个AI产品可能只要十分之一的成本

更新于 2026-08-28 08:13

小模型崛起:为什么你的下一个AI产品可能只要十分之一的成本

一个被大多数人忽略的事实:消费级AI产品迟迟没爆发,不是因为需求不够,而是模型太贵。现在,小模型把门槛打了下来。

一个有趣的实验

Calvin French-Owen(Segment 联合创始人)最近做了一件事:用 gpt-5.6-luna(一个相对小的模型)搭建了一个每日个性化新闻站。

这个站会自动上网搜索他感兴趣的内容——浏览 Hacker News、Reddit、Twitter,抓取当天最相关的话题,整理成一份属于他自己的日报。

如果用上一代旗舰模型(Claude Sonnet 级别),每次生成这份日报的成本大约是 1 美元。按每月 30 美元收费?几乎不赚钱。

但用 luna 跑同样的任务,成本降到了 0.1 美元

十分之一。

"现在我们有得聊了。"Calvin 写道。

被忽视的瓶颈

这几年大家一直在追大模型的进展——参数规模、推理能力、多模态……

但在消费级产品这端,有一个更现实的问题:每个用户请求的推理成本

传统消费互联网的公式很简单:

一个吸引人的网站 → 吸引用户 → 融资 → 扩大规模

Google、Facebook、Snapchat 都是这么起来的。每个用户每次请求的成本几乎为零。

但加进 AI 之后就变了——每次对话、每次生成、每次分析,都要花推理钱。用户越多,烧钱越快。这就把消费级 AI 产品的门槛拉高了一大截。

Calvin 和投资人聊过,对方也困惑:"怎么还没看到更多的消费级 AI 公司?"

答案其实很直白:token 太贵了。

"95% 的工作不需要天才"

Calvin 和 Segment 的另一位联合创始人 Peter 去爬山时聊到了这个问题。

Peter 同时管着好几家公司——Segment(卖了)、Charm Industrial(融了 1 亿+)、Revoy(刚融了 Series A)。他是出了名的高效。

但 Peter 说,他每天做的事,大约 95% 都属于第二类工作

  • 第一类("IQ 180"):天才创意、颠覆式解决方案
  • 第二类("token spewer"):快速响应、推动进度、回复消息、解决问题

绝大多数日常工作,都是第二类。

这个观察跟 AI 的发展方向不谋而合——大部分商业场景需要的不是「最强的模型」,而是 「够快够便宜、够用就好」的模型

你把公司里的人和供应商拉个清单想想:90% 的时候,你需要的只是一个人响应快、把事办了。不需要每次都是爱因斯坦。

小模型扮演的,就是这个角色。

小模型军团已经就位

不止是 gpt-5.6-luna。GLM 5.3、Gemini Flash 系列……一批「在性价比曲线上站住脚」的小模型正在集结。

它们的特点是:

  • 够聪明:复杂任务(搜索几千封邮件、分析代码、整理日报)都能做
  • 够快:响应速度比旗舰模型快得多
  • 够便宜:单次成本在几毛钱到几毛钱之间

这对创业者来说意味着什么?

如果你有个 AI 产品的想法,之前算账可能是这样的:每个用户每天用 10 次 × 1 美元 = 10 美元,月费怎么收?

现在变成了:每个用户每天 10 次 × 0.1 美元 = 1 美元。留出利润空间就现实了。

消费级 AI 产品的窗口,正在打开。

当然,旗舰仍然有它的位置

这并不是在说大模型没用了。

在需要真正突破的领域——工程难题、科学研究、前沿探索——最强的旗舰模型依然是不可替代的。它们做的是 5% 的「IQ 180」工作。

但对于剩下 95% 的场景——日常办公、客服、内容生成、数据分析——小模型是那个恰到好处的答案

所以

如果你一直想做一款 AI 产品,但被算账算到劝退,现在是重新打开计算器的时候了。

小模型已经把「能不能做」变成了「怎么做」。剩下的事,是产品、体验、用户——那些跟模型大小无关的事。

毕竟,用户不关心你用的是旗舰还是小模型。他们只关心:这玩意儿好用吗?


本文灵感来自 Calvin French-Owen 的文章 「Small Models Have Arrived」(calv.info)。