DeepSeek 涨价了!想自己本地跑 V4 Flash?这份配置清单先收好

DeepSeek 涨价了!想自己本地跑 V4 Flash?这份配置清单先收好
最近圈子里最热的新闻,就是 DeepSeek 官方宣布 API 要大幅涨价(8月6日公告,V2EX、知乎、Hacker News 全在刷屏)。
消息一出,很多人第一反应是:那我能不能自己本地跑一个 DeepSeek,不花这个钱?
刚好这阵子 DeepSeek V4 Flash 悄悄发布了(7月31日上线),这是 DeepSeek 最新一代的轻量模型,很多人在问"本地跑要什么配置"。今天我们就用小白也能看懂的方式,把这笔账算清楚。
先搞懂:DeepSeek V4 Flash 是个啥?
一句话版:它是 DeepSeek 新一代模型,官网主打"便宜、快、上下文超长"。几个关键数字(OpenRouter 官方数据):
- 总参数 2840 亿(284B),但用了 MoE(混合专家)架构,每次只激活 130 亿(13B)
- 上下文长度 100 万 token(1M),差不多可以把几百万字的长文一次丢给它
- 定价极低:输入每百万 token 只要 0.09 美元(约 0.6 元),输出 0.18 美元
听起来很香对吧?"激活只要 13B,那是不是一般显卡就能跑?"
真相:284B 就是 284B,没那么简单
这里正是最坑的地方,也是 V2EX 上好几个帖子在问的"本地部署要什么配置"的答案核心:
MoE 模型的"激活参数少"省的是算力(运行功耗),不是省显存(加载占用)。 你要把 2840 亿个参数全部装进显存才能跑得起来——
- FP8 精度整模型约需 ~300GB 显存 → 至少 2 张 H100/H20(80GB+)级别的卡,或者一台 8×H100 服务器,成本几十万起步
- 目前社区里能跑的方案(GitHub 上 llama.cpp 的实验实现、DGX Spark 部署配方),都是 2×DGX Spark / 2×H100 级别
- 只有等社区出低精度量化版(比如 4bit),才可能压到单张 48GB~80GB 的卡上,但那也要顶级消费卡(RTX 5090 48GB),一块大几万
所以直白说:本地跑 V4 Flash,普通人的电脑跑不动。 它虽然"激活13B",但那是给头部玩家上机的规格,不是给个人 PC 的。
那就没辙了吗?普通人有三条路
① 继续用官方 API(推荐):涨价是"大幅涨",但对标它的能力,价格依然很低。看 OpenRouter 数据,V4 Flash 定价 0.09/0.18 美元每百万 token,在同类里是性价比第一梯队。日常翻译、总结、写代码、跑自动化,用 API 完全够,几乎零门槛。
② 用集成工具白嫖/平替:现在很多 AI 编程类工具都内嵌了新模型,比如 Codex、Claude Code 都支持配置 DeepSeek V4 Flash 这类模型(网上有大把"把 DeepSeek 接入 Claude Code"的教程)。用工具配好,等于用一个很便宜的价格享受接近旗舰的体验。
③ 等待社区量化版再本地玩:如果你真的想体验本地部署,可以持续关注 llama.cpp 对 V4 Flash 的实验性支持(GitHub 上已有 antirez 的实验实现,star 335+),等它出 4bit 量化版,那才是普通人本地跑通的一天。想尝鲜的极客可以现在就跟着仓库自己编译跑跑看,倒也乐在其中。
给你存个配置速查
| 方案 | 需要什么 | 成本量级 |
|---|---|---|
| 官方 API | 什么都不用 | 每百万 token 约 0.6 元,性价比高 |
| 工具接入(Codex/Claude Code 等) | 只要会用工具 | 按用量扣费,便宜 |
| 本地 FP8 部署 | 2×H100/DGX Spark + 300GB 显存 | 几十万元 |
| 本地量化部署(未来) | 单张 48~80GB 卡(如 RTX 5090) | 数万元 |
总结一句话
DeepSeek 涨价虽然让人肉疼,但 V4 Flash 这个新款的性价比依然在线;而"自己本地跑"这件事,先别冲动买显卡——等社区量化版成熟再上,日常用 API 完全够。看完这篇,你应该不会再被"13B 激活参数=低配能跑"的老套路忽悠了。
(本文数据来源:OpenRouter 模型页、GitHub 社区仓库、全网热议帖。如有变动以官方为准。)