DeepSeek 涨价了!想自己本地跑 V4 Flash?这份配置清单先收好

更新于 2026-08-06 23:55# Agent# 效率工具# 后端

DeepSeek 涨价了!想自己本地跑 V4 Flash?这份配置清单先收好

最近圈子里最热的新闻,就是 DeepSeek 官方宣布 API 要大幅涨价(8月6日公告,V2EX、知乎、Hacker News 全在刷屏)。

消息一出,很多人第一反应是:那我能不能自己本地跑一个 DeepSeek,不花这个钱?

刚好这阵子 DeepSeek V4 Flash 悄悄发布了(7月31日上线),这是 DeepSeek 最新一代的轻量模型,很多人在问"本地跑要什么配置"。今天我们就用小白也能看懂的方式,把这笔账算清楚。

先搞懂:DeepSeek V4 Flash 是个啥?

一句话版:它是 DeepSeek 新一代模型,官网主打"便宜、快、上下文超长"。几个关键数字(OpenRouter 官方数据):

  • 总参数 2840 亿(284B),但用了 MoE(混合专家)架构,每次只激活 130 亿(13B)
  • 上下文长度 100 万 token(1M),差不多可以把几百万字的长文一次丢给它
  • 定价极低:输入每百万 token 只要 0.09 美元(约 0.6 元),输出 0.18 美元

听起来很香对吧?"激活只要 13B,那是不是一般显卡就能跑?"

真相:284B 就是 284B,没那么简单

这里正是最坑的地方,也是 V2EX 上好几个帖子在问的"本地部署要什么配置"的答案核心:

MoE 模型的"激活参数少"省的是算力(运行功耗),不是省显存(加载占用)。 你要把 2840 亿个参数全部装进显存才能跑得起来——

  • FP8 精度整模型约需 ~300GB 显存 → 至少 2 张 H100/H20(80GB+)级别的卡,或者一台 8×H100 服务器,成本几十万起步
  • 目前社区里能跑的方案(GitHub 上 llama.cpp 的实验实现、DGX Spark 部署配方),都是 2×DGX Spark / 2×H100 级别
  • 只有等社区出低精度量化版(比如 4bit),才可能压到单张 48GB~80GB 的卡上,但那也要顶级消费卡(RTX 5090 48GB),一块大几万

所以直白说:本地跑 V4 Flash,普通人的电脑跑不动。 它虽然"激活13B",但那是给头部玩家上机的规格,不是给个人 PC 的。

那就没辙了吗?普通人有三条路

① 继续用官方 API(推荐):涨价是"大幅涨",但对标它的能力,价格依然很低。看 OpenRouter 数据,V4 Flash 定价 0.09/0.18 美元每百万 token,在同类里是性价比第一梯队。日常翻译、总结、写代码、跑自动化,用 API 完全够,几乎零门槛。

② 用集成工具白嫖/平替:现在很多 AI 编程类工具都内嵌了新模型,比如 Codex、Claude Code 都支持配置 DeepSeek V4 Flash 这类模型(网上有大把"把 DeepSeek 接入 Claude Code"的教程)。用工具配好,等于用一个很便宜的价格享受接近旗舰的体验。

③ 等待社区量化版再本地玩:如果你真的想体验本地部署,可以持续关注 llama.cpp 对 V4 Flash 的实验性支持(GitHub 上已有 antirez 的实验实现,star 335+),等它出 4bit 量化版,那才是普通人本地跑通的一天。想尝鲜的极客可以现在就跟着仓库自己编译跑跑看,倒也乐在其中。

给你存个配置速查

方案需要什么成本量级
官方 API什么都不用每百万 token 约 0.6 元,性价比高
工具接入(Codex/Claude Code 等)只要会用工具按用量扣费,便宜
本地 FP8 部署2×H100/DGX Spark + 300GB 显存几十万元
本地量化部署(未来)单张 48~80GB 卡(如 RTX 5090)数万元

总结一句话

DeepSeek 涨价虽然让人肉疼,但 V4 Flash 这个新款的性价比依然在线;而"自己本地跑"这件事,先别冲动买显卡——等社区量化版成熟再上,日常用 API 完全够。看完这篇,你应该不会再被"13B 激活参数=低配能跑"的老套路忽悠了。

(本文数据来源:OpenRouter 模型页、GitHub 社区仓库、全网热议帖。如有变动以官方为准。)