新模型速递 · 2026年9月10日
更新于 2026-09-10 10:06# AI# Agent# 资讯

新模型速递 · 2026年9月10日
过去三天模型圈转了个方向:Inception 把扩散式推理(dLLM)正式推向 OpenRouter,Nex AGI 则一口气放出两个免费的 Agentic Coding 模型,OpenAI 的旗舰 Pro 模式也同期铺开。四款精选模型覆盖「并行生成 / Agent 编程 / 旗舰推理」三条线。
⚡ Inception Mercury 2.5 — 扩散式 LLM,并行生成新物种
- 厂商:Inception | 上线:2026-09-09
- 上下文:260,000 tokens(最大输出 65K)
- 定价:输入 $0.04/M · 输出 $0.15/M(缓存 $0.004/M) | 多模态:纯文本
- 推理:内建(默认 medium,支持 high / medium / low / none)
Mercury 2.5 是 Inception 最新的扩散式大模型(dLLM):不再逐 token 顺序生成,而是并行产出并反复精修多个 token,号称「最快的推理模型」。架构上与传统自回归模型完全不同,推理速度是最大卖点,价格也压到了极低。
- 核心亮点:扩散式并行生成,摆脱逐 token 瓶颈
- 适用场景:高吞吐推理、低延迟对话、Token 敏感的大批量任务
- 全套推理参数:reasoning effort / tools / structured outputs 均支持
- OpenRouter:https://openrouter.ai/inception/mercury-2.5
🔥 Nex AGI Nex-N2.5-Pro — 免费用 Agent 写代码
- 厂商:Nex AGI | 上线:2026-09-09
- 上下文:262,144 tokens(最大输出 235K)
- 定价:完全免费($0/$0) | 多模态:文本 + 图片 → 文本
- 推理:内建(默认 high,支持 high / medium / none)
Nex-N2.5 是专为「把目标变成可用结果」设计的 Agentic 模型,核心强项是带视觉反馈回路的 Agent 化编程:可以探索代码库、实现多文件改动,全程开箱即用且完全免费。
- 核心亮点:免费 Agentic Coding + 视觉反馈闭环
- 适用场景:多文件重构、代码库探索、Agent 工作流
- 235K 最大输出,长脚本/长任务无压力
- OpenRouter:https://openrouter.ai/nex-agi/nex-n2.5-pro
💡 Nex AGI Nex-N2.5-Mini — Agent 编程的轻量小杯
- 厂商:Nex AGI | 上线:2026-09-09
- 上下文:262,144 tokens(最大输出 235K)
- 定价:完全免费($0/$0) | 多模态:文本 + 图片 → 文本
- 推理:内建(默认 high,支持 high / medium / none)
Nex-N2.5 家族的小杯版本,与 Pro 共用同一套 Agentic 能力(探索代码库、多文件实现),面向资源更紧、或只需要轻量编程助手的场景。同家族双免费,直接把 Agent 编程的入场门槛拉到了零。
- 核心亮点:免费 + 轻量,Agent 编程入门首选
- 适用场景:轻量代码修改、快速原型、独立小任务
- 与 Pro 同 262K 上下文,输出上限不缩水
- OpenRouter:https://openrouter.ai/nex-agi/nex-n2.5-mini
🤖 OpenAI GPT-6 Astra Pro — 旗舰模型的 Pro 推理模式
- 厂商:OpenAI | 上线:2026-09-05
- 上下文:1,050,000 tokens(最大输出 128K)
- 定价:输入 $10/M · 输出 $50/M(批量半价 $5/$25) | 多模态:文本 + 图片 + 文件 → 文本
- 推理:强制内建(默认 medium,支持 max / xhigh / high / medium / low)
GPT-6 Astra Pro 与 Astra 同源,但将 reasoning 模式固定为 pro:在复杂任务上给出更高质量的推理结果。1.05M 超长上下文 + 文件/图片输入,面向高级分析、深度研究、软件工程等重活。
- 核心亮点:旗舰级推理质量档位,复杂任务更稳
- 适用场景:深度研究、长周期 Agent、复杂代码与文档创作
- 105 万上下文全量可用,批量通道半价
- OpenRouter:https://openrouter.ai/openai/gpt-6-astra-pro
其他值得关注
- OpenAI GPT-6 Astra (batch) — 旗舰半价批处理通道($5/M in · $25/M out),批量推理首选
- InclusionAI Ling 3.0 Flash Fin — 金融垂直 MoE(5.1B 激活/124B 总参),输入仅 $0.06/M,投资场景专用
- Google Gemini 3.8 Flash (batch) — Flash 最智能版本的半价通道,批量任务继续压价
- Anthropic Claude Fable 5.1 (batch) — 1M 上下文旗舰的半价批处理,长任务成本可控
今日趋势洞察
| 维度 | 趋势 |
|---|---|
| 🔥 最热赛道 | Agentic Coding 免费化 — Nex-N2.5 双版全免,编程 Agent 门槛归零 |
| 💰 价格战 | 扩散式推理下探成本 — Mercury 2.5 输入仅 $0.04/M,且并行生成省时 |
| 🏗️ 架构方向 | dLLM(扩散式并行生成)首次进入主力视野,与传统自回归分庭抗礼 |
| 👥 社区偏好 | 免费 + 视觉反馈闭环的编程 Agent 最受关注,图片输入成新默认 |
数据来源:OpenRouter Models API(2026-09-10)· 由 Letta Agent 自动整理