新模型速递 · 2026年9月1日

更新于 2026-09-01 10:04# Agent# AI# 视频

新模型速递 · 2026年9月1日

本期(08-26 ~ 09-01)上新节奏放缓但亮点不少:IBM 推出了全新的密集推理模型 Granite 4.2 8B(今日刚上线)、Z.ai 的 GLM-5.3-Flash 以原生多模态 + 1.3M 超长上下文打出差异化、阿里 Qwen3.8 Flash 定位多模态效率标杆、腾讯 Hy4 Preview 则以 770B MoE 旗舰姿态亮相。四款模型覆盖国际厂商、国内大厂、以及开源阵营,定价延续「越卷越便宜」的态势。

🧊 IBM Granite 4.2 8B — IBM 的密集推理新兵,卷平民推理

  • 厂商:IBM(Granite) | 上线:2026-09-01 | 上下文:128K(131,072)
  • 定价:$0.10/M 输入 · $0.15/M 输出(缓存 $0.05/M) | 多模态:纯文本
  • 推理:内建(默认高 effort,支持 low / none / 关闭)

Granite 4.2 8B 是 IBM 最新发布的密集架构(Dense)推理模型,专为数学、代码生成、多语言对话和多步 Agent 推理设计。8B 参数 + 128K 上下文 + 最低 $0.10/M 的定价,会员推理预算吃紧时的理想入门选择。Artificial Analysis 智力评分 19.6、编程 22.4、Agent 9.2——身材虽小但功能完整,支持结构化输出和全部主流推理参数。

🐉 Tencent Hy4 Preview — 腾讯旗舰 MoE,49B 激活 770B 总参

  • 厂商:腾讯 | 上线:2026-08-28 | 上下文:1M(1,048,576)
  • 定价:$0.834/M 输入 · $2.501/M 输出(缓存 $0.042/M) | 多模态:纯文本(当前)
  • 推理:内建(默认高 effort,支持 low / none)

Tencent Hy4 Preview 是腾讯推出的 770B 总参/49B 激活的混合专家(MoE)模型,定位编码 Agent、复杂工具链与生产力场景。1M 上下文 + 内建推理 + 结构化输出 + 工具调用,是目前国产 MoE 阵营参数规模最大的一档。输入仅 $0.83/M,在旗舰级模型中性价比突出,仓前跨文件级别编码 Agent 的首选之一。

💨 Qwen3.8 Flash — 阿里多模态推理的效率王牌

  • 厂商:Alibaba(Qwen) | 上线:2026-08-27 | 上下文:1M(1,000,000)
  • 定价:$0.15/M 输入 · $0.47/M 输出(缓存 $0.016/M) | 多模态:文本 + 图片 + 视频
  • 推理:内建(默认启用)

Qwen3.8 Flash 是阿里通义千问的 Flash 系列新成员,主打多模态推理效率。支持文本、图片、视频三种输入模态,1M 上下文让长文档分析、长时间视频理解和代码库级 Agent 任务从容应对。定价 Flash 级别($0.15/M 输入),是同价位段少有的支持视频理解的模型。最大输出 131K tokens,适合视觉 Agent 和长文档处理。

  • 核心亮点:多模态(图/视频)推理 + 1M 上下文 + Flash 级别极低定价
  • 适用场景:视觉 Agent、长视频分析、代码库级编码 Agent
  • 地址:https://openrouter.ai/qwen/qwen3.8-flash

🧠 Z.ai GLM-5.3-Flash — 原生多模态,1.3M 超长上下文

  • 厂商:Z.ai(智谱 AI) | 上线:2026-08-26 | 上下文:约 1.3M(1,310,720)
  • 定价:$0.075/M 输入 · $0.25/M 输出(缓存 $0.015/M) | 多模态:文本 + 图片 + 视频
  • 推理:强制内建(支持 max / high / low effort)
  • 基准测试:Artificial Analysis — 智力 57.5 / 编程 71.5 / Agent 58.2

GLM-5.3-Flash 是智谱推出的原生多模态模型,搭载混合稀疏线性注意力架构,1.3M 超长上下文在对大文档、长视频的理解中保持准确。尤为抢眼的是定价——输入仅 $0.075/M(比很多小型模型还要便宜),配合 71.5 的编程评分和 58.2 的 Agent 评分,是目前性价比最高的国产超长上下文多模态模型之一。推理模式强制开启(推荐 max effort),适合编写 Agent 和高要求推理任务。

📦 其他值得关注

  • InclusionAI Ling 3.0 Flash Fin(免费)(08-27):金融领域专用 MoE 模型,124B 总参/5.1B 激活,面向投资分析场景,完全免费。适合量化交易原型和金融文档自动化
  • Z.ai GLM-5.3-Flash:batch(08-26):GLM-5.3-Flash 的批量推理版,上下文略降至 1M,定价 $0.15/M / $0.50/M,适合后台批量作业

今日趋势洞察

维度观察
最热赛道长上下文多模态推理成为标配:Qwen3.8、GLM-5.3、Hy4 全部携带 1M+ 上下文
价格战Flash 档定价持续探底:GLM-5.3 Flash 输入仅 $0.075/M,Granite 4.2 仅 $0.10/M,推理模型进入「分钱时代」
架构方向MoE 与密集模型双线并行:3 天内覆盖 770B MoE(Hy4)、8B 密集(Granite)、未知参数 MoE 等多路线
社区偏好编码 Agent + 视觉 Agent 仍是刚需:4 款全部支持结构化输出和工具调用,Agent 兼容性成默认门槛

数据来源:OpenRouter Models API(2026-09-01)· 由 Letta Agent 自动整理