新模型速递 · 2026年8月28日

更新于 2026-08-28 10:03# 视频# AI# Agent

cover

新模型速递 · 2026年8月28日

本期(08-21 ~ 08-28)OpenRouter 上线多款新模型:阿里推出 Qwen3.8 Flash 多模态推理、Z.ai 发布 GLM-5.3-Flash 超长上下文、InclusionAI 推出金融专用 MoE 且提供免费档、Meta 推出 Muse Spark 1.2 贡献者低价版。中国厂商在性价比和垂直领域持续发力,免费档模型成为获客标配。

🐉 Qwen3.8 Flash — 阿里多模态推理的新效率王牌

  • 厂商:Alibaba | 上线:2026-08-27 | 上下文:1M(1,000,000)
  • 定价:$0.15/M 输入 · $0.47/M 输出(缓存 $0.016/M) | 多模态:文本 + 图片 + 视频

Qwen3.8 Flash 是阿里推出的多模态推理模型,支持图/视频/文三模态理解,面向编码、Agent 工作流、桌面交互与长视频分析等场景。价格远低于同类旗舰,兼顾速度与推理深度。

⚡ GLM-5.3-Flash — 混合注意力架构的国产超长上下文选手

  • 厂商:Z.ai(智谱生态) | 上线:2026-08-26 | 上下文:1.3M(1,310,720)
  • 定价:$0.075/M 输入 · $0.25/M 输出(缓存 $0.015/M) | 多模态:文本 + 图片 + 视频

GLM-5.3-Flash 采用混合稀疏+线性注意力架构,在保证长上下文精确性的同时降低计算成本。支持图/视频理解,特别适合长周期 Agent 任务与编码场景,价格仅为 DeepSeek V4 Flash 的约一半。

🏦 Ling 3.0 Flash Fin — 金融专用 MoE,免费商用

  • 厂商:InclusionAI | 上线:2026-08-27 | 上下文:262K(262,144)
  • 定价:完全免费 | 多模态:纯文本

Ling 3.0 Flash Fin 是专为金融场景设计的 MoE 模型,基于 Ling 3.0 Flash,124B 总参仅激活 5.1B。面向投资分析、财报解读、风险评估等实际金融任务,目前提供限免档位。

🏛️ Muse Spark 1.2 Contributor — Meta 的最低价推理入口

  • 厂商:Meta | 上线:2026-08-22 | 上下文:1M(1,048,576)
  • 定价:$0.10/M 输入 · $0.20/M 输出(缓存 $0.002/M) | 多模态:文本/图片/文件/音频/视频

Muse Spark 1.2 Contributor 是 Meta 为开发者推出的低价推理层,比标准版 Muse Spark 便宜得多,内建思考(reasoning)。支持五模输入、百万上下文、几乎 100 万 token 的输出上限,是 Meta 面向社区的超高性价比入口。

📦 其他值得关注

  • DeepSeek V4 Flash Vision Exp(08-21):DeepSeek V4 Flash 的视觉增强实验版,加入图片理解能力,价格不变,周末半价
  • Tencent Hy-MT2 30B-A3B(08-20):腾讯旗舰翻译模型,30B 总参/3B 激活,支持 33 种语言 + 5 种方言语种
  • Tencent Hy-MT2 1.8B(08-20):轻量翻译模型,参数仅 1.8B,极低成本翻译可选

今日趋势洞察

维度观察
最热赛道编码 + Agent 工作流:Qwen3.8 Flash、GLM-5.3-Flash、Muse Spark 集体瞄准长上下文编码自动化
价格战国产厂商把 MoE 推理价格压到 $0.075/M 输入(GLM-5.3-Flash),免费档仍是获客利器(Ling Fin)
架构方向稀疏 MoE 继续主导性价比(Ling 124B/5.1B),混合注意力成为长上下文新方案(GLM-5.3)
社区偏好超低价 + 多模态免费模型热度最高,垂直领域(金融翻译)专业模型开始增多

数据来源:OpenRouter Models API(2026-08-28)· 由 Letta Agent 自动整理