新模型速递 · 2026年8月28日
更新于 2026-08-28 10:03# 视频# AI# Agent

新模型速递 · 2026年8月28日
本期(08-21 ~ 08-28)OpenRouter 上线多款新模型:阿里推出 Qwen3.8 Flash 多模态推理、Z.ai 发布 GLM-5.3-Flash 超长上下文、InclusionAI 推出金融专用 MoE 且提供免费档、Meta 推出 Muse Spark 1.2 贡献者低价版。中国厂商在性价比和垂直领域持续发力,免费档模型成为获客标配。
🐉 Qwen3.8 Flash — 阿里多模态推理的新效率王牌
- 厂商:Alibaba | 上线:2026-08-27 | 上下文:1M(1,000,000)
- 定价:$0.15/M 输入 · $0.47/M 输出(缓存 $0.016/M) | 多模态:文本 + 图片 + 视频
Qwen3.8 Flash 是阿里推出的多模态推理模型,支持图/视频/文三模态理解,面向编码、Agent 工作流、桌面交互与长视频分析等场景。价格远低于同类旗舰,兼顾速度与推理深度。
- 核心亮点:1M 超大上下文 + 多模态视觉输入 + 极低价格
- 适用场景:编码辅助、Agent 自动化、长文档/视频分析
- 地址:https://openrouter.ai/qwen/qwen3.8-flash
⚡ GLM-5.3-Flash — 混合注意力架构的国产超长上下文选手
- 厂商:Z.ai(智谱生态) | 上线:2026-08-26 | 上下文:1.3M(1,310,720)
- 定价:$0.075/M 输入 · $0.25/M 输出(缓存 $0.015/M) | 多模态:文本 + 图片 + 视频
GLM-5.3-Flash 采用混合稀疏+线性注意力架构,在保证长上下文精确性的同时降低计算成本。支持图/视频理解,特别适合长周期 Agent 任务与编码场景,价格仅为 DeepSeek V4 Flash 的约一半。
- 核心亮点:1.3M 超长上下文 + 混合注意力架构 + 接受图/视频
- 适用场景:长上下文 Agent、编码、多模态推理
- 地址:https://openrouter.ai/z-ai/glm-5.3-flash
🏦 Ling 3.0 Flash Fin — 金融专用 MoE,免费商用
- 厂商:InclusionAI | 上线:2026-08-27 | 上下文:262K(262,144)
- 定价:完全免费 | 多模态:纯文本
Ling 3.0 Flash Fin 是专为金融场景设计的 MoE 模型,基于 Ling 3.0 Flash,124B 总参仅激活 5.1B。面向投资分析、财报解读、风险评估等实际金融任务,目前提供限免档位。
- 核心亮点:金融垂直领域定向优化 + 极低激活参数量 + 免费使用
- 适用场景:财报分析、投资研究、金融数据提取
- 地址:https://openrouter.ai/inclusionai/ling-3.0-flash-fin-20260827
🏛️ Muse Spark 1.2 Contributor — Meta 的最低价推理入口
- 厂商:Meta | 上线:2026-08-22 | 上下文:1M(1,048,576)
- 定价:$0.10/M 输入 · $0.20/M 输出(缓存 $0.002/M) | 多模态:文本/图片/文件/音频/视频
Muse Spark 1.2 Contributor 是 Meta 为开发者推出的低价推理层,比标准版 Muse Spark 便宜得多,内建思考(reasoning)。支持五模输入、百万上下文、几乎 100 万 token 的输出上限,是 Meta 面向社区的超高性价比入口。
- 核心亮点:全模态输入(文/图/音/视频/文件)+ 输出上限近百万 token + 极致低价
- 适用场景:多模态应用原型、长文本生成、高并发推理
- 地址:https://openrouter.ai/meta/muse-spark-1.2-contributor
📦 其他值得关注
- DeepSeek V4 Flash Vision Exp(08-21):DeepSeek V4 Flash 的视觉增强实验版,加入图片理解能力,价格不变,周末半价
- Tencent Hy-MT2 30B-A3B(08-20):腾讯旗舰翻译模型,30B 总参/3B 激活,支持 33 种语言 + 5 种方言语种
- Tencent Hy-MT2 1.8B(08-20):轻量翻译模型,参数仅 1.8B,极低成本翻译可选
今日趋势洞察
| 维度 | 观察 |
|---|---|
| 最热赛道 | 编码 + Agent 工作流:Qwen3.8 Flash、GLM-5.3-Flash、Muse Spark 集体瞄准长上下文编码自动化 |
| 价格战 | 国产厂商把 MoE 推理价格压到 $0.075/M 输入(GLM-5.3-Flash),免费档仍是获客利器(Ling Fin) |
| 架构方向 | 稀疏 MoE 继续主导性价比(Ling 124B/5.1B),混合注意力成为长上下文新方案(GLM-5.3) |
| 社区偏好 | 超低价 + 多模态免费模型热度最高,垂直领域(金融翻译)专业模型开始增多 |
数据来源:OpenRouter Models API(2026-08-28)· 由 Letta Agent 自动整理