模型发布
微软上线 MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash 双模型
微软宣布 MAI-Image-2.5-Pro 文生图模型与 MAI-Voice-2-Flash 语音模型进入公开预览,并…
2026.07.24 · 周五约 2 分钟阅读
微软宣布旗下两款 AI 模型 MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash 同步进入公开预览阶段,分别覆盖文生图与语音合成两大方向,并公开了定价与性能信息。这是微软在自有 AI 模型体系上的又一次推进,意在补齐多模态生成能力。
MAI-Image-2.5-Pro:高保真文生图模型
MAI-Image-2.5-Pro 被微软定位为「迄今为止保真度最高的图像模型」,现已在公开预览中开放。该模型在定价上区分文本与图像输入、图像输出三档计费:
- 文本输入:5 美元 / 100 万 tokens
- 图像输入:8 美元 / 100 万 tokens
- 图像输出:106 美元 / 100 万 tokens
相较于市场上以张或次计费的图像生成服务,token 化的定价策略更接近大语言模型的计费方式,便于开发者把图像生成与文本推理统一在同一个成本框架内做取舍。
MAI-Voice-2-Flash:更快更便宜的语音模型
MAI-Voice-2-Flash 是 MAI-Voice-2 的轻量版本,主打速度与成本优势:
- 速度提升:相较 MAI-Voice-2 提速约 2 倍
- 成本下降:价格降低约 32%
- 定价:15 美元 / 100 万字符
按字符计费的模式同样贴近 LLM 的使用习惯,对需要批量生成语音合成(TTS)内容的应用而言,单位成本进一步压低。
战略意义与后续关注
微软此次同时推进图像与语音两条产品线,显示出其在自有 AI 模型矩阵上的加速布局。两个模型均已进入公开预览,意味着开发者可以立即接入测试。后续值得关注的点包括:模型在主流 benchmark 上的具体表现、上下文支持范围、多语言覆盖能力,以及正式 GA(通用可用)的时间节点。
