Gemini 3.1: pro/flash-lite/live/tts
Gemini 3.1不是一个带有四个营销名称的单一模型。它是一个路由图:为困难工作提供深度推理,为大批量任务提供低成本吞吐量。
梯形图转SCL | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo
Gemini 3.1不是一个带有四个营销名称的单一模型。它是一个路由图:为困难工作提供深度推理,为大批量任务提供低成本吞吐量。
1、Gemini 3.1 Pro是图表的深度工作端
Google DeepMind的模型卡将Gemini 3.1 Pro描述为一个原生多模态推理模型,适用于复杂任务。其输入包括文本、图像、视频、音频和PDF,模型可以处理大型代码库和工具调用。
模型页面列出了100万token的输入限制和64,000 token的输出限制。它还列出了函数调用、结构化输出、搜索作为工具和代码执行。这些功能使Pro适合需要模型持有大型证据集、跨模态推理并返回其他系统可以使用的内容的任务。
这并不意味着每个请求都应该使用Pro。百万token窗口提高了上限;它不会使小型分类更有价值。它也可能使错误来源更难被发现,因为来源以更详细的形式可用。
正确的Pro问题是:任务是否需要长上下文、深度推理、多模态综合或代理工具使用?如果不是,更轻量的路由可能是更专业的选择。
2、基准测试表是操作点的地图
Google的模型卡将Gemini 3.1 Pro Thinking的高设置与其他系统在命名的测试环境和条件下进行比较。一些主要值包括:
- Humanity's Last Exam — Gemini 3.1 Pro结果: 44.4% — 条件: 无工具
- Humanity's Last Exam with search and code — Gemini 3.1 Pro结果: 51.4% — 条件: 搜索黑名单加代码
- ARC-AGI-2 — Gemini 3.1 Pro结果: 77.1% — 条件: ARC Prize Verified
- Terminal-Bench 2.0 — Gemini 3.1 Pro结果: 68.5% — 条件: Terminus-2 harness
- SWE-Bench Verified — Gemini 3.1 Pro结果: 80.6% — 条件: 单次尝试
- BrowseComp — Gemini 3.1 Pro结果: 85.9% — 条件: 搜索、Python和浏览
- τ2-bench Retail — Gemini 3.1 Pro结果: 90.8% — 条件: 代理工具使用设置
- MRCR v2, 1M pointwise — Gemini 3.1 Pro结果: 26.3% — 条件: 长上下文检索设置
这些数字很有用,因为它们展示了广度,但它们不是通用排行榜。模型卡本身记录了不同的工具访问、测试环境、尝试次数和思考设置。有搜索的分数回答的问题与没有工具的分数不同。
不常见的细节是MRCR v2。模型可以宣传百万token输入限制,同时长上下文检索仍然是一个独立的问题。"可以接受百万token"和"可以可靠地在百万token内找到正确的事实"不是同义词。
对于实际系统,在答案改变的地方测量检索精度。如果模型选择了错误的发票、仓库文件或策略段落,漂亮的最终解释也无法挽救工作流。
3、Flash-Lite是队列管理器
Google的开发文档将Gemini 3.1 Flash-Lite描述为一个低成本、高效率的多模态模型,适用于高频、轻量级任务。文档中显示的稳定模型ID是gemini-3.1-flash-lite。
输入限制为1,048,576 token,输出限制为65,536 token。这在纸面上听起来几乎像Pro,但产品意图不同。Flash-Lite针对翻译、转录、提取、分类、文档分类和延迟及成本是主要约束的轻量级代理工作进行了优化。
它接受文本、图像、视频、音频和PDF输入。文档列出了结构化输出、函数调用、搜索基础、文件搜索、代码执行和URL上下文。它没有列出此路由的图像生成或Live API支持。
最后一个区别在操作上很重要。大上下文窗口不会使Flash-Lite成为Pro的通用替代品。它是一个宽入口漏斗,而不是最深的推理台。
Google的文档甚至将路由用作模型模式:低成本分类器可以决定请求是留在Flash-Lite上还是移动到更强大的模型。这对构建者来说是一个实用的线索。让廉价模型在花费高级计算之前回答简单问题"这是什么类型的任务?"
4、Live改变了交互的形状
Gemini API变更日志记录了gemini-3.1-flash-live-preview作为一个音频到音频模型,用于实时对话和语音优先应用程序,于3月26日发布。
Live不仅仅是延迟更短的TTS。对话有轮流发言、中断、部分音频、沉默、插入行为、工具调用以及用户在完整响应完成之前改变方向的可能性。
因此测试应该包括事件,而不仅仅是最终转录:
- 系统多快开始响应;
- 当用户中断时是否停止;
- 工具调用是否被宣布和确认;
- 是否保留句子的未解决部分;
- 最终答案是否与实际发出的音频一致。
罕见的工作流洞察是将对话存储为事件日志。保留用户音频、部分转录、模型轮次、工具请求、工具结果和由时间戳链接的最终音频。如果系统出错,"声音听起来不对"不足以调试它。你需要知道错误是始于识别、轮次检测、推理、工具使用还是合成。
5、TTS是一个独立的交付表面
Google的语音生成文档公开了gemini-3.1-flash-tts-preview。它支持单人和多人语音、对语气、口音和节奏的自然语言控制、一组语音选项和流式音频输出。
API示例展示了转录和交付指令之间的有用区别。提示可以指定一个说话者听起来疲倦,另一个兴奋,然后为每个说话者分配语音。TTS路由输出音频;另一个模型可以先创建或修改转录。
这种分离比要求一个对话模型在没有检查点的情况下即兴创作脚本和表演更健康。当发音、法律语言或时间安排很重要时,在语音传递之前冻结文字。
TTS应该在行级别进行测试:
- 提供包含姓名、数字和标点的简短脚本。
- 添加交付指令而不改变文字。
- 以第二种情感方向生成相同的行。
- 比较发音、时间安排、呼吸放置和说话者连续性。
- 将确切的模型ID、语音和提示与音频一起保存。
自然语言风格控制很有用,但它们也可能隐藏回归。听起来更有表现力的声音可能变得不够精确。生产指标不是"足够人性化",而是"有表现力而不破坏指令"。
6、一个家族,四种失败模式
Gemini 3.1的分支失败方式不同:
- Pro — 最适合: 深度推理、长上下文、多模态代理 — 需注意的失败: 从大上下文检索到看似合理但错误的来源
- Flash-Lite — 最适合: 高容量提取、路由和分类 — 需注意的失败: 快速处理任务但错过需要升级的模糊性
- Live — 最适合: 实时音频到音频对话 — 需注意的失败: 丢失轮次边界或在工具结果确认之前采取行动
- Flash TTS — 最适合: 受控叙述和多人交付 — 需注意的失败: 听起来自然但错误发音姓名、数字或技术术语
这张表比单一家族排名更有用。同一个应用程序可能需要所有四个路由。语音助手可以使用Flash-Lite对传入请求进行分类,Pro推理复杂账户问题,Live管理音频循环,TTS生成受控公告。
7、构建者的实用路由器
从窄输入模式开始:
- 模态:文本、图像、视频、音频或文档;
- 延迟预算:批处理、交互式或实时;
- 输出类型:文本、JSON、工具调用或音频;
- 风险级别:可逆答案或外部操作;
- 上下文大小:短、长或仓库规模。
然后路由:
- 使用Flash-Lite进行分类、提取和首次转录。
- 将模糊或高影响请求升级到Pro。
- 仅当用户体验依赖于中断和流式传输时使用Live。
- 在转录和交付约束批准后使用TTS。
- 在代理语音循环更改数据或联系其他人之前要求确认。
小技巧是记录每次升级的原因。"发送到Pro因为PDF包含两个冲突的总数"比安静地学习将所有内容发送到昂贵模型的路由器更有用。
8、安全是路由的一部分
多模态输入可能包含图像、文档、语音指令或网页结果中的提示注入。实时音频增加了另一个风险:快速、自然的响应可以使未确认的操作听起来已被批准。
保持读写工具分离。使用结构化输出进行路由决策。在购买、消息、帐户更改或破坏性操作之前添加回读步骤。将音频和转录保留规则与模型配置一起存储。
预览端点和模型别名也需要纪律。Google的变更日志显示模型ID随时间推出、重定向和弃用。在可重复性很重要的地方固定快照,并在实验记录中保留别名加日期。
9、底线
Gemini 3.1在最实际的意义上是一个家族发布。
Pro是具有多模态上下文、工具和大型推理预算的深度工作台。Flash-Lite是高容量队列管理器。Live是实时音频循环。Flash TTS是受控交付层。
这个家族的优势不是某个模型赢得每个基准测试。而是应用程序可以根据必须处理的事件选择模型。这使得系统更快、更容易审计——如果路由边界是明确的。
按循环选择,而不是按标志:
在歧义昂贵时深入推理,在重复量大时轻量路由,仅在时间安排重要时流式传输,在文字批准后合成语音。
这是隐藏在Gemini 3.1发布中的模型家族洞察。
原文链接:Gemini 3.1: Google Splits Pro, Flash-Lite, Live and TTS
汇智网翻译整理,转载请标明出处