8 月 24 日消息,Google 在开发者大会上正式发布 Gemini 3——从架构层面将文本、图像、音频、视频统一为原生多模态输入,并推出面向复杂任务的深度 Agent 模式。
核心信息
| 能力 | 说明 |
|---|---|
| 原生多模态 | 视频帧级理解无需抽帧预处理,可直接"看"长视频回答问题 |
| 深度 Agent 模式 | 可自主规划并执行 20+ 步任务(查资料→写代码→生成文档→校验),失败自动重试 |
| 上下文 | 200 万 token 上下文向开发者 API 全量开放,适合整仓库代码分析、超长文档 |
| 端侧版本 | Gemini 3 Nano 面向手机端,主打离线语音与摘要 |
解读:Agent 竞赛进入"长跑模式"
Gemini 3 的深度 Agent 模式是这次发布最值得关注的信号——它把"AI 帮你干活"从单步问答推进到多步骤自主执行:你给一个目标,它自己拆解、执行、校验、交付。与各家"调用工具"的浅层 Agent 相比,Gemini 3 强调任务持久化与自我纠错能力。
对应用层开发者来说,200 万上下文全量开放意味着:整仓库代码分析、长纪录片内容理解、百页合同审阅这类此前"塞不下"的任务,现在可以直接作为产品功能。
对普通用户的意义
如果你用 Gemini 系的 C 端产品,试试给它一个"目标型"任务(比如"研究三个竞品并出一份对比报告"),体验深度 Agent 模式。日常办公场景中,长文档问答的实用性会明显提升。