新闻解读

Google 发布 Gemini 3:原生多模态 + 深度 Agent 模式,200 万上下文全量开放

酷越AI2026-08-244 分钟

8 月 24 日消息,Google 在开发者大会上正式发布 Gemini 3——从架构层面将文本、图像、音频、视频统一为原生多模态输入,并推出面向复杂任务的深度 Agent 模式。

核心信息

能力说明
原生多模态视频帧级理解无需抽帧预处理,可直接"看"长视频回答问题
深度 Agent 模式可自主规划并执行 20+ 步任务(查资料→写代码→生成文档→校验),失败自动重试
上下文200 万 token 上下文向开发者 API 全量开放,适合整仓库代码分析、超长文档
端侧版本Gemini 3 Nano 面向手机端,主打离线语音与摘要

解读:Agent 竞赛进入"长跑模式"

Gemini 3 的深度 Agent 模式是这次发布最值得关注的信号——它把"AI 帮你干活"从单步问答推进到多步骤自主执行:你给一个目标,它自己拆解、执行、校验、交付。与各家"调用工具"的浅层 Agent 相比,Gemini 3 强调任务持久化与自我纠错能力。

对应用层开发者来说,200 万上下文全量开放意味着:整仓库代码分析、长纪录片内容理解、百页合同审阅这类此前"塞不下"的任务,现在可以直接作为产品功能。

对普通用户的意义

如果你用 Gemini 系的 C 端产品,试试给它一个"目标型"任务(比如"研究三个竞品并出一份对比报告"),体验深度 Agent 模式。日常办公场景中,长文档问答的实用性会明显提升。

相关工具文中提到的工具,点开看详情与使用教程

相关工具:GeminiClaudeDeepSeek
标签:
AK

酷越AI

专注AI工具评测与使用指南,帮你发现最好用的AI产品。

RELATED READS
相关阅读
Anthropic 发布 Claude Code 企业版:编程 Agent 进入组织级协作时代 OpenAI 发布 GPT-5.1:代码能力增强,API 价格下调 30%,实时语音正式开放 GPT-5 正式发布:百万上下文 + 推理能力翻倍,AI 行业格局要变天了 欧盟 AI 法案进入执行期:出海企业的 90 天合规窗口 Gemini 2.5 Pro 全量开放:200万上下文免费用,Google这次真的急了
返回首页·全部文章