搜索框变成24小时智能体!谷歌I/O大会用Gemini 3.5 Flash掀起新风暴

导语:解析谷歌I/O大会核心发布,看Gemini 3.5 Flash如何重塑搜索、协同办公与多模态创作。

大模型竞争的下半场:从基准测试到智能体工程落地

谷歌在发布会上彻底揭开了通往智能体时代的序幕。CEO桑达尔·皮查伊在开场时分享了几组令人瞩目的数据:两年前快节奏的用户互动中,全球用户通过谷歌渠道每月消耗的Token仅为9.7万亿;而去年这一数字飙升至480万亿;到了今天,这个数字已经在原有高位上再次翻了七倍,达到了每月超过3.2千万亿Token的惊人规模。这种百倍级的跨越性增长,预示着AI应用已经从最初的尝鲜摸索,演变为开发者与大众日常生活中不可或缺的基础设施。

目前,全球已有超过850万名开发者正在使用Gemini生态来重构应用。在谷歌庞大的产品版图内,有13款应用的用户体量跨过了十亿门槛,其中甚至有5款产品拥有超过30亿的庞大用户群。以大家熟知的谷歌搜索“AI模式”为例,其月活跃用户早已突破10亿关口;而专注于创意生成的Nano Banana图像建模工具,至今也已创造了超过500亿张画面。如此庞大的业务体量,正全面转向依靠更具主动执行能力的智能体技术来支撑。

快如闪电的Gemini 3.5 Flash,为何成为新一代中枢?

虽然备受瞩目的重量级旗舰模型Gemini 3.5 Pro因技术打磨仍在内部测试阶段,未能按时面向公众亮相,引得发布会现场观众一阵惋惜,但皮查伊承诺的“下个月一定”也为市场留足了悬念。作为当前主打的先锋力量,轻量级模型Gemini 3.5 Flash即日起率先开放体验。这款模型不仅可以在谷歌搜索的AI Mode和Gemini App中直接调取,同时也对开发者开放了Google Antigravity平台接口、Google AI Studio及Android Studio的API,企业用户则能通过专有的Gemini Enterprise平台快速接入。

在技术指标上,Gemini 3.5 Flash在多项高难度编程与智能体评测中展现了极强的统治力。在针对终端掌控能力的Terminal-Bench 2.1测试中,它拿下了76.2%的成绩;在衡量开发能力与工作流效率的GDPval-AA和MCP Atlas基准中,分别取得了1656 Elo和83.6%的评分,其表现甚至超越了此前的Gemini 3.1 Pro。此外,它在考察多模态推理的CharXiv Reasoning指标上斩获了84.2%的高分。更令人关注的是,它的Token输出速率比其他主流模型快了4倍,而部署与运行的成本却降低到了前沿机型的一半以下。

在这种超高性价比和极佳响应速度的加持下,开发者无需再在模型智商与系统延迟之间纠结。结合新一代Antigravity执行框架后,Gemini 3.5 Flash能够化身成为多智能体协同工作的指挥官。在实际的协作场景中,它展现出了惊人的开发效能:借助开发平台,两个由Flash模型驱动的子智能体在对复杂的AlphaZero学术论文进行深度解析与逻辑合成后,仅用时6个小时便在虚拟沙盒中独立编写出了一款逻辑完整、可玩性极强的游戏程序。而在另一个演示中,子智能体群在Antigravity环境下快速迭代,完成了复杂精细的全新三维城市景观搭建。

同时,为了防范AI能力外溢带来的安全隐患,谷歌在设计Gemini 3.5系列模型时严格遵循了前沿安全框架(Frontier Safety Framework)。这使得模型在提升网络安全防护壁垒以及防范化学、生物、放射性与核能(CBRN)相关敏感风险时表现更为可靠。系统的敏感性判断也得到了深度优化,不仅能更精准地降解恶意内容的产出概率,也极大地减少了因误判而引起的合理请求被拒情况。

25年来最大巨变:谷歌搜索框演化为自主搜寻“特工”

谷歌最具盈利能力的基石产品——谷歌搜索,迎来了一次彻底重塑。在Gemini 3.5 Flash的深度融入后,延续了四分之一世纪的经典搜索框开始呈现出完全不同的交互形态。当用户移动鼠标输入查询请求时,搜索框会自动向外延伸,提供足够宽敞的空间来包容复杂的长句自然语言输入。用户甚至可以将本地图片、即时录制的视频、PDF分析文件以及当前浏览的Chrome标签页成组地上传至搜索输入区,让AI协同上下文进行跨模态判断。

这种新型交互更像是在给一位全职助理指派侦察任务。只要用户将多维度的需求细节输入其中,后台的多模态搜索智能体便会进入24小时不间断的自动化扫描工作。例如,当有换房需求的用户将自己的租房地段偏好、预算区间、物业要求等精细指南告知搜索框后,智能体将全天候监控新闻版块、地方论坛、社交媒体以及各类房源发布网站。一旦有匹配的新房源上线,系统会第一时间进行整理并推送,帮用户省去了每天反复刷新网页的繁琐操作。

Workspace全天候助手Spark:终结办公室里的机械重复

在日常协同办公领域,基于Gemini 3.5构建的独立AI智能体Spark展现出了卓越的自动化表现。该智能体原生集成了谷歌生态下的常用办公套件,包括Gmail邮箱、Docs文档和Slides演示文稿。用户可以用极其通俗的语言对其进行个性化培训,比如让它自动排查邮箱中的所有合作往来邮件,挑出涉及关键合同签署、会议审批的截止节点,并生成清晰的提醒日程表发回给用户。

Spark同样擅长处理那些繁杂的周期性核算工作。用户只需给它划定规则,告知需要防范的潜在暗坑(如未明示的扣费项目或订购费用),它就会定时读取月度信用卡电子账单进行核实与标记。此外,Spark还能横跨多种不同软件形态来运行复合型任务。比如在分析项目复盘报告时,它能一边从谷歌聊天群里的历史对话和商务往来邮件中提炼会议要点,一边将梳理出的论点填装进格式标准的谷歌文档内,最后自动起草一封简明扼要的说明邮件发向协作团队。

Gemini Omni Flash:迈向无界多模态的视频生成与编辑

多模态生成在Nano Banana大火之后迎来了新的迭代,谷歌推出了将逻辑推理与感官创作结合的Gemini Omni系列模型,首个公测版本为Gemini Omni Flash。该模型打破了传统文本与图像的界限,支持混合文字、音频、图片在内的多元输入格式,直接渲染出蕴含物理世界运动规律的高清视频,并可以通过连续的对话对话框对生成画面进行二次精修与编辑。

在展示的场景中,只需输入简单的口令命令“将当前艺术雕塑更换为五彩斑斓的泡泡质感”,系统便会平滑地重构视频中的物体结构与光影偏折,展现出极强的物性认知。用户如果上传了一段自己平时拍摄的微电影或生活记录片段,也能依靠Omni Flash进行后期大修,比如在空旷的房间里新增一位生动的虚拟NPC、修改原角色的运动轨迹,甚至能通过指令让视频中的环境光源跟后台播放的音频鼓点完美同步亮起。

目前,Gemini Omni Flash已经全面向Google AI Plus、Pro以及Ultra的订阅客户开放,支持在Gemini App及Google Flow中调用。同时,本周起该项视频生成特权也已被引入YouTube Shorts和YouTube Create应用的创作后台。后续的API生态开放也将在数周内加速落地企业端,让独立应用皆可调用这套视频创作能力。

纵观整场发布会,谷歌展现出的野心不再只是单纯比拼语言模型的知识面广度,而是将目光锁定了执行力强悍的场景落地。正如DeepMind创始人哈萨比斯在会后留下的那句思考一样,当我们从更远的时间维度回看当下,或许会由衷地感叹,人类此刻其实正真切地伫立在人工智能技术突变前的奇点山脚下。

© 版权声明

相关文章