谷歌 Pixel 11 发布会:硬件成 Gemini「容器」,对比豆包手机有何不同
Made by Google 2026 发布 Pixel 11 系列手机及多款硬件,Gemini 全面接管系统层,与豆包…
北京时间 8 月 13 日上午,谷歌举行 Made by Google 2026 硬件发布会,一口气推出 Pixel 11 系列手机、Pixel Watch 5、首款防丢器 Pixel Tag,并预告年内将推出智能眼镜。整场发布会贯穿一个核心思路:硬件不再追求参数领先,而是充当 Gemini 的载体,AI 能力才是主角。这一路径与国内「豆包手机」的思路相似,但两家的技术路线并不相同。
硬件矩阵:产品丰富,但亮点有限
Pixel 11 系列是本场发布会的核心,共四款机型,全系搭载谷歌新一代 Tensor G6 处理器,该芯片专为 Gemini 端侧运行设计。价格方面,整体较上代提高 100 美元,但由于 256GB 成为起步容量,实际到手价与上代基本持平。
- 影像方面:Pro 系列升级长焦镜头,支持最高 120 倍变焦;标准版沿用上代配置。
- 续航方面:标准版、Pro、Pro Fold 为 30W,Pro XL 为 45W。
- 最具讨论度的硬件变化是 Pro 系列背面的 LED 指示灯「Hilight」:Gemini 交互时稳定亮起,特定联系人来电时显示自定义颜色;但不支持短信、第三方通知,也未开放开发者接口。
其他硬件方面,Pixel Watch 5 售价 399 美元起,将内存从 2GB 提升至 3GB,以支撑手表端 Gemini 能力;Pixel Tag 单只 29 美元,补齐谷歌对标苹果生态的最后一块拼图。智能眼镜仅做了预告,没有展出实物。
Gemini 接管系统:从聊天走向「代办」
发布会上,Gemini 的能力展示远超硬件本身。它已从独立助手深度集成到 Pixel 的系统服务层,能够跨应用读取短信、日历等信息,并在谷歌地图中自动搜索餐厅、预订座位,甚至直接致电商家。同时,Gemini 会主动推送航班信息、餐厅推荐和日程提醒。不过,这些操作目前主要限于谷歌自家服务,关键步骤仍需用户确认。
语音功能方面,Gboard 新增 Rambler 功能,由 Gemini 驱动,可以:
- 自动清洗「嗯、啊」等语气词;
- 识别并消除用户中途改口造成的前后矛盾;
- 一键撤销刚才的输入。
多模态能力上,发布会现场演示了手语实时转文字(前置摄像头捕捉动作,大模型翻译成文字)、YouTube 与播客的实时翻译与配音。影像端,Magic Capture 可分析录制前后上百帧画面并自动选出最佳帧;Creator Suite 内置提词器,文字可跟随用户语速滚动。
值得注意的是,手语识别、实时翻译等功能高度依赖端侧 AI 算力,Tensor G6 的意义正在于此。但从功能本身看,手语识别苹果 FaceTime 已支持,实时翻译苹果、微软也已有覆盖,谷歌更多是把多模态延伸到视频和播客等具体场景,整体属于「追赶」而非「引领」。
「美国版豆包手机」:策略相同,路线不同
Pixel 11 被外界称为「美国版豆包手机」,这一比喻在策略层面成立:面对 OpenAI 等对手在模型跑分上的压力,谷歌和字节都选择将重心从「刷榜」转向「智能体」,让 AI 在更多场景中刷存在感。Gemini 深度绑定谷歌全家桶,豆包深度绑定字节系应用生态,两者都放弃了单点技术巅峰的竞争。
但技术路线存在差异。据大模型从业者介绍,AI 操作手机可分为两个层次:
- 操作层:又分两条路——GUI 模拟点按(AI 看屏幕,像人一样点击)和接口调用(AI 走 App 预留的内部通道直接发指令)。
- 协同层(A2A):手机端 Agent 与系统级 Agent 协作完成任务,属于更高层级,行业尚无成熟落地。
Pixel 11 以第一方接口调用为主,遇到未开放接口的 App 再退回 GUI 模拟点按;豆包手机一代采用纯 GUI 路线,因遭遇头部 App 风控,二代已转向 A2A。
更深层的差异在于垂直整合能力。Pixel 11 从 Tensor G6 芯片、Pixel 机身到 Gemini 模型全链路自研,谷歌可以围绕 AI 重新设计硬件(如给手表加内存以跑端侧模型);豆包手机则主要与努比亚等第三方厂商合作,硬件话语权有限,端侧优化空间受制于合作方。但反过来,豆包在 GUI 自动化落地方面是先行者,软件迭代速度和场景适配深度是其优势。
总体来看,Pixel 11 和豆包手机是同一趋势下的两种解法:目标一致,即让 AI 成为手机的「身体」;路径不同,一方靠全栈自研,一方靠生态绑定。谷歌卖的早已不只是手机,而是搭载 Gemini 的 AI 入口,硬件是一次性买卖,AI 订阅与服务才是更长线的生意。
