阿斯特拉 AI

谷歌 DeepMind 开发的实时多模态 AI 助手项目

阿斯特拉 AI

概述

阿斯特拉 AI(Project Astra)是谷歌 DeepMind 正在开发的多模态 AI 助手。它通过摄像头和实时语音理解周围环境,并持续进行自然对话。该产品于 2024 年谷歌 I/O 大会上首次公开,被视为下一代 AI 代理而备受关注。

主要内容

背景与开发

阿斯特拉 AI 于 2024 年 5 月在谷歌年度开发者大会 I/O 上发布。它旨在突破传统 AI 助手的局限,能够实时处理真实世界的视觉信息,并在保持上下文的情况下进行对话。该项目基于谷歌 DeepMind 最新的 Gemini 模型。

主要功能

  • 实时视觉理解:通过分析智能手机摄像头或智能眼镜的视野,识别物体、地点和情境。
  • 自然语音对话:对语音指令和问题做出快速灵活的响应,即使对话中途切换话题也能记住上下文。
  • 协作式代理:与多项谷歌服务(搜索、地图、Lens 等)联动,执行复杂任务。
  • 时间推理:可存储过去的对话内容,并在之后重新调用使用;对于“我的钥匙放哪儿了?”这类问题,可以搜索摄像头记录来回答。

工作方式

阿斯特拉 AI 会连续处理摄像头输入的图像帧,并将用户语音转换为文本加以理解。此外,它还会同时分析空间感知和语音语调,以提供更具沉浸感的交互。例如,当用户说“猜猜这个酒杯是什么材质”,它能在当场推断出材质并作答。

与传统助手的区别

传统语音助手(如 Google Assistant)更接近于执行简单指令,而阿斯特拉 AI 则进化为具备视觉与语音相结合的情境感知能力的代理。同时,它还着眼于通过“智能眼镜”(Glass)等可穿戴设备使用记忆上下文进行连续对话的场景。

最新动态

2024 年 12 月,谷歌启动了阿斯特拉 AI 的抢先体验计划,向部分开发者和用户提供测试版本。预计 2025 年将正式整合到 Gemini 应用和 Android 生态系统中,并且已经展示了与某些 AI 镜头相结合的“Astra Speak”功能。与此同时,OpenAI 的 GPT-4o、Meta 的 Ray-Ban 智能眼镜等竞争技术也纷纷推出类似的多模态助手,市场竞争日趋激烈。

相关主题

  • [[谷歌 DeepMind]]
  • [[Gemini(语言模型)]]
  • [[多模态 AI]]
  • [[GPT-4o]]