AI 快讯影石GO Ultra装上双模型助手
产品更新

影石GO Ultra装上双模型助手

2026-08-07T12:04:27.462Z
影石GO Ultra装上双模型助手

影石为GO Ultra上线AI语音助手Kira,中国大陆接入千问,港澳台及海外使用Gemini。它让拇指相机从拍摄设备变成可看、可听、可翻译的随身AI终端。

影石把AI助手塞进了53克的拇指相机

**影石 Insta360 在 2026 年 8 月 7 日为 GO Ultra 上线 AI 语音助手 Kira,并采用中国大陆接入阿里千问、港澳台及海外接入 Google Gemini 的分区方案。**这次更新加入面对面互译、拍图问答和语音问答三项核心能力,用户可以说出“Hey Kira”,或在关机状态下长按拍摄键唤醒助手,翻译及问答结果则能通过机身扬声器直接播报。

**Kira 是影石面向相机设备开发的 AI 语音助手,负责连接语音输入、镜头画面、相机控制与云端大模型。**它不是简单地把聊天机器人搬到相机里,而是让摄像头成为大模型的视觉输入,让扬声器成为输出界面,再把原本分散在手机 App 里的翻译、识图和信息查询压缩成一次语音交互。

影石 Insta360 GO Ultra 拇指相机与 AI 语音助手 Kira 功能界面

**这项更新的实际意义在于,GO Ultra 第一次有机会摆脱“先拍摄、再导入手机处理”的传统工作流。**用户在国外餐厅看到菜单时,可以直接让相机识别菜品;遇到路牌或建筑时,可以拍图后询问其含义;与当地人交流时,相机还能充当双向翻译设备。相比掏出手机、解锁、打开应用、选择功能,再对准目标,语音唤醒相机的操作路径明显更短。

IT之家 8 月 7 日报道,这套能力以影石自研系统为核心,在中国大陆融合阿里千问的多模态能力以及千问 App 的拍照问答能力;中国港澳台及海外市场则使用 Google Gemini。截至目前,影石没有公布具体接入的是哪一个千问或 Gemini 模型版本,也没有披露上下文长度、平均响应延迟和支持语言数量。

千问与Gemini分区,不只是模型选择

**分区部署是指同一款硬件根据用户所在市场连接不同的大模型及云端服务。**GO Ultra 在中国大陆使用千问,在港澳台及海外使用 Gemini,本质上是影石在模型能力、网络可用性、数据合规和服务覆盖之间做出的产品化取舍。

| 使用区域 | 云端模型体系 | 主要输入 | 主要输出 | 已确认用途 | |---|---|---|---|---| | 中国大陆 | 阿里千问 | 语音、经授权采集的镜头画面 | 机身扬声器语音播报 | 翻译、拍图问答、通用问答、模式切换 | | 中国港澳台及海外 | Google Gemini | 语音、经授权采集的镜头画面 | 机身扬声器语音播报 | 翻译、拍图问答、通用问答、模式切换 |

**这种区域化路线比强行全球统一模型更务实。**千问在中国大陆拥有更稳定的服务环境和中文生态,Gemini 则依托 Google 的全球产品与多语言能力覆盖海外市场;影石不用自己训练一个从中文问答到多语种翻译都能兼顾的基础模型,也避免把硬件体验绑定在单一地区可用性不足的服务上。

**分区方案同时带来了体验不一致的问题。**千问和 Gemini 对同一张菜单、同一句口语或同一个模糊问题可能给出不同答案,支持语言、内容安全规则、响应速度也不会完全相同。对于跨地区旅行或购买不同地区版本设备的用户,模型如何切换、是否跟随账号或地理位置变化,目前公开信息还没有交代清楚。

**影石也尚未说明区域模型是否可以由用户手动选择。**如果模型只能依据销售地区或服务所在地自动分配,那么 GO Ultra 实际上将形成两套云端体验;如果允许切换,则还要处理账号体系、数据跨境和服务条款差异。这些细节会直接影响经常跨国出行的核心用户,而他们恰恰是实时翻译功能最重要的目标群体。

端侧先判断,云端再干重活

**GO Ultra 采用的是端云协同架构,即低延迟、强隐私的基础判断在设备端完成,计算量更大的生成式任务交给云端模型。**现有信息显示,声纹识别和意图判断由端侧承担,问答、翻译、模式切换等复杂任务则由云端处理。

| 处理环节 | 执行位置 | 主要任务 | 这样设计的原因 | |---|---|---|---| | 唤醒与声纹相关处理 | 相机端侧 | 识别唤醒词、判断是否触发助手 | 降低等待时间,减少无效音频上传 | | 意图判断 | 相机端侧为主 | 区分翻译、拍图问答、普通问答等需求 | 快速选择后续工作流 | | 视觉理解 | 云端 | 分析路牌、建筑、菜单和其他画面内容 | 多模态模型计算量较大 | | 翻译与问答 | 云端 | 生成译文或信息答案 | 依赖大模型语言能力和外部信息服务 | | 结果输出 | 相机端侧 | 通过扬声器播报答案 | 用户无需查看手机屏幕 |

**端云协同并不等于离线 AI。**只要进入拍图问答、实时翻译或通用问答环节,设备大概率仍需联网访问云端服务;在地下空间、国际漫游不稳定或信号拥堵的景区,实际体验将取决于网络质量。影石目前没有公布离线翻译、离线识图或本地小模型兜底能力,因此用户不应把 Kira 理解为完全脱网可用的助手。

模式切换被放入云端任务也值得观察。“开始录像”“切到 4K 60fps”这类固定指令理论上可以由本地规则快速执行,而“帮我选择适合夜景骑行的拍摄模式”则需要理解场景和参数。影石如果把自然语言理解与本地控制拆开处理,Kira 才能同时兼顾响应速度与复杂意图;如果每次简单控制都要等待云端返回,语音操作反而可能不如按键直接。

**GO Ultra 内置的 5nm AI 芯片为端侧处理提供了硬件基础,但它并不意味着设备能在本地运行完整的千问或 Gemini。**这颗芯片原本就服务于影像增强和相关计算任务,如今增加唤醒、声纹及意图识别后,影石还需要在功耗、温度和持续录像稳定性之间重新分配算力。Kira 对续航的实际影响,目前同样没有官方数字。

三项功能里,拍图问答最符合相机逻辑

**面对面互译是 Kira 最容易被普通用户感知的功能。**用户可以让 GO Ultra 在两种语言之间进行双向实时翻译,并直接用扬声器播报结果,适合问路、点餐、购物和酒店沟通。相机体积小、可佩戴的优势,让它比手机更接近一台随手可用的翻译器。

**面对面互译的成败主要取决于端到端延迟,而不是模型跑分。**真实交流中,从用户说完一句话到译文播出的等待若明显超过数秒,对话节奏就会被打断;街道风噪、餐厅背景音以及说话人距离也会影响收音。影石暂未公布翻译平均延迟、语种数量、方言支持情况和嘈杂环境识别率,因此这项能力仍需实际场景验证。

**拍图问答是最能体现“相机原生 AI”价值的一项功能。**多模态模型是能够同时理解文本、图像、声音等不同数据类型的模型,Kira 在获得用户授权后,可以采集 GO Ultra 的镜头画面,识别路牌、建筑、菜单或商品,再通过语音给出解释。相比手机助手,相机无需额外调用另一台设备的摄像头;相比普通运动相机的语音控制,它又多了一层对现实环境的理解。

**语音问答则是最通用、也最缺乏差异化的一项功能。**用户不调用摄像头也能询问天气、路线等信息,但类似能力早已存在于手机、耳机、智能手表和智能音箱中。Kira 的优势不是答案一定比手机更好,而是在双手被占用、手机不便取出或相机已经佩戴在身上时,少一次设备切换。

| 能力 | 是否调用镜头 | 典型场景 | 相比手机的优势 | 当前不确定性 | |---|---:|---|---|---| | 面对面互译 | 否 | 问路、点餐、购物 | 可直接外放,操作链路短 | 语种、延迟、噪声环境表现未公布 | | 拍图问答 | 是,需用户授权 | 识别路牌、建筑、菜单 | 相机即视觉入口,无需重新取景 | 上传范围、保存策略未详细披露 | | 语音问答 | 否 | 天气、路线、常识查询 | 佩戴状态下更方便 | 与手机助手功能重叠明显 |

它和传统相机语音控制不是一回事

**传统相机语音控制只能匹配预设命令,而生成式 AI 助手可以理解更自然、更模糊的表达。**过去用户通常要准确说出“开始录像”或“拍照”,系统只是把语句映射到固定按钮;Kira 理论上可以理解“帮我看看这道菜是什么”“把对方刚才的话翻译成中文”或“现在去车站怎么走”这类开放式请求。

**Kira 与影石已有的 AI 高光助手也属于不同环节。**AI 高光助手主要面向录像后的内容识别与精彩片段处理,而 Kira 介入的是拍摄当下的人机交互:前者解决“拍完后哪些内容值得保留”,后者解决“现在看到的是什么,以及接下来该怎么操作”。两者如果进一步打通,才可能形成从拍摄建议、实时理解到后期剪辑的完整 AI 工作流。

**GO Ultra 的形态比智能眼镜更像可拆卸的视觉传感器。**它重 53 克,采用小方块机身,可以在不同位置安装或手持使用;智能眼镜的优势是始终保持第一视角,并能通过耳边扬声器自然反馈。影石获得的是运动相机级画质和灵活机位,失去的则是眼镜那种持续佩戴、无需重新对准目标的交互连贯性。

| 产品形态 | 视觉输入 | 主要优势 | 主要限制 | |---|---|---|---| | GO Ultra + Kira | 可拆卸相机镜头 | 画质、机位灵活、可兼顾运动拍摄 | 需要联网,扬声器外放存在隐私问题 | | AI 智能眼镜 | 第一视角摄像头 | 交互自然,适合持续佩戴 | 续航、外观和拍摄提示更敏感 | | 手机 AI 助手 | 手机摄像头 | 屏幕大、生态完整、输入方式丰富 | 需要取出手机并重新取景 | | 传统运动相机语音控制 | 相机麦克风 | 指令确定、响应路径简单 | 只能处理有限的预设命令 |

刘靖康说“重新定义”,但现在还不能下结论

**影石创始人刘靖康将这次更新称为“重新定义拇指相机”,并认为它可能成为市场上除 Meta 外存量和出货量最大的个人 AI 助手。**这个判断展示了影石的野心,却暂时缺少可核验的激活量、月活用户、语音调用次数和功能留存率数据,而且“个人 AI 助手”的统计口径也并不清晰。

**硬件出货量不能直接等同于 AI 助手使用量。**GO Ultra 的存量用户可以通过更新获得新能力,这是影石相较于从零销售 AI 硬件的优势;但用户购买它的首要原因仍是运动拍摄和便携记录,Kira 能否从一次性尝鲜变成高频入口,要看唤醒成功率、响应速度、准确度和续航成本。

**GO Ultra 本身具备承载这次更新的硬件条件。**这款口袋相机于 2025 年 8 月发布,标准套装价格为 2598 元,机身重量 53 克,搭载 1/1.28 英寸传感器、5nm AI 芯片和环境光传感器,最高支持 4K 60fps 视频拍摄。对于已经拥有设备的用户,软件更新提高了旧硬件的功能上限;对于新用户,AI 助手则尚不足以单独解释 2598 元的购买决策。

隐私与提示机制将决定它能走多远

**拍图问答天然涉及环境画面上传,因此用户授权必须比普通语音助手更明确。**影石已经强调该功能会在获得用户授权后采集镜头画面,但仍需进一步说明单次上传的是静态帧还是短视频、数据会保存多久、是否用于模型改进,以及用户能否查看和删除相关记录。

**扬声器直接播报提升了便利性,也可能暴露用户的查询内容。**在餐厅、机场和商店等公共场所,翻译结果外放符合面对面交流需求;但天气、路线甚至涉及个人行程的答案如果自动播报,就可能带来尴尬或隐私风险。音量控制、耳机输出以及播报前确认,会成为实际体验中的重要细节。

**相机类 AI 助手还需要处理旁观者对拍摄状态的感知。**当用户只是进行语音问答、进行拍图识别或正在录像时,设备应当提供足够清晰的状态提示,避免周围人无法判断镜头是否正在记录。这个问题在可穿戴设备上比手机更敏感,也是 Meta 等视觉 AI 硬件长期面对的社会接受度难题。

影石真正想做的是下一代相机入口

**Kira 的战略价值高于它目前三项功能的数量。**相机过去负责记录现实,手机和电脑负责理解内容;现在影石尝试把“看见—理解—回答—控制”放在同一台 53 克设备里,相机因此从被动采集工具变成主动交互入口。

**千问与 Gemini 的分区接入也展示了一种更现实的 AI 硬件路线。**硬件厂商不必自己训练所有基础模型,而是掌握设备、传感器、端侧算法和交互层,再按区域选择云端模型。模型可能变化,入口和用户关系则留在影石手里,这比单纯在包装上增加一个 AI 标签更有长期价值。

**这次更新目前仍更像一个方向正确的第一版,而不是已经成熟的杀手级体验。**它的功能组合与旅行、户外和随身记录高度契合,拍图问答尤其符合相机定位;但模型版本、响应延迟、离线能力、语言覆盖、功耗变化与隐私规则都还缺少量化信息。影石能否真正“重新定义拇指相机”,最终不会由发布会口号决定,而要看用户是否愿意在拍摄之外持续说出那句“Hey Kira”。

参考来源

相关推荐

查看全部