千问把AI眼镜能力交给开发者

千问开放平台已打通App、PC和AI眼镜三端,开发者可调用拍照、语音等能力创建导游、教练和菜谱Skill,企业还能定制工业与零售巡检助手。
千问把AI眼镜从产品变成平台
千问正在把AI眼镜的开发权交给第三方开发者。
8月10日,阿里千问开放平台正式上线,同时覆盖App、PC和AI眼镜3类终端。根据千问官方近日披露、IT之家报道的信息,截至今天(8月15日),眼镜端已经形成技能平台和行业定制两大模块:前者允许开发者调用拍照、语音交互等硬件能力创建Skill,后者面向工业、零售等企业场景提供更深层的流程适配。
AI眼镜生态是由眼镜硬件、环境感知能力、多模态模型、任务工具和第三方应用共同组成的开发体系。 它与在眼镜里预装一个聊天机器人不是一回事:聊天机器人只负责回答问题,生态则要让开发者把摄像头、麦克风、显示和企业数据组织成完整任务。
千问这次更新的关键不在于又增加了几个演示功能,而在于它开始把AI眼镜拆成可被开发者调用的能力组件。只有外部开发者能够围绕不同职业、地点和人群持续创建应用,AI眼镜才可能摆脱翻译、拍照、问答这套高度同质化的功能组合。

Skill不是一句提示词,而是一条任务链
Skill是围绕特定场景封装感知、推理、工具调用和反馈动作的可复用AI能力。 在AI眼镜上,一个真正可用的Skill通常要完成四个环节:先获取用户视野或语音,再理解当前环境,然后调用知识与业务工具,最后通过语音或显示把结果反馈给用户。
千问目前披露的能力入口主要包括眼镜拍照和语音交互。开发者可以用自然语言描述需求,将这些能力组合成面向特定人群的随身助手,例如视障辅助、景点导览、菜谱指导和运动陪练。
千问给出的“身边有什么”Skill是最典型的视觉辅助案例。眼镜拍摄佩戴者前方画面后,系统识别门槛、台阶和障碍物,再通过语音提供环境提示。与手机拍照识别相比,眼镜的优势是第一视角和免手持;用户不需要掏出手机、对准目标再查看屏幕,整个过程可以在行走中完成。
景点导览Skill则把“看到什么就问什么”变成持续服务。用户将目光转向一座建筑,眼镜获取当前画面并判断目标,再介绍建筑资料和背后的故事。这类体验比传统语音导览器更灵活,因为讲解对象由用户的视线决定,而不是由固定路线和预先编号决定。
菜谱专家Skill更考验系统对过程状态的理解。它不能只把完整菜谱读一遍,而要判断用户正处于备菜、焯水、翻炒还是出锅阶段,并在合适时间给出下一步提醒。对AI眼镜而言,这种连续任务比单张图片问答更有价值,也更难做好。
| Skill场景 | 主要输入 | 系统需要完成的任务 | 反馈方式 | 核心价值 | |---|---|---|---|---| | 视障辅助 | 第一视角照片、语音 | 识别台阶、门槛与障碍物 | 实时语音提示 | 减少手持操作,提供环境信息 | | 景点导览 | 建筑画面、用户提问 | 目标识别、资料检索与讲解 | 语音,未来可结合显示 | 视线指向哪里,讲解跟到哪里 | | 菜谱专家 | 食材、厨具与烹饪状态 | 判断当前步骤并给出下一步 | 分阶段语音指导 | 双手被占用时仍可交互 | | 运动教练 | 语音、未来的运动状态数据 | 识别训练阶段并提供建议 | 语音或视觉提醒 | 形成随身陪练体验 | | 巡检助手 | 设备或货架画面、检查清单 | 核对项目、识别异常并记录 | 语音、显示或业务系统记录 | 将企业流程带入第一视角作业 |
自然语言创建降低门槛,但不等于完全零代码
自然语言创建Skill的意义是缩短能力编排过程,而不是自动消除工程工作。开发者可以描述需要调用的拍照、语音等能力以及任务目标,由平台协助生成或配置Skill;但涉及业务数据、身份认证、错误处理和设备适配时,仍然需要传统开发与测试。
这一区别很重要。一个面向游客的建筑介绍可以容忍偶尔答非所问,但一个辅助视障用户避障的工具不能把模型猜测包装成确定事实;一个家用菜谱助手说错调料用量可能只是影响口味,工业巡检漏掉设备异常则可能带来安全与生产风险。
千问现阶段更像是在提供AI眼镜的能力编排层。它让开发者不必从摄像头采集、语音交互和模型连接开始重复造轮子,但平台是否足够成熟,最终仍要看Skill的调试、分发、权限、日志、评测和版本管理体系,而不只是能否通过一句自然语言生成原型。
行业定制比消费级Skill更接近真实收入
行业定制是按照企业自身检查标准、作业流程和数据系统构建专用AI助手的服务模式。 与面向普通用户的通用Skill相比,它需要接入企业规则、设备信息、商品目录和检查清单,部署难度更高,但付费意愿通常也更明确。
千问目前重点提到工业和零售巡检两个方向。在工业场景中,巡检助手可以识别设备状态、逐项核对检查要求并提示异常;在零售场景中,它可以查看货架陈列、商品摆放和检查项目,帮助工作人员完成标准化巡店。
AI眼镜尤其适合双手不能长期操作手机的岗位。工厂维修人员可能同时拿着工具,零售员工需要整理商品,仓储人员需要搬运和扫描货物,厨师则要持续处理食材。第一视角设备可以把提醒直接放到作业现场,这是手机和PC难以替代的位置。
| 对比维度 | 开发者技能平台 | 企业行业定制 | |---|---|---| | 目标用户 | 消费者、垂直兴趣人群 | 工业、零售等组织客户 | | 创建方式 | 调用开放能力并组合Skill | 结合企业标准与作业流程深度适配 | | 典型场景 | 导游、教练、菜谱、辅助识别 | 设备巡检、货架检查、异常提示 | | 数据来源 | 通用知识与用户当前环境 | 企业清单、设备资料和内部规则 | | 交付重点 | 体验、分发与使用频率 | 准确率、合规、审计与系统集成 | | 主要风险 | 幻觉、延迟、用户留存 | 漏检、误报、权限和数据安全 |
行业定制也是千问这次开放中更值得关注的部分。消费级AI眼镜仍需要证明用户为什么每天佩戴,以及为什么愿意为第三方Skill付费;企业巡检则已经存在明确流程、人工成本和检查标准,更容易计算部署价值。
眼镜与手机的差别,不只是屏幕位置不同
AI眼镜真正的产品优势是它与人的视线天然一致。手机AI需要用户主动取出设备、打开应用并提供上下文,眼镜则可以在获得授权后直接从第一视角理解现场,交互成本明显更低。
AI眼镜真正的工程难点也是它与人的视线天然一致。摄像头可能拍到路人、工位、票据和商业机密,麦克风可能收录周围对话,系统还要判断什么时候应当采集、保存或上传数据。因此,权限提示、录制指示、数据保留周期和本地处理比例会直接影响产品能否进入企业和公共空间。
| 使用形态 | 上下文获取 | 交互方式 | 适合任务 | 主要限制 | |---|---|---|---|---| | PC助手 | 文档、网页、键鼠输入 | 键盘与屏幕 | 长文本、复杂编辑、办公任务 | 无法持续理解线下环境 | | 手机助手 | 拍照、语音、屏幕内容 | 触控与语音 | 临时识别、搜索、拍摄 | 需要手持和主动打开应用 | | AI眼镜助手 | 第一视角画面、语音、未来的状态感知 | 语音与近眼显示 | 导览、陪练、巡检、现场指导 | 续航、延迟、隐私与佩戴舒适度 |
千问同时覆盖App、PC和AI眼镜3端,也为任务跨设备流转留下了空间。眼镜适合采集现场信息和即时提醒,手机适合确认与补充操作,PC适合配置复杂流程和查看记录。如果三端只是分别提供聊天入口,价值有限;如果同一个任务能够在三端延续,平台才会形成真正的设备协同。
空间3D与健康感知仍是预告能力
空间3D立体显示是利用近眼显示与空间定位,在用户视野中呈现具有位置和深度关系的信息。 千问表示平台正在陆续开放这项能力,未来可用于更沉浸的3D景点导览,让建筑标签、路线或说明与真实空间对应。
运动健康状态感知是通过设备传感器和相关数据判断用户活动与身体状态的能力。 千问将其列为后续开放方向,开发者可据此创建个性化陪练和提醒,例如根据运动阶段调整指导内容,而不是按照固定时间播放口令。
这些能力目前更适合视为路线图,而不是已经完整交付的开发接口。公开信息尚未给出支持的具体眼镜型号、传感器列表、空间定位精度、端到端延迟、续航影响、Skill审核机制以及商业化规则,也没有公布工业巡检的准确率、误报率或实际节省工时数据。

开放生态能不能成立,要看四个硬指标
千问开放AI眼镜生态已经迈出平台化的一步,但“允许创建Skill”和“形成繁荣生态”之间还有很长距离。开发者最终会用四个指标投票。
- 可覆盖设备数量决定Skill的潜在用户规模。 如果能力只适配少量硬件,开发者很难收回设计、测试和维护成本。
- 端到端延迟决定现场助手是否可用。 导览可以等待片刻,避障、运动指导和工业异常提醒则要求更快、更稳定的反馈。
- 视觉识别可靠性决定高风险场景的边界。 平台需要区分生活建议与安全判断,并为不确定结果设计降级提示和人工确认。
- 分发与商业机制决定开发者是否持续投入。 Skill需要被发现、安装、评价和更新,企业定制还需要权限控制、日志审计与服务保障。
千问当前没有公布上述指标的具体数字,因此还不能仅凭几个场景案例判断生态成熟度。尤其是视障辅助和工业巡检,演示中“识别到障碍物”并不等于真实环境中可以替代专业辅助设备,企业也不能在缺少评测数据时把模型输出直接当作最终检查结论。
这次开放的意义,是争夺AI眼镜的应用层
千问正在争夺的不是某一个眼镜功能,而是AI眼镜时代的应用入口。硬件厂商可以提供摄像头、麦克风和显示模组,大模型厂商则希望掌握环境理解、任务编排、Skill分发与行业知识连接层。
这套路径与智能手机早期开放应用能力有相似之处,但AI眼镜不会简单复制App Store。传统App的交互边界比较清楚,用户知道自己打开了什么;AI眼镜Skill可能在连续环境中工作,需要处理视线、语音、位置和状态,权限设计与责任边界都更复杂。
千问这次开放值得肯定的地方,是没有只停留在通用问答和实时翻译,而是把导游、教练、菜谱与巡检明确成可由开发者构建的垂直任务。它把AI眼镜从“展示模型能力的硬件”向“承载第三方服务的终端”推进了一步。
千问这次开放仍然需要补齐的地方,是开发细节和量化结果。平台尚未公开完整的设备兼容范围、价格、延迟、续航影响、审核规则和商业化方案;未来能力也仍处于陆续开放阶段。对开发者而言,现在适合验证第一视角交互是否真的解决问题,但还不到依据宣传案例进行大规模投入的时候。
参考来源
- IT之家:阿里千问开放AI眼镜生态,支持自建导游、教练、巡检等多种Skill——整理了千问开放平台的上线时间、眼镜端两大模块、典型Skill案例及后续能力规划。



