京东JoyAI让数字人看图下单

京东 JoyAI App 于 9 月 7 日推出实时视频购物 AI 数字人“万能博士”。用户可在视频通话中直接展示商品、询问选购建议,并通过“帮我找同款”完成京东下单;同时支持上传一张图片,自定义数字人的形象、人设、音色与互动场景。
京东JoyAI让数字人看图下单
京东 JoyAI App 今天推出了实时视频购物 AI 数字人“万能博士”,把“拍照识物—推荐商品—跳转下单”改成了视频通话里的连续对话。
用户开启视频通话后,只需把摄像头对准线下看到的商品,数字人就能实时理解画面、回答商品相关问题,并根据“帮我找同款”“这个值得买吗”等自然语言指令调取京东商品。确认后,用户可以直接在通话界面完成购买,不需要再切换到京东主 App 或其他搜索页面。
这不是又一个把图片识别结果丢给搜索框的 AI 购物助手,而是京东正在尝试把“看见商品”变成交易入口。它的价值不在于数字人长得像真人,而在于把视觉理解、语音交互、商品检索和电商履约放进同一条链路。

购物从“识别后搜索”变成视频通话内闭环
AI 视频购物是指 AI 通过实时分析摄像头画面理解商品,并在同一交互界面中完成咨询、推荐和购买的购物方式。
过去多数 AI 购物产品的路径相对固定:用户上传商品图片,系统识别品牌、品类或型号,再跳转到搜索结果页;或者用户先和聊天机器人对话,AI 推荐几个商品链接,用户点击链接后进入电商平台完成后续操作。技术上这已经解决了“找什么”的问题,但没有解决“买不买、怎么买”的连续决策问题。
JoyAI 的变化,是把摄像头变成了移动购物入口。用户在线下超市拿起一袋零食,可以直接让“万能博士”查看包装信息,询问配料、口味和价格;试戴耳机时,可以让数字人结合外观、品牌和公开口碑给出选购参考;看到一件家具或数码产品,也可以直接说“帮我找同款”或“有没有更便宜的替代品”。
从操作链路看,JoyAI 目前强调的是四个步骤:
- 实时看见:通过手机摄像头捕捉商品外观、包装、标签或使用场景。
- 即时理解:结合图像与语音输入,判断商品类别、品牌、型号和用户意图。
- 对话决策:用户可以追问价格、口碑、配料、参数、替代品等问题,也可以随时打断或切换话题。
- 直接交易:AI 根据需求调取京东商品,用户确认后在当前对话链路中下单。
这条路径更接近真人陪逛,而不是传统意义上的“搜索框升级版”。用户不需要先想好准确关键词,也不用把商品名称、型号和规格手动输入系统。对于在线下购物时经常遇到的“看到了但不知道叫什么”“想买同款但认不出型号”等场景,视觉输入确实比键盘搜索更自然。
“万能博士”真正承担的是导购角色
“万能博士”是 JoyAI 体系中的通用型 AI 数字人助手,定位不只是聊天机器人,而是连接京东商品与生活服务的语音、视觉和视频交互入口。
京东给出的典型场景包括超市选购零食、线下试戴耳机,以及面对面询问商品是否值得购买。数字人会根据画面识别结果和用户问题提供信息参考,并调用京东生态中的商品服务。
这里有一个重要区别:商品识别本身并不难,难的是把识别结果变成可执行的购买建议。例如,用户拿起一瓶饮料,AI 不仅要知道它是什么,还要理解用户可能关心的是糖分、配料、容量、价格,还是和另一款产品的差异。用户问“这个值得买吗”,也不是在要求一段商品详情页复述,而是在要求一个结合预算、用途和偏好的判断。
JoyAI 的产品方向,显然是让大模型承担更多“导购上下文”的工作。它需要在一次视频通话中记住用户前面提到的预算和用途,理解后续的省略表达,再把对话意图映射到京东的商品检索和交易系统。这比单轮图片搜索复杂得多,也更接近电商平台真正想要的 AI 能力:不是帮用户找到更多商品,而是缩短从需求产生到订单完成的距离。
不过,用户仍然需要把它当作“购买参考”,而不是绝对可靠的专业顾问。商品标签可能因为反光、遮挡或画面清晰度不足而识别错误,实时视觉模型也可能混淆相似型号;涉及食品过敏、药品、健康器械和高价数码产品时,最终决策仍应以商品详情、官方说明和专业意见为准。
一张照片,自定义一个数字人
JoyAI 的另一项更新是高自由度数字人创建功能,即用户上传一张图片后,可以自定义数字人的形象、人设、音色和交互场景。
这意味着数字人不再只是平台提供的固定头像。用户可以用一张人物照片、虚拟角色图或其他形象素材,创建拥有特定性格和表达方式的 AI 角色,再通过自然语言描述它的身份、关系和说话风格。平台支持语音、动作、图像和视频通话等多模态互动,并提供唱歌、跳舞、方言表达和动作演绎等玩法。
从产品结构看,JoyAI 想做的不是单独的“数字人生成器”,而是一套从角色创建到内容传播的闭环:
- 创建:上传图片,用自然语言配置形象、人设、音色和场景。
- 互动:通过文字、语音或视频通话与角色交流。
- 创作:让角色生成语音、图片和短视频内容。
- 传播:将数字人作为内容主体,用于社交分享、IP 孵化或个性化表达。
AI 数字人是由模型生成并驱动的可交互虚拟角色,而不是传统预录视频中的固定人物。传统数字人通常依赖脚本、动作库和固定渲染流程,能说什么、怎么说、做什么动作,往往在制作阶段就被写死。JoyAI 试图把角色的外形、声音和行为控制交给大模型,使其能够在不同对话中保持相对稳定的人设。
这项能力的想象空间比“给照片配音”更大。用户可以创建一个懂数码的朋友、一个用方言聊天的家庭角色,或者一个专门负责内容创作的虚拟 IP。对普通用户来说,门槛从学习建模、配音和视频制作,降到了上传一张图片并写几句设定;对创作者和品牌来说,数字人则可能成为持续生产内容的角色资产。
但“高自由度”也意味着更高的治理成本。照片、声音和人设都可能涉及肖像权、声音权、著作权与未成年人保护问题。平台需要明确哪些素材可以上传、哪些角色不能仿冒,尤其要防止用户未经授权复制真实人物形象或声音。JoyAI 当前公开资料重点介绍了创建和互动能力,但关于水印、身份标识、内容审核与声音授权机制,仍需要更多产品细节。
它和传统 AI 购物助手有什么区别
JoyAI 的核心竞争力不是单点识图精度,而是把实时多模态交互和京东交易基础设施结合起来。
| 对比维度 | 传统图片识别购物 | 对话式 AI 购物助手 | JoyAI 实时视频购物 | |---|---|---|---| | 输入方式 | 上传图片或输入关键词 | 文字、语音 | 摄像头画面、语音、文字 | | 典型流程 | 识别商品后进入搜索页 | 对话后点击商品链接 | 视频通话中识别、咨询、下单 | | 交互连续性 | 通常是单轮或少轮 | 支持连续对话 | 支持实时插话、追问和换话题 | | 商品理解 | 以外观和关键词匹配为主 | 以用户描述和商品信息匹配为主 | 同时结合现场画面、语音意图和商品数据 | | 交易链路 | 经常需要跳转 App | 通常需要打开电商页面 | 京东生态内完成购买 | | 主要优势 | 快速找同款 | 适合比较和筛选 | 更接近陪逛,降低表达门槛 | | 主要限制 | 无法充分理解使用场景 | 看不到用户手上的真实商品 | 识别准确性、隐私和推荐可信度仍需验证 |
从体验上看,JoyAI 更像把导购员放进了手机摄像头里。它并没有改变电商平台最核心的商品、库存、价格和配送系统,但改变了用户进入这些系统的方式:用户不必主动搜索,商品可以在被看见的瞬间进入可交易状态。
这对京东尤其重要。此前京东在 AI 入口竞争中相较于字节、阿里等平台并不占据明显优势,JoyAI App、京东 AI 购以及数字人等产品,承担着把京东商品和服务重新包装成 AI 原生入口的任务。实时视频购物则是一个更容易被用户感知的功能:它不需要用户理解“大模型”,只需要把手机对准商品并开口提问。
京东的优势在生态,短板也在生态
京东做实时视频购物最大的优势,是商品、物流、售后和生活服务已经存在于同一商业体系中。
除了购物,JoyAI App 还承载外卖、充话费、酒店预订和健康咨询等服务。理论上,用户可以从“这个耳机值得买吗”继续聊到“帮我订一个适合出差的酒店”,再延伸到“提醒我给手机充话费”。如果这些服务都能在同一对话上下文中调用,JoyAI 就不只是一个购物助手,而是在向“生活事务代理”靠近。
但生态打通并不自动等于体验优秀。AI 推荐商品时,需要处理库存变化、区域价格、促销规则、配送时效和售后政策;涉及外卖和酒旅时,还要理解地址、时间、人数和预算等约束。对话可以很自然,执行结果却必须足够准确,否则用户对 AI 的信任会在一次错误下单或错误预订后迅速下降。
实时视频交互还会带来额外的性能要求。用户期待的是接近真人聊天的响应,而不是每次拍照后等待几秒再刷新结果。公开资料目前没有披露 JoyAI 视频购物的平均响应时延、识别准确率、并发规模、支持的商品范围或具体收费方案,因此暂时无法用量化指标判断它与其他 AI 购物产品的差距。
截至 2026 年 9 月 7 日,JoyAI 这次更新更适合被理解为一次产品形态上的前置探索,而不是已经完成商业验证的成熟购物基础设施。它把多个看似分散的能力——实时视觉理解、语音对话、数字人驱动、商品检索和下单——组合成了一个完整演示,但实际长期价值还要看复购频率、推荐转化率、误识别率以及用户是否愿意持续通过数字人购物。
这次更新对开发者和深度用户意味着什么
JoyAI 的产品信号是,AI 应用的竞争正在从“能不能生成内容”转向“能不能直接完成任务”。
对于开发者来说,实时视频购物至少提供了三点值得观察的方向:
- 视觉输入会成为交易和服务入口。 用户未必愿意描述商品,但愿意直接把镜头对准商品。未来家居、汽车、服装、维修和线下零售,都可能围绕“看见即理解”重做交互。
- 数字人开始从展示层进入执行层。 过去数字人主要负责播报、客服或直播间讲解,JoyAI 则试图让数字人参与比较、推荐和下单。数字人的价值由“像不像真人”转向“能不能把事情办完”。
- 模型能力必须和业务系统深度耦合。 仅有视觉模型无法完成购物,只有聊天模型也无法处理库存和订单。真正可用的代理需要连接检索、商品、支付、履约和售后等系统,并对每一步执行结果负责。
对于深度用户,最值得测试的不是数字人的外观,而是它在复杂场景中的稳定性:能否识别遮挡和反光商品,能否区分同一品牌的不同型号,能否根据预算进行多轮比较,能否在用户改变需求后及时修正推荐,以及最终下单前是否清楚展示价格、规格和配送信息。
如果这些环节都能稳定工作,JoyAI 的实时视频购物会比普通“拍照搜同款”更有用;如果它只能识别商品并生成一段听起来合理的介绍,那么视频通话只是更华丽的包装,实际效率未必高于搜索框。
OpenAI Hub 观点:交易闭环比数字人外观更重要
JoyAI 此次更新最值得肯定的地方,是没有把重点停留在“生成一个会说话的虚拟人”,而是尝试让数字人参与真实消费决策,并在同一场视频通话中完成交易。
它的产品路线也很清楚:一端连接京东的商品和生活服务,另一端连接用户自定义的数字人角色,中间用实时多模态交互把“看、聊、选、买”串起来。对京东而言,这可能是比单纯推出一个聊天机器人更现实的 AI 入口策略,因为每一次有效对话都有机会落到具体订单或服务上。
但目前还不能把它称为 AI 购物的终局。没有公开的延迟、准确率、转化率和错误订单数据,外界无法判断“实时”到底达到了什么水平;没有更明确的隐私与数字人授权规则,自定义角色也存在治理风险;没有足够多的真实用户反馈,数字人的陪伴感是否会转化为持续使用仍是未知数。
我们的判断是:JoyAI 的方向是对的,但产品成败不取决于数字人能否唱歌跳舞,而取决于它能否在看不清、说不明、需求反复变化的真实购物场景里,给出可信建议并准确完成订单。 如果京东能够把视觉理解和电商履约进一步打磨,JoyAI 有机会成为京东 AI 入口中更具辨识度的一条产品线;否则,它仍可能只是一个功能丰富、但使用频率有限的数字人应用。
参考来源
- IT之家:京东 JoyAI App 推出首个能实时视频购物的 AI 数字人 —— 介绍“万能博士”视频购物、自定义数字人及京东生态服务等官方信息。



