商汤6.8轻量Agent押注委派智能

SenseNova 6.8 Flash Lite预览版上线,主打数百步长程执行、十余个子Agent协作与原生多模态操作。商汤想争夺的不是聊天模型跑分,而是复杂任务的完整交付权。
商汤把轻量模型推向了“交付结果”
商汤科技在 8 月 11 日上线 SenseNova 6.8 Flash Lite Preview,试图把轻量多模态模型从“快速回答问题”推进到“自主完成任务”。这款预览模型已经进入 SenseNova Token Plan,正式版 SenseNova 6.8 Flash Lite 以及性能更强的 SenseNova 6.8 Flash 也将在近期发布。
**SenseNova 6.8 Flash Lite Preview 是商汤面向长程任务推出的轻量多模态智能体模型。**按照商汤公布的信息,它具备自主规划、持续执行、多 Agent 协作和动态纠偏能力,可以围绕一个目标连续运行数百步、跨越多个任务阶段,并在持续数小时的执行过程中保留关键事实和约束。
这次更新真正值得关注的地方,不是“Flash Lite”又多了一个版本号,而是商汤给它选定的产品方向:委派智能。
**委派智能(Delegated Intelligence)是指用户只提交目标和约束,由 AI 自主规划流程、调用工具、检查结果并完成交付,人类主要负责授权与验收。**它与传统聊天机器人的区别,类似于“给同事发一份任务书”和“向搜索框输入一个问题”:后者交付的是回答,前者要承担过程与结果。

“委派”比“回答”难得多
委派智能的核心指标不是单轮回答有多漂亮,而是模型能不能在几十分钟甚至数小时后,仍然记得自己为什么开始这项工作。一个模型即使单次推理准确率很高,只要在第 80 步忘记用户限定的时间范围,或者在第 150 步引用了未经核验的数据,最终交付物仍然可能整体失效。
**长程稳定是模型在多阶段、长时间任务中持续保持目标、约束和关键事实的能力。**商汤称,SenseNova 6.8 Flash Lite Preview 可以处理数百步、跨阶段并持续数小时的任务,而且在执行失败后能够自主回退、重新规划,而不是遇到异常便停在原地等待用户接管。
这项能力直接决定 Agent 能否从演示走向生产。生成一页 PPT、总结一篇文档或者修改一段文字,普通对话模型已经能够完成;但如果任务变成“读取本地季度材料、核对公开数据、生成图表、设计整套演示文稿,再检查每页数字是否一致”,模型就需要持续维护任务状态,并识别哪些步骤失败后必须重做。
传统工作流通常依靠开发者预先画好流程图:先搜索,再提取,再计算,最后生成报告。SenseNova 6.8 Flash Lite Preview 想做的是让模型自己决定下一步走哪条路径,并在途中动态调整路线。这种差别类似固定导航与自动驾驶:前者只告诉你既定路线,后者还要应对封路、误判和临时目标变化。
不过,商汤目前没有公布长程任务成功率、平均工具调用次数、上下文容量、执行延迟或失败恢复率。所谓“数百步”和“持续数小时”证明了任务长度,却不能单独证明最终质量;对 Agent 来说,运行得久并不等于做得对。
一个主 Agent,临时组织十余个专业 Agent
**Sub-agent 动态协作是由主 Agent 根据任务需要创建、调度和整合多个专业子 Agent 的执行机制。**商汤表示,SenseNova 6.8 Flash Lite Preview 的主 Agent 可以动态组织十余个专业 Agent,并行处理信息检索、数据分析、数学计算、视觉理解和事实核验。
这种设计的价值在于减少单个模型频繁切换角色造成的认知混乱。以一份行业研究报告为例,检索 Agent 可以寻找资料,数据 Agent 负责表格清洗与计算,视觉 Agent 读取图片和图表,核验 Agent 复查来源,主 Agent 则维护大纲、分配任务并汇总结果。
并行协作也可能显著缩短复杂任务的墙钟时间。假设十份资料彼此独立,串行处理需要依次完成十轮读取和核验,而多个子 Agent 可以同时开工;但真实效率仍取决于调度开销、模型延迟、工具并发限制以及主 Agent 的合并能力,不能简单理解为“十个 Agent 就快十倍”。
多 Agent 系统最难的部分也不是把任务拆出去,而是把答案收回来。不同子 Agent 可能使用不同口径、重复检索同一资料,甚至得出互相冲突的结论;主 Agent 必须识别冲突、追溯证据,并决定重新计算还是重新搜索。如果缺少严格的事实核验与状态管理,多 Agent 只会把一次幻觉扩大成十次并行幻觉。
从产品定位看,商汤没有把 Flash Lite 做成一个只追求低延迟的“小模型”,而是尝试用轻量主干配合多 Agent 调度来换取复杂任务能力。这个方向比单纯压缩参数更有现实意义,因为企业真正关心的是完成一项任务需要多少总成本,而不只是某一次模型调用有多便宜。
多模态不再只是“能看图”
**原生多模态融合是指文字、图片、图表、文档、视频和应用界面能够进入同一条任务轨迹,由模型统一规划、推理、操作和验证。**SenseNova 6.8 Flash Lite Preview 不只接收多种输入,还强调让这些输入共同参与后续工具调用与结果检查。
这一点决定了它能否处理真实办公环境。现实任务很少是一段干净的纯文本:财务数字可能藏在表格里,产品状态显示在网页界面中,会议重点存在视频里,最终结果又要写进演示文稿。如果模型每次遇到新格式都需要人工复制和转换,所谓自动化就只完成了一半。
商汤给出的典型场景是动态 PPT 制作。模型可以连续完成内容撰写、图表制作和版式设计,并生成原生 HTML 动态演示,而不是只输出传统静态页面。HTML 方案允许加入动画、交互组件和实时数据展示,也更方便在浏览器中运行,但它同时会带来字体兼容、屏幕适配、离线展示和导出稳定性等新问题。
另一个重点场景是浏览器与应用操作。模型能够理解网页中的文字、图片和界面状态,也可以读取本地文件,随后操作浏览器或应用完成办公任务、编写脚本并自动运行。这意味着 SenseNova 6.8 Flash Lite Preview 的目标不是成为一个更聪明的侧边栏,而是成为可以跨应用执行工作的操作层。
三款6.8模型的定位仍有信息差
商汤已经给出了 SenseNova 6.8 系列的发布节奏,但尚未披露正式版的完整参数和价格。当前可以确认的是,Flash Lite Preview 已开放体验,Flash Lite 正式版和性能进一步提升的 Flash 模型将在近期发布。
| 模型 | 当前状态(截至2026年8月11日) | 官方定位 | 已公布的核心能力 | 尚未公布的关键信息 | |---|---|---|---|---| | SenseNova 6.8 Flash Lite Preview | 已上线预览 | 轻量、敏捷的多模态智能体 | 数百步长程执行、数小时任务保持、十余个子Agent协作、原生多模态融合、失败回退与重新规划 | 上下文容量、基准成绩、调用价格、工具成功率、延迟 | | SenseNova 6.8 Flash Lite | 近期发布 | Flash Lite正式版 | 官方尚未披露相对预览版的具体变化 | 发布时间、性能增幅、价格、限额 | | SenseNova 6.8 Flash | 近期发布 | 性能进一步提升的Flash版本 | 官方确认性能将高于Flash Lite,但未公布量化结果 | 模型规模、基准成绩、延迟、价格、可用范围 |
现阶段不适合仅凭“Flash Lite”名称推断它一定更便宜或更快。商汤尚未公布三款模型的单价、吞吐量与首 Token 延迟,也没有说明 Flash Lite 与 Flash 在推理深度、多模态输入和 Agent 并发能力上的具体差距。
它和传统聊天模型到底差在哪
SenseNova 6.8 Flash Lite Preview 的竞争对象不是某个单一聊天模型,而是“模型加工作流加工具”的整套 Agent 系统。商汤希望把原本需要开发者自行拼装的规划、分工、执行、回退和核验能力,尽量收进一个统一模型与运行环境中。
| 能力维度 | 传统聊天模型 | 固定工作流Agent | SenseNova 6.8 Flash Lite Preview的目标形态 | |---|---|---|---| | 用户输入 | 问题或指令 | 预设表单与参数 | 高层目标、约束和交付要求 | | 执行方式 | 单轮或多轮回答 | 按预设节点运行 | 自主规划并动态修改路径 | | 任务长度 | 通常偏短 | 可长,但流程固定 | 数百步、跨阶段、持续数小时 | | 协作方式 | 单模型处理 | 开发者预先配置角色 | 主Agent动态调度十余个子Agent | | 多模态能力 | 识别图片或文档 | 依赖独立解析组件 | 在同一任务轨迹中统一处理文本、图像、视频和界面 | | 失败处理 | 提示用户重试 | 依赖预设异常分支 | 自主回退并重新规划 | | 最终交付 | 答案、文本或文件 | 预设格式结果 | 强调端到端完整结果 |
这种集成路线的优势是部署和使用门槛更低。用户不必先理解每个 Agent 的职责,也不必亲自把搜索、计算、浏览器操作和文档生成串成工作流,只需要描述目标。
这种集成路线的风险则是可控性可能下降。固定工作流虽然不够灵活,但每一步都容易审计;自主 Agent 可以临时改变路径,却可能访问不该访问的文件、误操作网页,或者在没有充分证据时提交结果。越接近“委派”,权限边界和操作日志就越重要。
真正的考题是可靠性,而不是演示效果
SenseNova 6.8 Flash Lite Preview 已经展示出一个清晰方向:轻量模型不再只负责低成本问答,也可以成为复杂 Agent 系统的任务调度核心。相比继续堆叠聊天功能,这条路线更接近企业对自动化生产力的真实需求。
但预览版距离可放心委派仍有几道硬门槛。首先是可恢复性,模型不仅要知道失败了,还要准确找到失败发生在哪一步;其次是可验证性,最终报告中的每个数字和结论都应能追溯到来源;再次是权限控制,浏览器、本地文件和脚本执行必须提供分级授权、敏感操作确认与完整日志。
成本也是多 Agent 产品绕不开的问题。一次复杂任务可能包含数百步推理、十余个子 Agent、反复检索和多次失败重试,即使单次调用足够轻量,总成本也可能快速累积。商汤需要在正式版中说明任务级成本,而不只是模型级价格,因为用户最终购买的是一份报告、一套 PPT 或一次办公流程,而不是若干 Token。
评估这类模型也不能只看传统知识和推理跑分。更有参考价值的指标应包括端到端任务完成率、工具调用成功率、事实引用准确率、失败恢复率、人工接管次数、平均完成时间和单任务成本。商汤目前没有给出这些量化数据,因此“突破性增强”仍主要是官方产品表述,实际表现需要更多公开测试验证。
商汤押注的是Agent入口,而不只是模型版本
SenseNova 6.8 Flash Lite Preview 最值得肯定的地方,是它把“自主回退”“动态分工”和“结果验证”放到了与生成能力同等重要的位置。Agent 产品过去最常见的问题,是第一分钟看起来惊艳,第十分钟开始偏航;商汤至少把问题瞄准了正确方向。
SenseNova 6.8 Flash Lite Preview 目前仍是一款需要观察的预览模型。没有公开基准、价格、上下文容量和任务成功率,就无法判断它在真实环境中究竟比传统工作流节省多少时间,也无法确认十余个子 Agent 是否能稳定协作。
商汤下一步真正需要交付的不是更多演示视频,而是一组可复现的长程任务结果。只要正式版能够证明数百步执行并非“跑得久”,而是“持续做对”,SenseNova 6.8 系列就有机会在国内多模态 Agent 竞争中建立差异化;如果可靠性和成本控制跟不上,委派智能仍然只会停留在需要人类全程盯着的半自动化阶段。
截至 2026 年 8 月 11 日,SenseNova 6.8 Flash Lite Preview 已经开放体验,官方 GitHub 仓库也已上线。对于开发者而言,现在最值得测试的不是让它生成一张漂亮幻灯片,而是给它一个包含多份文档、网页操作、数据核验和格式交付的完整任务,观察它在第 100 步之后是否仍然记得最初目标。
参考来源
- IT之家:商汤日日新 SenseNova 6.8 Flash Lite 预览版上线——发布信息、模型定位及主要能力介绍。
- OpenSenseNova:SenseNova 6.8 官方 GitHub 仓库——商汤公开的 SenseNova 6.8 项目资料与后续更新入口。



