StepEdge-Omni 30B 登陆手机

高通宣布与阶跃、无量火及江波龙合作,将 300 亿参数的 StepEdge-Omni 30B-MoE 适配到第六代骁龙 8 超级至尊版移动平台,手机端可本地完成邮件理解、行程规划和邮件草拟等智能体任务。
StepEdge-Omni 30B 登陆手机,端侧大模型开始处理邮件与智能体任务
高通在当地时间 9 月 22 日举行的骁龙峰会上宣布,已携手阶跃、无量火及江波龙,将阶跃的 StepEdge-Omni 30B-MoE 适配到第六代骁龙 8 超级至尊版移动平台,并现场演示了可在手机本地运行的智能体助手。
这不是又一个只能总结通知、改写短信的轻量模型。StepEdge-Omni 30B-MoE 的目标,是让手机直接理解邮件、日历和出行需求,并进一步完成规划、推荐、同步、分享和草拟邮件等连续任务。按照北京时间计算,相关峰会将在 9 月 23 日凌晨完成披露;这也意味着,端侧大模型正在从“能聊天”走向“能调用手机数据和系统能力办事”。

30B 模型为什么能塞进手机
混合专家模型(MoE)是一种只在每次推理时激活部分参数的模型架构。 StepEdge-Omni 30B-MoE 虽然拥有 300 亿参数,但并不意味着每一个输入都要同时计算全部参数。系统会根据任务内容选择对应的专家模块,例如让负责文本理解、规划或工具调用的部分参与计算,从而降低实际计算量和内存带宽压力。
这和把一台数据中心服务器直接缩小塞进手机不是一回事。更准确的比喻是:手机里放了一套规模很大的“专家团队”,但每次只叫来解决当前问题最相关的几个人。模型的总知识规模仍然较大,运行时却不必让全部专家同时工作。
不过,MoE 并不会自动解决端侧部署的所有问题。未激活的专家参数仍然需要以某种形式存储,模型权重、KV Cache、上下文窗口和系统运行空间都会占用内存。因此,StepEdge-Omni 30B-MoE 能够在手机上运行,关键不只是模型结构,还包括推理引擎、异构调度和存储方案的联合优化。
高通披露,合作方案让模型的运行内存需求相比行业常规方案降低超过 50%。这项数据的重要性高于“30B”本身:对于手机来说,内存容量和内存带宽通常比峰值算力更先成为瓶颈。模型如果需要长时间占用大量内存,即使芯片理论算力足够,也可能出现后台应用被杀、机身发热、续航下降和首字延迟过长等问题。
330 Token/s 预填充,28 Token/s 解码
预填充吞吐是模型读取输入内容的速度,解码吞吐则是模型逐个生成输出 Token 的速度。 高通公布的测试数据显示,StepEdge-Omni 30B-MoE 在该移动平台上的预填充吞吐超过每秒 330 个 Token,解码吞吐超过每秒 28 个 Token。
这两个数字对应的是智能体体验中的两个不同环节。
- 预填充超过 330 Token/s:模型读取邮件、历史对话、日历记录和用户指令时速度较快,适合处理较长上下文。
- 解码超过 28 Token/s:模型生成回复、规划步骤或邮件草稿时,理论上可以保持相对流畅的实时输出。
- 两者不能混为一谈:预填充速度快,代表“读得快”;解码速度快,才更接近用户感受到的“说得快”。
对于普通问答,28 Token/s 已经足以提供连续输出体验;但对于智能体任务,真正的端到端延迟还要加上系统权限检查、邮件检索、日历读写、网络状态判断和工具调用耗时。换句话说,模型生成速度并不等于任务完成速度。
如果用户说“帮我安排下周去上海的出差”,手机需要先理解出发地和时间,再读取日历,可能还要检索航班和酒店,最后生成确认信息。模型每一步都很快,并不代表整个流程不需要等待。端侧模型的价值,更多在于减少云端往返、缩短决策链路,并让多个本地动作可以被统一编排。
手机本地可以做什么
端侧智能体是运行在本地设备上的软件代理,它能够理解用户目标,并调用系统或应用能力完成多步任务。 此次演示覆盖的任务已经超出传统手机助手的“语音问答”范围。
根据高通披露的信息,StepEdge-Omni 30B-MoE 可以在无需调用云端服务的情况下完成以下任务:
- 邮件理解:读取邮件内容,提取时间、地点、人物和待办事项。
- 行程规划:根据邮件或自然语言指令整理出差安排。
- 日历同步:将识别出的会议、航班或活动写入日历。
- 航班和酒店推荐:结合任务上下文给出出行建议。
- 行程分享:整理行程信息,并发送给指定联系人。
- 邮件草拟:根据已有邮件和用户意图,生成回复或通知草稿。
这些任务的共同点,是模型不只要生成文字,还要理解手机里的结构化数据,并能对系统执行操作。比如“把客户邮件里的会议安排到日历,再把行程发给同事”,背后至少涉及邮件解析、时间实体识别、冲突检测、日历写入和联系人选择。
因此,真正决定体验的并非模型回答是否漂亮,而是它能否稳定地完成“理解—规划—调用工具—检查结果—向用户确认”这一整条链路。只会生成一封看起来不错的邮件,还不能称为成熟的智能体;能够识别权限边界、发现日历冲突并在执行前请求确认,才更接近可用产品。
与当前手机 AI 的区别:从摘要功能走向任务闭环
过去两年,手机端 AI 的主流形态是通话摘要、录音转写、图片消除、文本改写和通知总结。这些功能大多属于单轮处理:用户给出一段内容,模型返回一个结果,任务就结束了。
StepEdge-Omni 30B-MoE 所代表的路线更进一步,它试图把模型放在手机操作系统和应用数据之间,成为一个能够跨应用工作的任务中枢。用户不必分别打开邮件、日历、地图和酒店应用,而是直接描述目标,由智能体完成信息串联。
| 对比维度 | 传统手机端 AI | StepEdge-Omni 30B-MoE 端侧智能体 | 云端大模型智能体 | |---|---|---|---| | 主要能力 | 摘要、改写、识图、转写 | 邮件理解、日历同步、行程规划、邮件草拟 | 复杂推理、长流程工具调用、跨服务协作 | | 数据路径 | 多数在本地完成 | 目标是全流程本地完成 | 通常需要上传云端处理 | | 网络依赖 | 低 | 低,部分任务可离线 | 高,依赖网络稳定性 | | 隐私风险 | 相对较低 | 理论上更低,但取决于权限与日志设计 | 需要考虑数据上传、保存和第三方处理 | | 模型规模 | 通常偏小 | 总参数 300 亿,采用 MoE | 从轻量模型到超大规模模型均有 | | 适合场景 | 单点功能 | 手机内跨应用任务 | 复杂知识工作和开放式任务 | | 主要短板 | 任务之间割裂 | 功耗、可靠性、权限管理 | 延迟、成本和隐私 |
这张表也说明,端侧 30B 模型并不是要全面替代云端旗舰模型。它更像是手机里负责“就近处理”的执行层:高频、私密、低延迟的任务交给本地模型,复杂推理和需要最新外部信息的任务再交给云端。
端云协同仍然是更现实的路线
端云协同是指端侧模型和云端模型根据任务复杂度、隐私要求和实时性动态分工。 从阶跃此前公布的 Step Edge 端侧模型路线看,端侧模型负责低延迟的本地推理、全模态隐私处理和轻量级智能任务,复杂场景则可以联动云端旗舰模型。
这套架构比“所有任务都离线”更现实。邮件分类、日历整理、个人信息提取等任务适合留在手机本地;需要实时查询航班价格、酒店库存、地图路线或处理超长文档时,云端模型通常拥有更强的工具生态和更新能力。
端侧模型的优势不是绝对智能,而是靠近数据和用户。它可以在没有网络的地铁、飞机或弱网环境中继续处理部分任务,也可以避免把整封私人邮件、通讯录和日程上传到服务器。对于企业用户来说,本地推理还可能降低敏感数据外流的风险。
但“无需调用云端服务”需要限定在演示所覆盖的任务范围内。模型可以本地理解邮件,不代表它能离线获得最新航班库存;模型可以生成酒店推荐,不代表它能在没有网络的情况下完成预订。端侧推理与端侧完成全部业务闭环,是两个不同概念。
这次合作的关键,不只是阶跃和高通
这次适配还涉及无量火和江波龙,说明手机端部署 30B MoE 需要模型、芯片和存储方案共同配合。
高通负责移动平台、AI 加速和异构调度能力;阶跃提供 StepEdge-Omni 30B-MoE 模型及端侧适配;无量火参与推理优化;江波龙则涉及存储和内存方案。最终效果取决于四个环节能否形成闭环:模型是否适合端侧、编译器是否能充分利用 NPU/GPU/CPU、内存系统是否能承受持续推理,以及整机厂商能否把功耗和散热控制在可接受范围内。
这也是端侧大模型与服务器大模型最大的不同。服务器可以通过增加显卡、内存和散热系统来换取性能,手机则必须在有限的电池、机身空间和热设计功耗内运行。一次演示跑通并不难,难的是让它每天稳定工作数小时,同时不牺牲拍照、通信和后台应用体验。
30B 上手机,距离规模化还有多远
端侧大模型规模化的核心挑战,不是“能不能运行”,而是“能不能在真实用户手里稳定运行”。 目前至少有四个问题需要继续观察。
第一,功耗和发热
持续生成、长上下文读取和多轮工具调用都会让 NPU、GPU 和内存系统保持高负载。高通给出的吞吐数据证明了峰值性能,但还需要看到长时间运行下的温度、功耗和降频曲线。对于用户来说,手机能否在 10 分钟任务后仍保持正常使用,比实验室里的最高 Token/s 更重要。
第二,智能体可靠性
邮件和日历属于高敏感场景。模型如果把会议时间识别错、把收件人选错,或者在没有确认的情况下直接发送邮件,后果远比普通聊天答错一道题严重。端侧智能体需要具备明确的权限分级、执行前确认、结果回滚和操作日志。
第三,应用生态开放程度
跨应用智能体能否落地,取决于手机操作系统是否提供稳定的系统级接口。只依赖模拟点击和屏幕识别,短期可以演示,长期很难保证稳定性。邮件、日历、地图和通信应用需要开放统一的权限与工具接口,否则模型再强,也可能被卡在最后一步。
第四,终端成本与产品定位
30B MoE 需要更高规格的内存、存储和 AI 算力,这些都会推高手机 BOM 成本。厂商需要决定是把它放在旗舰机上作为差异化卖点,还是通过量化、分层加载和端云协同,把能力下放到更大范围的机型。
我的判断:端侧模型真正的竞争点是“调用权”
这次 StepEdge-Omni 30B-MoE 登陆手机,最值得关注的并不是“手机跑了一个 300 亿参数模型”,而是大模型开始获得处理个人数字生活的入口。
当模型只负责聊天时,模型参数规模决定上限;当模型开始处理邮件、日历和出行任务时,系统权限、工具接口和执行可靠性决定产品价值。一个回答能力略弱但能稳定完成任务的端侧模型,可能比一个推理能力更强、却每一步都需要用户手动确认的云端模型更有用。
阶跃的优势在于同时推进基础模型和端侧终端路线,并通过 Step Edge、Step AOS 以及 STEPX 等产品布局,把模型从应用层继续向设备和操作系统层推进。高通则提供了把大模型带到手机上的芯片与软件基础设施。两者结合,意味着手机 AI 的竞争可能从“谁接入了哪个模型”转向“谁能把模型真正嵌入系统工作流”。
但现在下结论说手机已经拥有了一个可靠的私人助理,还为时过早。330 Token/s 的预填充吞吐和 28 Token/s 的解码吞吐是积极信号,超过 50% 的内存需求下降也解决了端侧部署的一部分硬约束;然而,功耗、权限、幻觉、跨应用执行和真实用户留存,仍然需要量产设备和长期使用数据验证。
更现实的预期是:从 2026 年开始,旗舰手机会逐渐具备一批默认本地运行的智能体能力,先从邮件、日历、会议纪要、通知整理和个人信息检索等高频场景切入,再通过端云协同扩展到预订、购物和复杂办公。端侧大模型未必会立刻替代云端,但它很可能先成为手机系统里一个不再显眼、却越来越难以移除的基础能力。
结论
StepEdge-Omni 30B-MoE 的手机端适配,标志着端侧大模型开始从轻量文本功能进入邮件处理和多步骤智能体任务阶段。它通过 30B MoE 架构、推理引擎优化、异构调度和存储方案协同,在第六代骁龙 8 超级至尊版平台上实现了超过 330 Token/s 的预填充吞吐、超过 28 Token/s 的解码吞吐,以及超过 50% 的运行内存需求下降。
它的真正价值在于三点:更低的本地交互延迟、更少的敏感数据外发,以及手机系统对多步任务的统一编排能力。它的真正风险也同样清晰:高功耗、执行错误、权限滥用和应用生态适配不足。
所以,这更像是一次重要的工程拐点,而不是端侧 AI 的终局。手机已经开始装下更大的模型,但这些模型能否真正替用户办事,还要看厂商能否把“模型能力”转化为可控、可解释、可回滚的系统能力。
参考来源
- IT之家:高通携手阶跃等为第六代骁龙 8 超级至尊版端侧适配 300 亿参数 AI 模型 —— 提供本次骁龙峰会披露的合作信息、模型参数、内存优化比例及吞吐数据。
- 知乎:阶跃发布大模型原生 AI 终端品牌 STEPX 及 Step AOS —— 介绍阶跃的 Step Edge 端侧模型、端云协同策略及 STEPX、Step AOS 产品布局。



