AI 快讯华为手机将支持本地部署大模型
产品更新

华为手机将支持本地部署大模型

2026-09-09T05:05:31.461Z
华为手机将支持本地部署大模型

据博主透露,华为 Pura X View 与 Mate XT 2 非凡大师将支持下载部署两款端侧多模态大模型,分别面向离线图像生成、语音合成和复杂任务操控,模型体积约 6GB 与 15GB。

华为两款旗舰手机据称支持本地部署多模态大模型

据博主 @超维界 9 月 9 日透露,华为 Pura X View、Mate XT 2 非凡大师两款旗舰手机将支持下载部署端侧本地大模型。用户可以在设备上自主选择下载两类模型:一款体积约 6GB 的“多模态增强大模型”,以及一款体积约 15GB 的“多模态混合专家大模型”。

端侧本地大模型是指直接下载并运行在手机处理器、NPU 或其他本地计算单元上的 AI 模型,核心特点是不依赖网络连接即可完成部分推理任务。 这意味着,华为正在把手机里的 AI 能力从“调用系统功能”推进到“在设备上运行相对完整的模型”。

目前华为官方尚未公开两款模型的正式名称、参数规模、量化方式、适配芯片以及具体推理速度,相关信息仍应以华为后续公告和系统实际推送为准。但从泄露的功能描述来看,这并不是简单增加几个离线 AI 小功能,而是尝试在旗舰手机上提供一套可下载、可选择、可按场景调用的本地模型体系。

华为 Pura X View 与 Mate XT 2 非凡大师本地大模型下载与服务场景界面示意图

两款模型分别解决什么问题

据目前曝光的信息,约 6GB 的多模态增强大模型更偏向高频、低门槛的内容生成和影像增强;约 15GB 的多模态混合专家大模型则更偏向复杂任务理解、跨应用执行和设备操控。

| 模型类型 | 预计体积 | 主要能力 | 典型场景 | 是否支持离线使用 | |---|---:|---|---|---| | 多模态增强大模型 | 约 6GB | 本地图像生成、语音合成、影像增强、图库修图、人声播报 | 离线生成图片、照片优化、文字转语音 | 是,据称支持 | | 多模态混合专家大模型 | 约 15GB | 复杂任务理解、任务规划、应用操控、文件与照片整理 | 执行离线照片整理、跨应用完成连续操作 | 是,据称支持 |

多模态增强大模型是能够同时处理文字、图像、声音等信息,并直接提供生成或增强服务的端侧模型。 从应用描述看,它可能被系统级 AI 服务调用,而不是要求用户像使用独立聊天机器人一样手动打开模型。

这类模型的价值在于响应链路更短。比如用户在无网络环境下拍摄一张逆光照片,系统可以在本地完成超清增强;用户输入一段文字,也可以让设备直接合成人声;在图库中输入“把这张照片里的路人移除”,修图任务理论上可以在手机内部完成。对用户来说,体验上仍然是调用小艺或系统功能,但背后执行任务的模型已经从远端服务转移到手机本地。

多模态混合专家大模型是将多个“专家”子网络组合起来、按任务选择部分专家参与计算的模型架构。 与同等能力的稠密模型相比,MoE 模型通常可以在保留较强任务覆盖面的同时,减少单次推理需要激活的参数量,不过模型文件本身仍可能较大。

此次曝光的 15GB 模型被描述为“本地 MoE 大模型”,主要提供复杂任务理解和应用操控服务。例如,用户可能只需说“把上周在展馆拍的照片找出来,按人物和风景分成两个相册”,模型就需要完成时间、地点、图像内容和应用操作之间的关联,再调用图库执行整理动作。

需要注意的是,15GB 是模型下载体积,并不等于模型参数量,更不等于每次推理都会占用 15GB 的运行内存。模型是否采用 4-bit 或 8-bit 量化、权重是否分层加载、MoE 每次激活多少专家,目前都没有公开答案。在手机端部署中,这些工程细节往往比“模型有多少参数”更直接地决定速度、发热和续航。

从“离线问答”走向“离线执行任务”

华为此次动作最值得关注的地方,不是本地图像生成本身,而是它把端侧模型的职责扩展到了应用操控。

应用操控是指模型理解用户的自然语言目标后,调用系统或应用中的具体功能完成任务,而不仅仅是返回一段文字。 这相当于把手机从“回答问题的设备”变成“能够执行操作的设备”。

传统手机 AI 大多停留在单点功能:相机负责识别,图库负责搜索,语音助手负责唤醒应用,自动化工具负责执行预设流程。模型驱动的应用操控则试图把这些能力串起来。用户描述的是目标,模型负责拆解步骤、选择工具并判断执行结果。

例如,“找出我今年拍过的所有菜单照片并提取菜名”至少包含以下步骤:

  1. 在图库中筛选指定时间范围的图片;
  2. 判断哪些图片属于菜单或餐厅场景;
  3. 对图片进行 OCR 和语义理解;
  4. 提取菜名并去除重复内容;
  5. 以列表、备忘录或文档形式输出结果。

如果这些步骤都由端侧模型完成,手机就不只是提供一个 AI 对话框,而是具备了有限的本地智能体能力。它的优势是数据不必离开设备,断网时仍能运行;局限则是模型必须准确理解系统权限、应用界面和任务边界,否则很容易出现误操作。

华为官网对小艺的定位已经包含系统级智慧助手、视觉交互、智能修图、全局搜索和智能体协作等方向。此次曝光的本地模型下载机制,可能是这些系统能力进一步下沉到设备端的基础设施。不过,当前尚不能确认两款端侧模型是否完全由华为自研,也不能确认其是否与盘古大模型存在直接关系。

6GB 和 15GB,用户真正需要付出什么

对旗舰手机而言,下载 6GB 模型并非不可接受,但 15GB 模型会明显提高存储空间和内存管理压力。假设用户同时下载两款模型,至少需要占用约 21GB 存储空间,还要考虑模型缓存、运行时内存、索引文件和系统更新所需的额外空间。

| 维度 | 6GB 多模态增强模型 | 15GB 多模态 MoE 模型 | |---|---|---| | 下载成本 | 较低,适合大多数用户尝试 | 较高,需要更多存储空间 | | 推理复杂度 | 侧重生成与增强 | 侧重规划、理解与执行 | | 典型硬件压力 | 主要考验 NPU 图像与音频算力 | 同时考验 NPU、内存和系统调度 | | 预期响应 | 更适合即时调用 | 复杂任务可能需要更长等待时间 | | 主要风险 | 生成质量与细节有限 | 误判意图、误操作和续航消耗 |

端侧 AI 的实际体验由模型、芯片、内存、量化方案和系统调度共同决定,单看模型大小无法判断最终性能。 同一个 6GB 模型,在不同芯片上的首 token 延迟、每秒生成速度和持续运行温度可能完全不同。

尤其是图像生成和语音合成,通常比文本分类、关键词提取更消耗算力。手机需要在有限功耗下完成扩散模型或自回归生成,同时避免影响相机、通信和后台应用。华为如果要让这些功能达到“随手可用”的水平,必须针对自研芯片的 NPU 指令集、内存带宽和系统调度做深度优化。

因此,用户最终更关心的不是“模型有 6GB 还是 15GB”,而是几个可量化指标:一张图片生成需要多少秒、离线修图是否支持高分辨率导出、连续执行任务能否保持稳定、运行 10 分钟后手机温度如何、是否会明显降低电池续航,以及模型更新是否需要重新下载完整文件。

与云端 AI 相比,端侧部署的优势与边界

本地推理的最大优势是数据和计算都留在设备上,网络状态不再是功能可用性的前提。 对照片、录音、联系人、日程和文件等高敏感数据而言,这一点尤其重要。

在以下场景中,端侧模型更有现实价值:

  • 无网络环境: 飞行途中、地下空间、户外山区或网络质量较差的地区,仍可完成基本图像理解、语音合成和照片整理;
  • 隐私敏感任务: 私人照片、会议录音、证件内容和本地文档可以在设备内处理;
  • 低延迟交互: 不需要经过网络传输,理论上能减少请求排队和往返延迟;
  • 系统级调用: 相机、图库、录音机和文件管理器等功能可以直接调用模型,不必在多个应用之间切换。

但端侧模型也不可能全面替代远端大模型。手机的存储、内存和散热条件决定了本地模型必须在能力上做取舍。它更适合固定场景、隐私任务和快速响应,不适合需要海量知识、长上下文、复杂联网检索或高质量长文本创作的任务。

这也是华为采用“两款模型自主选择下载”思路的原因之一:小模型负责高频功能,大模型负责复杂任务,让用户根据存储空间、使用习惯和设备配置做取舍。未来更合理的形态可能不是单一模型包,而是多个按能力拆分的模型组件,例如视觉理解、语音合成、OCR、任务规划和应用执行分别按需安装。

HarmonyOS 7 更新或为功能落地铺路

据 IT之家此前报道,华为在今年 8 月开启 HarmonyOS 7.0.0.102 SP8 版本推送,带来了 3D 空间壁纸、亲密圈、户外探索模式等功能。升级后,支持端侧 AI 的机型还可以查看本地模型版本、参数大小及服务场景。

能够查看本地模型版本、体积和服务场景,说明端侧 AI 已经被纳入 HarmonyOS 的系统级管理范围。 这至少意味着模型不再是某个应用私自携带的资源,而可能由系统统一负责下载、版本管理、权限控制和能力调度。

对开发者而言,系统级模型管理比单个应用内置模型更有想象空间。应用可以围绕系统提供的视觉理解、语音交互和任务执行能力设计新的功能,而不必分别集成多个模型。不过,华为是否会向第三方开放统一的端侧 AI 能力、开放哪些权限、是否提供标准化开发接口,目前都没有公开信息。

如果应用操控能力只服务于华为自有应用,短期内更像是系统体验升级;如果未来开放给第三方应用,HarmonyOS 可能进一步形成面向智能体的系统能力层。届时,手机应用的交互入口将从按钮和菜单,逐渐转向由模型理解用户意图后进行任务编排。

这次更新的含金量,取决于三个问题

第一,华为需要公布模型的真实规格和推理性能。 目前已知的只有约 6GB 和约 15GB 两个体积数字,缺少参数量、上下文长度、量化精度、NPU 占用、首 token 延迟和持续生成速度等关键指标。在没有实测数据前,无法判断 15GB MoE 模型究竟处于行业什么水平。

第二,离线功能需要明确边界。 “支持离线使用”可能意味着完整任务都在本地执行,也可能只是部分环节离线,某些复杂功能仍需要网络。华为需要说明图像生成、语音合成、照片整理和应用操控分别支持哪些离线能力,以及数据是否会在特定情况下离开设备。

第三,应用操控必须建立可靠的安全机制。 让模型读取图库、创建相册、修改图片或调用系统设置,本质上涉及敏感数据和高权限操作。理想方案应当包含任务预览、逐步确认、可撤销记录和权限分级,而不是让模型拥有不受限制的自动执行权。

从产品判断来看,华为这次的方向是对的,但目前更像一次重要的基础设施铺设,而不是已经完成的端侧智能体革命。6GB 模型对应的是用户容易感知的离线生成和增强功能;15GB MoE 模型则承担更高阶的任务理解与系统操控,真正的差异化也将出现在后者的稳定性和可控性上。

如果最终实测能够做到:常用照片任务在数秒内完成、离线语音合成足够自然、模型运行不明显发热,并且复杂操作能够准确执行,那么 Pura X View 和 Mate XT 2 非凡大师会成为少数真正把端侧多模态模型做进系统体验的旗舰手机。反之,如果大模型下载后响应缓慢、续航下降明显,或者应用操控只能完成演示级任务,15GB 只会变成一个占用存储空间的“能力储备包”。

截至 2026 年 9 月 9 日,华为尚未公开两款本地模型的正式发布说明和完整性能数据。现阶段可以确认的是:华为正在尝试让旗舰手机支持多模型本地部署,并将离线图像生成、语音合成、影像增强和应用操控纳入同一套端侧 AI 框架。至于它能否真正改变手机交互,还要等系统推送范围、机型适配情况和实际体验进一步验证。

参考来源

相关推荐

查看全部