AI 快讯VMware AI Factory落地,私有云部署提速
产品更新

VMware AI Factory落地,私有云部署提速

2026-08-31T17:04:21.476Z
VMware AI Factory落地,私有云部署提速

博通今日发布 VMware AI Factory,将 VMware Cloud Foundation 的基础设施自动化、GPU 资源池、模型管理和可观测性整合到企业私有云中,目标是把 AI 服务从数周部署压缩到数小时。

VMware AI Factory落地,企业私有云部署AI从数周缩短至数小时

博通在 2026 年 8 月 31 日宣布推出 VMware AI Factory,试图解决企业部署私有云 AI 时最难的一环:不是单独装好一块 GPU,也不是单独跑通一个模型,而是把服务器、虚拟化、容器、GPU、模型推理、RAG 工作流和运营监控连成一条可重复的生产链路。

VMware AI Factory 是一套面向企业私有云的 AI 基础设施软件定义方案,核心依托 VMware Cloud Foundation(VCF)提供从硬件上线到模型服务运行的自动化能力。按照博通的说法,VCF 可以把 AI 服务器部署到模型开始提供服务的周期从数周缩短至数小时。

这个发布的价值不在于又增加了一个模型平台,而在于博通开始把 VMware 的传统优势——数据中心基础设施管理、虚拟化和私有云运维——直接改造成 AI 生产环境。对于已经采购大量 VMware 软件、但仍靠人工拼装 GPU 集群和模型服务的企业来说,这比再引入一个孤立的模型开发工具更有现实意义。

VMware AI Factory 企业私有云 AI 部署流程示意图,展示从 AI ReadyNodes、GPU 资源池、VCF 到模型推理和 RAG 工作流的自动化链路

先看清楚:VMware AI Factory到底是什么

私有云 AI 是指企业在自有数据中心或专属云环境中运行模型、数据和推理服务,而不是把敏感数据交给公共云平台处理。它通常更符合金融、制造、能源、医疗和政务客户对数据主权、内网访问和合规审计的要求,但代价是企业需要自己承担硬件、软件、集群调度和运维复杂度。

VMware AI Factory 是博通为这类环境提供的 AI 基础设施软件定义基础,重点不是训练一个新模型,而是自动化管理 AI 运行所需的底层资源和服务流程。其覆盖范围可以拆成四层:

  1. 硬件层:通过 VCF AI ReadyNodes 认证服务器承载 CPU、GPU、存储和网络资源。
  2. 资源层:利用 VCF 把分散在企业内部的 GPU 汇集为可共享的资源池。
  3. 平台层:在虚拟机、容器和 GPU 资源之间部署及管理模型推理与 RAG 工作流。
  4. 运营层:监控 Token 吞吐量、延迟、计算利用率和内存利用率,帮助企业判断模型服务是否真正跑得划算。

VCF 是 VMware Cloud Foundation 的缩写,它是一套用于构建和管理企业私有云的基础设施平台。VMware AI Factory 的关键变化,是让 VCF 不再只负责虚拟机、集群和云资源的生命周期管理,而是进一步承担 AI 工作负载的资源编排和运行监控。

它具体自动化了什么

VMware AI Factory 的核心能力,是把传统的“买硬件、装系统、配集群、部署模型、接入业务”串成一条标准化流程。

在过去,企业上线一个内部大模型应用,往往需要多个团队协作:基础设施团队准备服务器,虚拟化团队配置集群,GPU 管理员安装驱动和运行时,数据科学团队准备模型,应用团队再接入知识库和业务系统。任何一个环节出现版本不兼容、资源不足或权限配置错误,整个项目就会停在模型已经下载、服务却无法稳定运行的阶段。

VMware AI Factory 的设计目标,是将这部分工作转化为统一平台上的资源配置和服务部署。企业可以先把经过认证的 AI ReadyNodes 加入 VCF,再由平台管理计算、存储、网络和 GPU 资源;模型和推理工作流则通过统一模型库完成部署,避免每个团队为自己的模型重新准备一套服务器。

这种方式的本质,是把 GPU 从“某个项目独占的昂贵设备”变成“企业级共享基础设施”。不同团队可以在同一套硬件上运行多个模型,资源由平台统一分配,企业不必为每一个聊天机器人、知识库问答系统或智能客服单独配置一组服务器。

GPU共享比单纯扩容更重要

GPU 资源池是 VMware AI Factory 最值得关注的部分,因为企业 AI 项目普遍面临的不是没有 GPU,而是 GPU 利用率不稳定。

一个模型在高峰期可能需要大量显存和算力,到了夜间或业务低谷,整台服务器却可能处于低负载状态。如果每个部门都独立采购和管理 GPU,就会出现一边排队、一边闲置的情况。VCF 试图通过统一资源池,让多个模型和多个团队共享同一批硬件,从而提高设备的整体利用率。

当然,共享并不等于所有工作负载都能无条件混用。大模型推理通常对显存容量、显存带宽、批处理策略和网络通信有明确要求,实时对话与离线批处理也需要不同的调度策略。因此,VMware AI Factory 是否能真正提高利用率,最终仍取决于它对 GPU 拓扑、显存隔离、调度优先级和模型服务弹性的支持深度。

博通目前给出的信息更强调统一管理和可观测性,而没有公布 GPU 虚拟化粒度、具体调度算法、支持的 GPU 型号清单,以及不同模型并发运行时的性能数据。这意味着企业在评估时不能只看“支持 GPU 共享”这句话,还需要实际验证多租户场景下的吞吐量、尾延迟和资源隔离效果。

统一模型库,解决模型服务碎片化

统一模型库是 VMware AI Factory 面向数据科学团队提供的单一入口,用于在虚拟机、容器和 GPU 资源之间部署及管理模型推理与 RAG 工作流。

模型库的意义,不只是把模型文件集中放在一个目录里,而是让模型从实验阶段进入生产阶段时,有一套可追踪、可管理的交付路径。企业可以围绕模型版本、运行环境、资源需求和服务状态建立统一管理,而不是让每个团队分别维护一套脚本、镜像和服务器配置。

RAG 是检索增强生成的简称,指模型回答问题前先从企业知识库中检索相关资料,再基于检索结果生成答案。RAG 目前是企业私有云最常见的 AI 应用形态之一,因为它可以让通用模型访问内部文档、产品手册、工单和制度,而不必直接用企业数据重新训练基础模型。

对于 RAG 工作流而言,模型推理只是其中一环,前面还涉及文档处理、向量检索、重排序、权限过滤和上下文拼接。VMware AI Factory 如果能够把这些工作流与底层虚拟机、容器和 GPU 资源统一管理,企业就可以更快复制知识库问答、内部搜索和智能客服等应用。不过,参考信息目前只明确提到模型推理和 RAG 工作流的部署管理,并未披露其是否内置向量数据库、Embedding 服务、重排序模型或知识库权限体系,不能把它理解成完整的企业 AI 应用开发平台。

可观测性从“机器健康”转向“模型经济性”

AI 可观测性是对模型服务的吞吐量、延迟、资源消耗和运行状态进行持续监控,以判断系统是否稳定、资源是否被有效利用。VMware AI Factory 内置的可观测性功能,明确关注 Token 吞吐量、延迟、计算利用率和内存利用率。

这几个指标比传统虚拟机监控更贴近 AI 服务的真实成本。普通企业应用通常看 CPU 使用率、内存占用和请求数,但大模型服务还必须知道每秒生成多少 Token、首 Token 延迟是多少、完整响应耗时多长,以及 GPU 是否因为显存不足或批处理策略不合理而没有发挥作用。

| 监控指标 | 反映的问题 | 对企业的实际意义 | |---|---|---| | Token 吞吐量 | 单位时间内处理或生成的 Token 数量 | 判断模型服务的处理能力和并发效率 | | 请求延迟 | 用户发起请求到获得响应的等待时间 | 衡量对话、搜索和客服场景的交互体验 | | 计算利用率 | CPU、GPU 等计算资源的使用情况 | 发现设备闲置、过载或调度不均衡 | | 内存利用率 | 系统内存与显存的占用情况 | 判断模型是否能稳定加载,以及并发是否受限 |

“最大化 Token 利用率”是一个很典型的 AI 基础设施目标。它并不是简单追求 GPU 利用率越高越好,而是在可接受的延迟和服务质量下,让每一块 GPU 尽可能多地完成有效推理。对企业来说,这直接关系到每次回答的基础设施成本,以及是否需要继续采购硬件。

但需要注意,平台能展示指标,不代表平台已经解决性能优化。Token 吞吐量最终还受到模型量化方式、推理引擎、上下文长度、批处理策略、KV Cache 管理和 GPU 互联带宽影响。VMware AI Factory 的优势更可能体现在统一采集、统一观察和统一运维,而不是替代专门的模型推理优化工具。

支持哪些硬件和模型

VMware AI Factory 将支持思科、戴尔、联想、超微等厂商的 VCF AI ReadyNodes 认证产品。AI ReadyNodes 是经过厂商认证、适合运行 AI 工作负载的服务器配置,通常会对 GPU、CPU、内存、存储、网络和 VMware 软件版本进行组合验证。

认证硬件的价值,在于降低企业自行组装 AI 集群的风险。AI 服务器并不是把 GPU 插进通用服务器这么简单,驱动、固件、PCIe 拓扑、散热、电源、网络和虚拟化层之间都可能影响稳定性。认证节点可以把一部分兼容性问题前置到厂商验证阶段。

根据博通公布的信息,VMware AI Factory 还将支持客户偏好的 AI 软件和加速器架构,并兼容 Gemma 4、cotomi、Qwen 3.7-Max、GLM 5.2 等模型。由于这些模型名称和具体版本可能随厂商发布节奏变化,企业采购时仍应以博通、VMware 及模型提供方公布的正式兼容性清单为准,重点确认模型格式、推理引擎、量化版本、显存需求和多卡运行方式。

| 维度 | VMware AI Factory目前披露的信息 | 企业需要进一步确认的内容 | |---|---|---| | 服务器 | 支持思科、戴尔、联想、超微等厂商的 VCF AI ReadyNodes | 具体型号、GPU 配置、网络规格和认证版本 | | 资源管理 | 汇集企业内部 GPU,支持多个团队共享硬件 | GPU 隔离、调度优先级、显存分配和多租户能力 | | 模型管理 | 通过统一模型库部署和管理推理工作流 | 模型格式、版本管理、回滚和灰度发布方式 | | 工作流 | 支持模型推理和 RAG 工作流 | 是否包含向量数据库、Embedding、重排序和权限控制 | | 监控 | 监控 Token 吞吐量、延迟、计算及内存利用率 | 告警、审计、成本核算和第三方监控集成能力 | | 模型兼容 | 提到 Gemma 4、cotomi、Qwen 3.7-Max、GLM 5.2 等 | 正式版本、推理引擎、量化方案和性能数据 |

它和公有云 AI 平台的差异在哪里

公有云 AI 平台的优势是开通快、弹性强,企业可以按需使用算力和托管模型;VMware AI Factory 的优势则是把 AI 运行环境放回企业可控的私有云中。

| 对比维度 | VMware AI Factory | 公有云 AI 平台 | |---|---|---| | 数据位置 | 运行在企业私有云或专属环境 | 通常运行在云服务商数据中心 | | 部署速度 | 通过认证硬件和自动化缩短部署周期 | 资源开通通常更快,但受云上配置和区域供给影响 | | 硬件投入 | 需要采购和维护服务器、GPU、网络与存储 | 以租用算力为主,前期硬件投入较低 | | 数据控制 | 更适合内网、数据主权和强合规场景 | 依赖云服务商的隔离、合规与区域策略 | | 资源弹性 | 受企业自有 GPU 总量限制 | 通常更容易临时扩容,但高峰期可能受配额影响 | | 适用场景 | 长期稳定运行、敏感数据和已有 VMware 体系的企业 | 快速试验、流量波动明显和不想自建硬件的团队 |

这并不意味着 VMware AI Factory 能全面替代公有云。对于模型试验、短期项目和流量不可预测的应用,公有云仍然更灵活;对于已经拥有数据中心、需要长期运行大量内部推理任务的企业,私有云则可能在数据控制和长期成本上更合适。

真正的竞争点,是 VMware 能否把私有云部署体验从“专业基础设施项目”变成接近云服务的标准化产品。如果企业仍需要多个团队手工处理 GPU 驱动、网络配置、模型镜像和推理调优,那么“数小时上线”的承诺就很难在真实项目中兑现。

对企业意味着什么

VMware AI Factory 首先会影响已经使用 VMware 体系的大型企业,因为这些客户通常已经具备 VCF 管理经验、数据中心资源和既有运维流程,迁移成本相对较低。

金融机构可以将内部知识库、风控辅助和客服模型部署在私有环境中;制造企业可以把视觉检测、设备维护和生产知识问答放在工厂或企业内网;医疗机构则可以围绕病历辅助、医学资料检索和运营分析构建受控的模型服务。这些场景共同特点是数据敏感、访问边界清晰、模型调用相对稳定,并且企业愿意为长期可控性投入基础设施。

其次,它可能改变企业内部 AI 团队的分工。数据科学团队不必反复申请服务器,基础设施团队也不必针对每个模型项目手工搭建环境。平台团队可以把注意力转向资源配额、服务等级、成本分摊和安全策略,而模型团队则更专注于模型选择、提示词、检索质量和业务效果。

不过,自动化不会消除管理问题,只会把管理问题从“怎么装上去”转移到“怎么管得好”。企业仍然需要制定模型准入、数据访问、日志保留、输出审计、资源配额和故障切换规则。尤其是多个部门共享 GPU 时,谁能优先使用资源、哪些业务必须保证低延迟、哪些批处理任务可以延后,都需要平台层面的策略支持。

目前最值得警惕的三个问题

第一,VMware AI Factory 的公开信息仍偏产品定位,缺少可复现实测数据。目前已知的关键数字主要是部署周期目标,即从数周缩短至数小时,但没有公布具体服务器配置、模型规模、并发请求数、Token 吞吐量或端到端延迟。企业不能仅凭这一数字推断所有模型和工作负载都能达到同样速度。

第二,模型兼容列表不等于生产级优化。一个模型能够被加载,只说明基础兼容性可能成立;真正决定体验的是推理引擎、量化精度、上下文长度、并发调度、显存管理和故障恢复。对于超大参数模型或多模态模型,硬件拓扑和互联带宽往往比“平台支持模型名称”更重要。

第三,VMware 的软件授权和硬件采购成本可能影响整体账本。私有云 AI 的优势通常在数据控制、可预测运行和长期资源利用率,而不是低门槛。企业需要把服务器折旧、GPU 采购、机房电力、运维人员、软件许可和模型优化成本放在一起计算,再与公有云长期使用费用比较。

OpenAI Hub判断:它更像AI基础设施操作系统,而不是模型平台

VMware AI Factory 的定位更接近企业 AI 基础设施操作系统,而不是一个与模型厂商竞争的模型平台。它不负责定义模型能力,而是试图把企业已有的硬件、虚拟化环境和模型服务组织起来,让 AI 应用具备更稳定的生产部署路径。

它最有用的地方,是把“基础设施上线”和“模型上线”放在同一个生命周期里管理。过去企业私有云的自动化往往停在虚拟机和容器层,模型团队拿到环境后还要自行解决 GPU 调度、推理服务、RAG 工作流和监控问题。VMware AI Factory 正在补上这段断层。

它最需要证明的地方,则是自动化是否足够深入。若平台只能完成服务器纳管、虚拟机创建和基础监控,却无法处理模型版本回滚、GPU 资源隔离、推理弹性伸缩、RAG 组件编排和成本核算,那么它仍然只是 AI 硬件管理平台,而不是完整的 AI 生产平台。

截至 2026 年 8 月 31 日,博通给出的方向已经清晰:以 VCF 为底座,以认证 AI ReadyNodes 为硬件入口,以 GPU 资源池和统一模型库为中间层,再用 Token 级可观测性连接到模型服务运营。对已经押注 VMware 私有云、同时希望把 AI 从试验项目推进到企业生产系统的客户,这套方案值得进入评估名单;但在正式采购前,仍应要求厂商提供具体硬件配置、模型性能、授权模式、多租户隔离和故障恢复测试结果。

如果这些能力能够在真实企业负载下兑现,VMware AI Factory 的意义就不只是“让 AI 部署更快”,而是把私有云从承载虚拟机的基础设施,升级为能够持续交付模型服务的企业 AI 平台。

参考来源

相关推荐

查看全部