Solar Pro 4低价杀入智能体战场

Upstage 发布 Solar Pro 4,以 512K 上下文、128K 输出和每百万 Token 0.3 美元输入价切入智能体市场。模型首次登上 Agent Arena,排名第 44,性价比突出,但距离第一梯队仍有差距。
Solar Pro 4低价杀入智能体战场
韩国 AI 公司 Upstage 今天(2026 年 8 月 13 日)正式发布 Solar Pro 4,一款面向复杂智能体任务的商用大模型。它提供 512K Token 上下文窗口、最高 128K Token 输出,输入价格压到每百万 Token 0.3 美元,并成为首个进入 Agent Arena 排行榜的韩国模型。
Solar Pro 4 最值得关注的不是某项跑分夺冠,而是把长上下文、工具调用和低价格放进了同一个产品里。它在 Agent Arena 暂列第 44 位,处于 MiniMax M2.7 附近,离全球头部模型显然还有距离;但对需要批量处理合同、报告、表格和终端任务的团队来说,这个价格已经足以进入候选清单。

512K 上下文之外,128K 输出更值得注意
上下文窗口是模型在一次请求中能够读取和处理的 Token 总量上限。 Solar Pro 4 的上下文窗口达到 512K,即约 52.4 万 Token,适合一次加载多份合同、研究报告、运营数据或代码文件,而不必先把材料切成大量碎片。
最大输出长度是模型在一次生成过程中可以返回的 Token 数量上限。 Solar Pro 4 最高支持 128K Token 输出,相当于其上下文规模的四分之一,这个配置比单纯把输入窗口做大更有实际价值。
很多长上下文模型的问题不是“读不进去”,而是“写不出来”。模型可以接收几十万 Token 的材料,却只能输出几千到一两万 Token,最终仍然需要开发者手动拆分报告、表格说明、代码补丁和审计记录。128K 输出意味着 Solar Pro 4 理论上可以在一次任务中交付更完整的分析结果,尤其适合生成长篇审查报告、迁移方案、测试记录或结构化文档。
Solar Pro 4 的核心规格如下:
| 项目 | Solar Pro 4 规格 | 实际意义 | |---|---:|---| | 上下文窗口 | 512K Token | 可在单次会话中加载多份长文档与数据文件 | | 最大输出 | 128K Token | 能生成长报告、完整交付文档和大规模结构化结果 | | 输入价格 | 0.3 美元/百万 Token | 适合高输入、低输出的检索与审查任务 | |缓存读取价格 | 0.06 美元/百万 Token | 相比普通输入低 80% | | 输出价格 | 1.2 美元/百万 Token | 是普通输入单价的 4 倍 | | 参数规模 | 未披露 | 暂时无法判断模型的架构效率与部署规模 | | 产品定位 | 商用智能体模型 | 重点覆盖长文档、终端操作和多轮工具调用 |
Solar Pro 4 暂未披露参数量、激活参数规模和具体模型架构。这个缺口并不影响在线使用,却会限制外界判断其训练效率、推理吞吐和能力上限,也意味着目前不宜仅凭价格推断它属于“小模型”还是稀疏激活的大型模型。
0.3 美元输入价很低,但账不能只算输入
Token 定价是模型按照输入、输出及缓存读取量计算推理费用的计费方式。 Solar Pro 4 每百万 Token 普通输入为 0.3 美元,缓存读取为 0.06 美元,输出为 1.2 美元;按发布时汇率粗略换算,分别约为 2 元、0.41 元和 8.1 元人民币。
这套价格结构明显在鼓励“多读材料、少写废话”。普通输入单价只有输出的四分之一,而缓存读取又只有普通输入的五分之一,因此重复使用固定知识库、制度文档和代码索引时,成本会进一步下降。
以一次理论上的满窗口任务计算,512K 输入约需 0.1536 美元,128K 输出同样约需 0.1536 美元,总费用约为 0.3072 美元。按参考汇率估算,这次超长任务的纯 Token 费用约为 2.06 元人民币,不包括外部搜索、沙箱、数据库、文件解析及其他工具产生的费用。
如果 512K 输入全部命中缓存,输入费用会降至 0.03072 美元;再加上 128K 最大输出,合计约为 0.18432 美元。与未命中缓存的同规模任务相比,总 Token 成本下降约 40%,而输入部分本身下降 80%。
| 理论场景 | 输入费用 | 输出费用 | Token 总费用 | |---|---:|---:|---:| | 512K 普通输入,不输出 | 0.1536 美元 | 0 | 0.1536 美元 | | 512K 缓存读取,不输出 | 0.03072 美元 | 0 | 0.03072 美元 | | 512K 普通输入 + 128K 输出 | 0.1536 美元 | 0.1536 美元 | 0.3072 美元 | | 512K 缓存读取 + 128K 输出 | 0.03072 美元 | 0.1536 美元 | 0.18432 美元 |
这些数字说明,Solar Pro 4 的优势更容易在文档审查、企业知识检索和批量分类中体现。若任务需要持续生成超长答案,输出仍会成为主要开支;若输入材料固定且能够反复命中缓存,成本优势才会被真正放大。
低价格也不能自动等同于低总成本。智能体产品的实际支出还取决于任务成功率、平均重试次数、工具调用轮数、生成速度和人工复核成本:一个便宜 50% 但需要执行三次才能成功的模型,最终通常比一次完成任务的高价模型更贵。
官方演示不再是聊天,而是交付一套文件
AI 智能体是能够规划步骤、调用工具并根据执行结果继续行动的模型系统。 Upstage 把 Solar Pro 4 定位为智能体模型,而不是只强调问答、数学或知识记忆,这一点从官方演示的任务设计中表现得很直接。
官方以虚构咖啡品牌 Solarbean Coffee 的门店选址作为演示。模型收到 1 份门店开设政策文档和 6 份市场数据文件,需要从 10 个候选站点中完成政策筛选,并依次生成 Excel 工作簿、审查报告和幻灯片。
Solar Pro 4 在 3 条提示词内完成了这套流程。这个演示的重点不是模型能否写一段选址建议,而是它能否把政策限制、市场数据、候选地点和最终交付物串成同一个工作流。
门店选址任务实际上压缩了企业智能体最常见的四个难点:
- 跨文件读取: 同时理解政策文档和多份市场数据,而不是只总结单一文件。
- 约束执行: 先按硬性政策淘汰不合格地点,再对剩余地点排序。
- 结构化计算: 把分析过程和结果写入可检查的工作簿,而非只给自然语言结论。
- 多格式交付: 将同一套事实转换成报告和演示文稿,保持数字与结论一致。
这类演示比“上传一份 PDF 然后提问”更接近真实工作,但仍然不能视为完整生产验证。官方没有披露 Excel 公式是否准确、幻灯片数字是否与工作簿逐项一致,也没有给出任务重复运行后的成功率。对于智能体来说,一次演示成功只能证明流程可走通,连续运行 100 次仍保持稳定才接近企业可用。
三项跑分指向终端、工具调用和长上下文
智能体基准是用于评估模型能否在多步骤环境中执行任务、调用工具并完成目标的测试集合。 Upstage 公布的三项核心结果分别是 Terminal-Bench v2.1 得分 57、τ³-Banking 得分 23、AA-LCR 得分 71。
| 基准 | Solar Pro 4 得分 | 主要观察能力 | |---|---:|---| | Terminal-Bench v2.1 | 57 | 在终端环境中理解任务、执行命令并修正错误 | | τ³-Banking | 23 | 在银行业务场景中进行多轮交互与工具调用 | | AA-LCR | 71 | 长上下文条件下的信息定位、推理与任务完成能力 |
Terminal-Bench v2.1 的价值在于,它测试的是模型能否真的在终端里把事情做完。模型不仅要生成看似合理的命令,还要处理目录、依赖、权限、执行报错和中间状态,因此比静态代码题更接近编码智能体和运维智能体的实际环境。
τ³-Banking 的低绝对分数反而提醒了市场,多轮业务智能体仍是难题。银行场景通常包含身份、账户状态、政策边界和工具返回值,模型必须在多轮对话中保持状态,并避免越权执行;Solar Pro 4 得分 23,说明它虽然面向此类任务优化,但距离稳定自动化仍有很大空间。
AA-LCR 得分 71 展示了 Solar Pro 4 的长上下文潜力,但 512K 容量不等于 512K 内容都能被可靠使用。上下文窗口像一张足够大的办公桌,长上下文推理能力则决定模型能否从桌上几十摞文件中找到正确页码,并把相隔很远的证据连起来;容量解决“放不放得下”,评测解决“找不找得到”。
官方跑分目前缺少更完整的横向对照、误差范围和运行配置,因此不宜把单项数字直接解释成对某个竞品的领先。真正值得继续观察的是 Solar Pro 4 在长任务中的成功率、重试率、Token 消耗和延迟,而不仅是一次基准测试的最终得分。
首登 Agent Arena,排名第 44 是起点而非胜利
Agent Arena 是通过匿名对战和人类偏好反馈评估智能体表现的平台。 它延续了模型竞技场的双盲比较思路,让用户在不知道模型身份的情况下选择更好的任务结果,再通过类似 Elo 的统计方法形成排名。
Solar Pro 4 此次成为首个进入 Agent Arena 的韩国模型,首次亮相位列第 44 名,与 MiniMax M2.7 处于相近位置。这个成绩对 Upstage 有象征意义,但从全球竞争位置看,它目前属于“有资格上桌”,还不是第一梯队挑战者。
| 模型 | Agent Arena位置 | 当前可得结论 | |---|---:|---| | Solar Pro 4 | 第 44 名 | 韩国模型首次进入该榜单,已获得真实用户任务反馈 | | MiniMax M2.7 | 与其处于相近区间 | 两者当前人类偏好表现大致在同一档位 |
Agent Arena 排名比厂商自测更有参考价值,却也存在样本量和任务分布问题。新模型刚上线时对战次数通常较少,名次可能随投票增加而快速变化;用户偏好也会受到输出风格、响应速度和展示形式影响,不完全等同于严格的任务正确率。
第 44 名还暴露了 Solar Pro 4 的现实边界。它的定价和上下文规格足够激进,但综合智能体体验尚未证明自己能取代头部模型,尤其是在复杂规划、错误恢复、长链工具调用和高风险业务执行上。
这并不意味着 Solar Pro 4 没有竞争力。对开发团队而言,最合理的使用方式可能不是让它承担所有高难度任务,而是把它放在分层模型架构中:Solar Pro 4 负责长文档读取、数据整理、候选方案生成和批量交付,少数高风险决策再交给能力更强、价格也更高的模型复核。
Upstage 的机会,在于把“韩国模型”做成企业选项
Upstage 的差异化机会不在于复制全球通用聊天助手,而在于企业文档和区域市场。韩国企业对本地语言、数据合规、内部文档处理和部署支持有明确需求,一款价格足够低、能够处理超长材料的商用模型,更容易从具体工作流切入。
Solar Pro 4 的产品设计也体现了这一取向。512K 输入适合制度文件与档案,128K 输出适合生成完整交付物,缓存价格适合重复使用固定知识库,而终端和银行基准则对应开发、运营和受监管行业。
Solar Pro 4 当前最大的未知数仍然是稳定性。官方尚未披露参数规模、训练方法、真实吞吐、首 Token 延迟、完整多语言表现及安全评测,这些指标都会影响企业是否愿意把核心流程交给它。
Solar Pro 4 当前最清晰的结论是:它不是凭综合能力登顶的新旗舰,而是一款用极低输入成本和超长交付能力争夺智能体工作负载的实用型模型。第 44 名说明能力还有明显短板,0.3 美元的价格则意味着开发者有足够低的试错门槛。
如果后续第三方测试证明它能在 512K 输入下保持稳定检索,并将 Terminal-Bench 得分转化为真实任务成功率,Solar Pro 4 会成为企业智能体市场里相当有威胁的成本型选手。反过来,如果长上下文只是容量指标,而工具调用需要频繁重试,那么再低的单 Token 价格也只会变成一张好看的价目表。
参考来源
- IT之家:韩国 AI 模型 Solar Pro 4 首次亮相 Agent Arena——整理了 Upstage 官方发布信息、模型规格、定价、智能体基准成绩及 Agent Arena 排名。



