PSSA开源:Rust重做非Transformer语言模型

PSSA 是一个用 Rust 从零实现的非 Transformer 语言模型项目,近期在 GitHub 上引发关注。它目前更像一份面向开发者的架构实验和可读源码,而不是已经完成商业化验证的通用大模型。
PSSA 开源:Rust 从零重做非 Transformer 语言模型
PSSA 是一个用 Rust 从零实现的非 Transformer 语言模型项目,近期在 GitHub 上引发了开发者关注。项目没有把重点放在“又一个更大的聊天模型”上,而是把语言模型拆回基础零件:文本如何进入模型、状态如何在序列中传播、参数如何训练,以及这些过程如何用一门强调内存安全和性能的系统语言重新实现。
截至 2026 年 9 月 30 日,PSSA 更适合被看作一项公开的模型架构实验,而不是可以直接替代 GPT、Claude 或 Qwen 的生产级模型。它的价值不在于公布了多少参数、跑分多高,而在于把“语言模型是否一定要依赖 Transformer”这个问题,变成了一份可以阅读、编译和继续修改的 Rust 源码。

先说结论:PSSA 有意思,但不是性能神话
PSSA 的核心卖点是非 Transformer 架构和从零实现,这让它成为研究模型内部机制、学习训练流程和探索 Rust AI 工程实践的好材料。
不过,现有公开资料没有给出足够完整的参数规模、训练语料、训练成本、上下文长度、吞吐量和主流基准成绩。因此,不能仅凭“非 Transformer”“Rust 实现”或 GitHub 热度,推导出它在推理速度、准确率或成本上已经超过 Transformer 模型。
这一区分很重要。今天的大模型报道经常把“架构创新”“工程实现”和“模型效果”混在一起:一个项目可以在代码层面非常新鲜,却还没有经过大规模训练验证;也可以在单机上运行得很快,但在长文本、复杂推理和多轮对话中表现有限。PSSA 目前最确定的价值,是把前一层问题做得足够公开,让开发者能够直接观察一个非 Transformer 语言模型如何工作。
PSSA 到底改变了什么
非 Transformer 语言模型是指不以 Transformer 的多头自注意力模块作为核心序列建模机制的语言模型。
Transformer 语言模型通过注意力机制,让当前位置的表示直接访问上下文中的其他位置。简单说,模型在生成一个词时,可以回头查看前文,并计算“当前词应该关注哪些词”。这种机制非常擅长处理远距离依赖,也是 GPT、Claude、Gemini、Llama、Qwen 等现代语言模型的基础之一。
但注意力机制的代价也很明确:当上下文长度增加时,计算和显存压力会快速上升。虽然工程实现中已经有 FlashAttention、分组查询注意力、滑动窗口和 KV Cache 等优化,但 Transformer 仍然需要处理大量 token 之间的关系。
PSSA 选择了另一条路线。非 Transformer 架构通常会让模型沿着序列逐步维护某种隐藏状态,新的 token 到来后,模型用当前输入和已有状态计算下一步状态,再依据状态预测输出。这个过程更像一个不断更新的压缩记忆,而不是每次都重新查看整段历史。
状态空间模型是通过隐藏状态随序列演化来建模文本的模型范式,它通常试图用固定规模或受控增长的状态表示更长的上下文。
这类方法的潜在优势是计算路径更接近线性,推理时也有机会把过去信息压缩成状态,从而减少重复读取历史 token 的开销。潜在问题同样明显:如果压缩状态丢失了关键细节,模型可能更难精确恢复很久之前的事实、变量名或指令关系。Transformer 的注意力像一张可以随时检索的索引,状态模型则更像一个持续更新的工作记忆,两者的取舍并不只是“谁更先进”。
“用 Rust 从零写”为什么值得看
Rust 是一种强调内存安全、并发安全和运行时效率的系统编程语言,PSSA 使用它实现语言模型,重点并不只是把 Python 换成另一种语法。
在常见的 AI 原型中,研究者往往使用 Python、PyTorch 或 JAX 快速搭建模型,再把真正耗时的算子交给底层库。这样的分工非常高效,但也会把很多细节藏在框架后面:张量如何分配、矩阵乘法在哪里发生、反向传播如何组织、数据类型如何转换,使用者通常不需要逐层理解。
从零实现则相反。开发者必须面对张量布局、维度匹配、参数初始化、梯度计算、优化器更新、数据读取和训练循环等问题。PSSA 用 Rust 承担这些工作,意味着项目的阅读价值不仅来自模型结构,也来自它如何把一套通常由深度学习框架提供的能力显式写出来。
这种实现方式对学习者尤其有用。一个只调用高层接口的训练脚本,可以在几十行内启动实验;但它很难回答“一个 token 的误差究竟怎样影响前面的参数”。从零实现的项目则更适合沿着数据流追踪:输入怎样编码,隐藏状态如何更新,预测结果怎样计算损失,损失又怎样转化为参数变化。
Rust 的另一项价值是工程边界更清晰。语言本身会在编译阶段检查许多内存和并发问题,这对于长期运行的训练程序、推理服务或嵌入式部署都有帮助。不过,Rust 不会自动让模型更聪明,也不会自动解决 GPU 算子、分布式训练和数据质量问题。模型效果仍然取决于架构、数据、优化方法和训练规模。
与主流模型路线怎么比较
PSSA 与 Transformer、状态空间模型和传统循环神经网络的差异,主要体现在序列信息的处理方式上,而不是编程语言本身。
| 路线 | 核心机制 | 主要优势 | 主要限制 | 更适合的场景 | |---|---|---|---|---| | Transformer | 通过注意力计算 token 之间的关系 | 训练成熟、扩展性强、生态完整 | 长上下文会带来显存和计算压力 | 通用大模型、复杂推理、代码生成 | | 循环神经网络 | 按顺序更新隐藏状态 | 结构直观、推理状态较小 | 训练并行度低,长距离记忆较弱 | 教学、轻量序列任务 | | 状态空间模型 | 以状态演化表示序列 | 有机会降低长序列处理成本 | 记忆压缩和训练稳定性需要权衡 | 长序列、流式推理、研究实验 | | PSSA | Rust 实现的非 Transformer 语言模型 | 源码完整、便于研究底层流程 | 公开性能和规模信息有限 | 架构学习、Rust AI 实验、模型原理研究 |
从产品角度看,Transformer 仍然占据明显优势。它有成熟的预训练配方、硬件支持、量化工具、推理框架和模型生态,开发者可以直接使用现成模型完成对话、代码、检索增强和多模态任务。PSSA 暂时没有证据表明自己已经具备同等的生态覆盖。
从研究角度看,PSSA 的价值反而更清楚。它没有把问题包装成“参数越大越好”,而是提供了一个可以拆开观察的替代实现。对于想理解序列模型的人来说,这种项目比一份只展示调用方式的模型卡更能说明底层机制。
开发者应该重点看哪些部分
阅读 PSSA 时,最值得关注的是数据流和状态更新,而不是先看项目能不能生成一段像样的文章。
第一,先确认输入表示方式。语言模型需要把文本转换成 token 或数值序列,词表大小、未知词处理、序列切分和训练样本组织,都会直接影响模型能学到什么。一个架构再新,如果输入管线过于简化,也很难支持复杂语言任务。
第二,观察核心状态怎样更新。非 Transformer 模型的关键通常不在一个醒目的类名,而在每个时间步如何组合当前输入、历史状态和可训练参数。这里决定了模型究竟保留了多少历史信息,也决定了推理时能否以流式方式处理文本。
第三,检查训练目标和优化流程。语言模型通常通过预测下一个 token 学习序列规律,但损失函数、学习率、批大小、梯度裁剪和参数初始化,都会改变最终结果。一个“从零实现”的项目,如果只展示前向计算而没有完整训练闭环,它更接近模型演示,而不是可复现实验。
第四,区分 CPU 运行能力和 GPU 训练能力。Rust 代码能够在本地运行,并不等于它已经拥有成熟的 GPU 加速。开发者需要确认项目使用了什么数值计算后端、是否支持并行训练、是否提供混合精度,以及长序列下的实际吞吐量。这些指标比仓库首页的一句“高性能”更有参考价值。
第五,查看评测是否可复现。至少应该明确模型参数量、训练数据规模、上下文长度、硬件环境、训练步数和评测脚本。没有这些信息时,任何“更快”“更省显存”或“效果更好”的结论,都只能算待验证的假设。
PSSA 现在适合谁
PSSA 最适合希望理解语言模型内部机制、同时愿意接触 Rust 和底层数值计算的开发者。
如果你的目标是快速搭建一个生产级问答系统,PSSA 不是优先选择。成熟的开源模型已经提供了更强的能力、更完整的推理工具和更广泛的部署经验。直接使用经过训练和评测的模型,通常比从一个实验性项目开始更节省时间。
如果你的目标是学习模型原理,PSSA 的门槛和收益都比较合适。你可以从词表、数据集和训练循环开始,再逐步追踪状态更新、损失计算和参数优化。这个过程不一定马上得到高质量文本,但能帮助开发者理解“模型会生成什么”背后到底发生了哪些计算。
如果你的目标是研究长上下文和流式推理,PSSA 也值得作为对照样本。它可以帮助开发者思考一个问题:当模型不再依赖显式注意力读取全部历史时,记忆压缩会带来什么收益,又会牺牲哪些精确性。这个问题对本地模型、边缘设备和持续输入场景都有现实意义。
这次开源真正值得关注的地方
PSSA 的重要性不在于它已经证明非 Transformer 模型全面胜出,而在于它把模型架构竞争从论文和商业发布,拉回到了开发者可以直接阅读的代码层面。
近几年,AI 工程逐渐形成了两条路线。一条路线不断扩大模型规模,通过更好的数据、算力和训练配方提升通用能力;另一条路线则试图降低推理成本,探索更适合长上下文、流式处理和本地部署的结构。PSSA 显然属于后者的早期实验。
这条路线短期内不会取代 Transformer。Transformer 的优势来自整个系统,而不只是注意力公式:它拥有大规模预训练经验、成熟硬件内核、完整工具链和大量公开模型。非 Transformer 架构要真正改变现状,必须在多个维度同时证明自己,包括相近质量下的训练成本、更长上下文的稳定性、更低的推理延迟,以及开发者能够接受的部署复杂度。
PSSA 当前最诚实的评价是:它是一份值得拆解的 Rust 模型源码,也是一张关于替代架构的早期实验切片。开发者可以从中学习语言模型如何落地、Rust 如何承载数值计算,以及状态式序列建模与注意力机制之间的真实差异;但在公开基准、规模和生产可用性信息补齐之前,不应把它宣传成 Transformer 的替代品。
编辑判断
PSSA 有用,但它的“用”不在于马上拿来做业务,而在于让开发者重新看见语言模型的内部结构。
对于 AI 深度用户,这个项目提供了一种少见的观察角度:不依赖成熟框架的黑盒封装,用 Rust 把非 Transformer 模型从数据输入到训练输出完整摊开。对于模型研究者,它可以作为理解状态式架构的轻量入口。对于追求现成效果的应用开发者,它暂时更像学习材料,而不是模型采购清单。
接下来最值得等待的数据有四类:PSSA 的参数规模和训练集说明、与同规模 Transformer 的困惑度对比、长上下文下的速度与记忆保持能力,以及在不同硬件上的实际吞吐量。只有这些信息公开后,PSSA 才能从“有意思的开源实现”进一步走向“值得认真比较的模型路线”。
参考来源
- PSSA GitHub 仓库:项目源码、README 和最新更新,是本文关于项目定位与实现方式的主要来源。
- RustGPT 相关介绍:用于说明 Rust 从零实现语言模型这一开发趋势的背景材料;RustGPT 与 PSSA 并非同一项目。
- 知乎关于 Rust 与模型工程的讨论:用于补充 Rust 在 AI 工程和本地化部署方向的行业背景,不作为 PSSA 性能数据来源。



