Apollo上线,AI开始修复古希腊残卷

奥地利科学院联合 Mistral AI 与 Sail Reply 发布 Apollo,这是面向古希腊语的专用大语言模型,训练语料约 6 亿词,可辅助搜索、解读和修复受损莎草纸与铭文。
Apollo上线:Mistral参与打造的古希腊语模型,开始修复莎草纸与铭文
奥地利科学院联合法国 AI 公司 Mistral AI 与 Sail Reply,正式发布了古希腊语大语言模型 Apollo。它不是一个面向大众聊天的通用助手,而是一套专门服务于古典学、历史语言学和考古研究的研究工具:模型可以在数十万份古希腊莎草纸与石刻铭文中进行检索,并根据上下文为残缺文本提出修复候选。
Apollo 的训练语料约包含 6 亿个历史希腊语词汇,来源覆盖手稿、莎草纸、铭文以及已经整理出版的古代文本。研发团队希望借助它,把过去需要资深学者耗费数年完成的文本筛选和初步复原,压缩到数小时甚至更短时间内。
这件事的意义不在于“AI 学会了古希腊语”这么简单,而在于:一批过去几乎无法被系统检索、无法快速归类、只能依靠少数专家逐字处理的历史材料,开始具备了机器可读性。

Apollo 是什么:面向古希腊语研究的专用大模型
Apollo 是一个针对历史古希腊语训练的专用大语言模型,主要用于古代文本检索、语义分析和残缺文本修复。 与 ChatGPT 这类通用模型不同,Apollo 的价值不在于覆盖尽可能多的现代知识,而在于理解古希腊语在不同时代、不同地区和不同文本类型中的变化。
项目由奥地利科学院、Mistral AI 和 Sail Reply 共同推进。奥地利科学院负责古典学和历史文献方面的研究资源,Mistral AI 参与模型与生成式 AI 能力建设,Sail Reply 则提供技术服务和部署支持。根据项目方披露的信息,Apollo 运行在欧洲基础设施上,并强调数据安全与研究资料的保护。
目前,研究人员可以通过聊天机器人界面免费试用 Apollo。它的具体开放范围、模型参数规模、上下文长度和底层架构尚未完全公开,因此不宜把它简单理解为一个“古希腊版的某某通用模型”。Apollo 更像是一个经过专业语料、任务设计和研究流程重新塑造的领域模型。
| 项目 | Apollo 当前公开信息 | |---|---| | 模型定位 | 面向古希腊语研究的专用大语言模型 | | 主要参与方 | 奥地利科学院、Mistral AI、Sail Reply | | 训练语料 | 约 6 亿个历史希腊语词汇 | | 文献类型 | 手稿、莎草纸、石刻铭文及已出版古代文本 | | 主要能力 | 文本检索、语义搜索、残缺文本修复、研究辅助 | | 使用方式 | 通过聊天机器人界面免费使用 | | 公开情况 | 尚未披露完整参数规模、训练细节和统一评测成绩 |
它要解决的,不只是“看不清楚”
古希腊文献的难点并不单纯是文字损坏。很多莎草纸残片即便肉眼可以看到部分笔画,也仍然需要研究者完成一整套复杂判断:识别字母、划分词语、推测文本年代、判断作者或文体,再结合当时的语法、方言和社会背景,决定缺失部分最可能是什么。
古希腊文本修复是一个同时涉及文字识别、历史语言学、文献学和语境推理的综合任务。 这也是 Apollo 与普通 OCR 工具的根本区别。OCR 主要回答“图像里看到了什么”,而 Apollo 试图进一步回答“这里原本可能写了什么”。
古希腊文本还有一个非常具体的技术障碍:许多早期文本并不使用现代意义上的空格分隔单词。研究者需要先判断连续字母应该如何切分,再根据语法和上下文判断词形。一个字符的识别错误,可能会改变整句话的语法结构;一个词边界的判断错误,甚至可能让整段文本产生完全不同的含义。
此外,古希腊语并不是静止不变的单一语言。荷马史诗使用的语言、古典时期雅典文本使用的语言、多利亚方言铭文,以及希腊化时期和罗马时期的书面语,在词汇、语法、拼写和表达习惯上都有差异。
奥地利科学院历史学家、莎草纸研究者 Anna Dolganov 表示,Apollo 可以根据文本类型切换语言背景:遇到荷马文本时,模型会参考荷马时代的语言;遇到多利亚方言石刻铭文时,则会采用相应方言特征。这种能力对于古典学研究非常关键,因为“语法上正确”并不等于“历史上合理”。
Apollo 如何修复一段残缺文本
Apollo 的文本修复可以被理解为一种带有历史约束的概率推断。模型并不是直接从空白处“创造”一句话,而是根据残存字符、上下文、文体、时代和相似文献,计算哪些词句更符合已有证据。
一个典型的研究流程可能包括以下步骤:
- 输入残片信息:研究者提供莎草纸或铭文的图像、转写文本,或者已经识别出的残存字符。
- 识别文本背景:模型判断材料可能属于史诗、戏剧、哲学、宗教、法律、私人书信或行政文书等类型。
- 划分词语与句法结构:对于没有空格的连续文本,模型尝试给出词边界和语法分析。
- 检索相似表达:Apollo 在古希腊语语料中寻找相同词组、同类句式或主题相近的文本。
- 生成修复候选:模型给出一个或多个缺失部分的可能版本,并说明依据。
- 交由学者复核:研究者结合图像、年代、出土地、文献来源和其他证据,决定是否接受或修改建议。
这套流程的核心不是让模型替代学者,而是让模型先完成大量“候选生成”和“资料筛选”工作。过去,研究者可能需要翻阅词典、语料库和大量注释本,逐一确认某种表达是否在特定年代存在;Apollo 可以先把相关材料集中出来,减少人工检索成本。
需要特别强调的是,Apollo 输出的修复结果是候选,不是被证明的原文。语言模型本质上仍然会根据概率生成内容,即使它使用了高度专业的训练语料,也可能把相似文本错误地拼接在一起,或者给出语法合理但历史上不存在的句子。
600 million words 为什么重要
Apollo 的 6 亿词训练语料,重要之处不只是数量,而是它把古希腊语放回了历史时间轴和文献类型中。 对通用大模型而言,现代英语、现代汉语和当代网络文本可以提供海量训练数据;但古希腊语资料分散、版本复杂,很多内容还存在转写差异和学术争议。
Apollo 使用的材料包括数十万份历史文本中的一部分,以及数以万计已经出版的铭文和莎草纸。这样的语料规模可以让模型学习到更细的模式,例如:
- 某个词在古典时期和希腊化时期的用法差异;
- 某类行政文书常见的固定格式;
- 铭文中用于纪念、祭祀、法律和公共事务的惯用表达;
- 不同地区方言在词尾、拼写和语法上的变化;
- 同一主题在史诗、哲学文本和私人书信中的表达差别。
不过,训练数据规模仍然不能自动解决版本和偏差问题。古代文献能够保存至今,本身就不是随机结果。保存较好的往往是重要城市、宗教机构、富裕阶层或特定历史时期的材料。某些群体、地区和日常生活文本可能因为载体更脆弱,反而更少进入数字语料库。
因此,Apollo 未来能发现什么,既取决于模型,也取决于哪些文献已经完成数字化、转写和公开。模型可以在既有材料中找出过去被忽略的关联,但它无法凭空补回从未保存、从未扫描或从未正确转写的历史。
对古典学研究,真正有用的可能是“先筛选,再修复”
Apollo 最现实的价值,可能不是一次性复原一块最著名的残片,而是帮助研究者从庞大的材料库中找出值得关注的对象。
全球高校图书馆、博物馆和研究机构保存着大量莎草纸残片。其中相当一部分没有完整转写,或者只被做过初步目录记录。研究者如果想寻找“古代税收制度”“女性私人书信”“地方宗教仪式”或“某一类法律术语”,过去往往需要熟悉不同机构的目录和出版物,再手动比对文本。
Apollo 可以将研究问题转换为语义层面的检索任务。研究者不一定需要准确记得某个词,而是可以描述一个主题,让模型在不同文本中寻找表达相近、背景相关的材料。这类能力对于古典学尤其重要,因为同一个概念在不同作者、不同方言和不同年代中可能使用不同词汇。
从工作流看,它可能带来三层变化:
第一层:把“不可检索”变成“可以初步检索”
很多残片的内容不完整,传统关键词搜索无法发挥作用。模型可以根据已识别字符、片段语义和上下文,给出主题相关的候选材料。
第二层:把“逐字查资料”变成“批量生成候选”
研究者不再需要从零开始尝试每一种可能的补全文字,而是先查看模型列出的候选,再集中精力处理真正存在争议的地方。
第三层:把研究重点从文字识别推进到历史解释
如果模型能够承担一部分初步转写和修复,学者就有更多时间分析文本背后的制度、社会关系、经济活动和文化传播,而不是把大部分精力放在确认一个缺失词尾上。
这也是 Apollo 与“让 AI 自动替代专家”叙事不同的地方。古典学研究最难的部分,往往不是生成一句看起来通顺的古希腊语,而是判断这句话是否符合具体材料的来源、年代、书写者身份和考古背景。
最大风险:一段“很像真的”错误文本
语言模型用于古籍修复,最大的风险不是输出明显乱码,而是生成一段足够流畅、足够符合语法、却没有可靠证据支持的文本。
在古典文献研究中,流畅度不能等同于真实性,模型置信度也不能替代文献证据。 一段补全内容即使在语言上非常自然,也可能只是模型从相似文本中归纳出的高概率表达,而不是原作者真正写下的句子。
这类风险至少有四种表现:
- 时代错配:模型使用了后世词汇或语法,放入了更早时期的文本中。
- 方言混用:模型把不同地区的语言特征混合在一起,生成“平均化”的古希腊语。
- 文体误判:把史诗、哲学或行政文书的表达方式错误套用到另一种文本上。
- 重复训练偏差:某些著名作品在语料中出现频率较高,模型可能过度倾向于使用其中的固定表达。
因此,Apollo 如果要真正进入严肃研究流程,输出最好同时提供候选排名、引用依据、相似文本位置、词形解释和不确定性说明,而不是只给出一条确定答案。研究者也需要保留原始图像、模型输入、候选结果和最终人工修改记录,确保未来能够追溯每一次修复是如何完成的。
它和普通多模态模型有什么不同
Apollo 被项目方称为面向古代语言的先进多模态大语言模型,但目前公开信息尚未披露完整的模型结构、参数量和视觉编码器细节。因此,现阶段更准确的理解是:它的目标不仅是处理纯文本,还计划结合手稿、铭文图像和手写文字等视觉材料,形成从图像到文本、再到历史语境分析的完整链路。
普通多模态模型通常可以识别图片中的现代印刷体、表格或自然场景;古代莎草纸则更加棘手。墨迹可能褪色,纸张可能折叠、撕裂或被覆盖,石刻表面也可能存在磨损。模型需要区分真实笔画、裂纹、污渍和后期修补痕迹,这不是一般图像问答能够直接解决的问题。
如果 Apollo 后续能够把图像识别、古文字转写和语言模型推断结合起来,它的能力边界会明显超过单纯的文本生成器:研究者上传一张残片照片,模型先识别可见字符,再分析词边界,最后给出结合时代和文体的修复建议。这个过程仍然需要人工确认,但会减少大量机械性工作。
目前,项目方已经将手写文本识别、语义搜索和更广泛的历史文献分析列为后续发展方向。至于这些功能何时开放、准确率如何,以及是否会提供标准化评测,仍需等待后续信息。
Mistral 参与的意义:领域模型不一定要从零造一个巨兽
Apollo 还有一个值得关注的信号:一个高度垂直的历史语言项目,选择与 Mistral AI 这样的通用模型公司合作,而不是完全由学术机构独立开发。
对于研究机构来说,直接训练一个覆盖数亿词语料、同时具备现代推理和多模态能力的大模型,成本和工程复杂度都很高。模型训练、数据清洗、推理部署、安全控制和用户界面,任何一环都可能成为项目瓶颈。Mistral 的参与,能够把成熟的模型技术和部署经验带入一个规模较小但专业门槛极高的领域。
但 Apollo 也说明,领域模型的竞争不只看参数规模。一个模型即使比通用模型小得多,只要训练资料足够聚焦、任务定义足够清楚、评测方式贴近真实工作流,也可能在特定任务上更有用。
可以把通用大模型比作一座大型综合图书馆,而 Apollo 更像一间配备专家目录系统的古典学研究室。前者知识面更广,后者未必能回答所有问题,但更清楚哪些版本可靠、哪些词属于哪个时代、哪些表达可能来自特定地区。
对开发者和 AI 产品的启发
Apollo 并不是面向普通消费者的热门聊天产品,却提供了一个很有代表性的模型产品方向:把通用模型能力嵌入一个数据稀缺、专家密集、任务流程明确的行业。
这类模型的产品价值通常来自四个部分:
- 高质量专业数据:不是简单抓取网页,而是建立经过整理、标注和版本控制的语料库。
- 领域任务设计:模型需要围绕检索、转写、修复和证据追踪设计,而不是只追求聊天效果。
- 专家反馈闭环:古典学者的修改结果可以反过来改善训练数据和评测体系。
- 可追溯输出:模型必须说明建议来自哪些材料,并保留不确定性,避免把推测包装成事实。
这对法律、医学、金融、工业维修和地方历史档案等领域同样适用。真正有价值的领域模型,往往不是“什么都能聊”,而是能在一个高价值、低容错的流程里稳定减少重复劳动。
OpenAI Hub 观察:Apollo 更像研究副驾驶,而不是自动考古学家
Apollo 的发布值得关注,但不应被夸大为“AI 已经能够自动破解古代文明”。截至目前,公开资料主要证明了它拥有专门语料、古希腊语建模和文本修复目标,并没有公布足够完整的统一基准测试,来证明它在所有古希腊语任务上都优于通用模型或资深学者。
我们的判断是:Apollo 最可能首先在三个场景中产生实际价值。
- 大规模材料初筛:从数十万份残片中快速找到与研究主题相关的内容。
- 修复候选生成:为专家提供多个可能词句,减少从零开始查找的时间。
- 跨文本关联发现:把分散在不同作者、地区和年代的相似表达连接起来。
它暂时不适合承担最终定稿、独立发表或替代专家判断的工作。对于真正重要的铭文和莎草纸,每一个字母都可能影响历史结论,模型生成的答案必须回到原始图像、考古记录和学术版本中验证。
但即便如此,Apollo 仍然代表了一个明确趋势:AI 的下一轮落地不一定发生在更大的聊天机器人上,也可能发生在那些长期被认为“数据太少、专业门槛太高、无法自动化”的领域。
古希腊莎草纸只是一个开始。随着博物馆和高校继续数字化馆藏,类似模型未来可能被用于拉丁文手稿、古埃及文字、楔形文字、敦煌文献以及濒危语言研究。它们不会替代历史学家,但可能让更多过去沉默的材料重新进入可检索、可比较、可讨论的知识系统。
参考来源
- IT之家:Apollo 大语言模型问世,专门用于解读古希腊莎草纸残片 —— 介绍 Apollo 的发布背景、参与机构、训练语料规模和莎草纸修复场景。
Apollo 的下一步,不是证明机器可以独立写出一部古希腊史,而是让研究者更快找到那些原本藏在碎片、裂痕和模糊字迹里的线索。对于古典学来说,这已经足够重要。


