免费导出 Business 对话

开源工具 scrapemychats 可将当前账号有权访问的 ChatGPT Business 对话批量保存到本地,补上官方导出入口不完整留下的空缺,但使用前必须处理好权限、会话凭据与企业数据合规问题。
scrapemychats:免费导出 ChatGPT Business 对话
ChatGPT Business 用户现在多了一个免费的本地备份方案。近日受到开发者关注的开源工具 scrapemychats,可以借助用户已经登录的 ChatGPT 浏览器会话,抓取其在 Business 工作区内有权访问的历史对话,并将结果保存到本地。
**scrapemychats 是一个面向 ChatGPT Business 工作区的开源对话导出工具。**它解决的不是“如何把当前页面打印成 PDF”,而是如何批量取回散落在侧边栏中的历史会话,适合离职交接、知识库迁移、审计留档以及团队更换 AI 工具前的数据盘点。
这件事看起来只是“导出聊天”,实际击中了 ChatGPT Business 的一个长期痛点:个人 ChatGPT 账户通常可以在数据控制页面申请数据副本,但 Business 工作区中的数据可携带性受工作区类型、管理员策略和产品界面限制,并不总能沿用个人账户的导出流程。用户能在网页里逐条打开对话,却未必有一个同样直接的批量导出按钮。
scrapemychats 的价值很明确:它把网页端已经允许用户查看的内容自动化收集下来,价格是 0 美元,也不要求为一次性迁移任务购买企业级归档产品。不过,它仍然属于依赖 ChatGPT 网页结构和登录状态的非官方工具,稳定性、安全性与长期兼容性都不能按官方功能看待。

它和普通“导出当前对话”工具不是一回事
**批量工作区导出与单页格式转换是两类不同需求。**常见浏览器扩展擅长把当前打开的会话转换为 Markdown、PDF、图片或纯文本,优点是操作直观、排版漂亮;scrapemychats 更关心的是批量获取会话,以及尽可能减少逐条点击和手工复制。
| 方案 | 覆盖范围 | 是否适合批量迁移 | 主要优点 | 主要限制 | |---|---|---:|---|---| | ChatGPT 个人账户官方数据导出 | 个人账户中的可导出数据 | 是 | 官方提供,数据类型通常更完整 | Business 工作区不一定提供相同入口或范围 | | 浏览器“当前对话导出”扩展 | 当前打开的一条或少量对话 | 否 | PDF、图片、Markdown 等格式丰富 | 数百条会话时操作成本很高 | | scrapemychats | 当前用户可访问的 Business 会话 | 是 | 免费、开源、面向批量取回 | 依赖网页与内部请求行为,可能随 ChatGPT 更新失效 | | 企业归档或合规系统 | 取决于管理员配置与产品能力 | 是 | 权限、审计和保留策略更规范 | 部署与采购成本较高,个人成员通常无法自行配置 |
**scrapemychats 最适合“我看得到这些聊天,但没有方便的批量导出入口”这一场景。**如果只有三五条关键会话,直接复制或使用单页导出扩展反而更省事;如果侧边栏里积累了数百条项目讨论、代码分析和研究记录,自动化工具才真正有意义。
它是怎么工作的
**scrapemychats 的基本原理是复用用户自己的已登录会话,在本地自动遍历和保存可见对话。**它不是从模型侧恢复历史,也无法绕过工作区权限;本质上只是把浏览器中原本需要人工完成的“列出会话—打开会话—读取内容—写入文件”过程自动化。
这类工具一般包含两个阶段。第一阶段获取账号当前能够看到的会话列表,第二阶段逐个请求会话详情并写入本地。它比直接解析屏幕文字更有效率,因为聊天页面中还存在角色、时间、消息顺序和分支结构等信息,仅靠复制页面很容易丢失这些上下文。
**导出能力的上限就是当前账号权限的上限。**已经删除的聊天、因保留策略到期而清除的数据、其他成员的私有会话,以及管理员未授权访问的内容,都不会因为运行 scrapemychats 而重新出现。若某条会话在网页端已经无法打开,工具通常也没有数据来源。
**工具能否持续工作取决于 ChatGPT 网页端是否改变。**ChatGPT 的前端路由、请求参数、身份验证方式和工作区标识都可能更新,因此今天可用的抓取逻辑,未来可能因一次前端改版而需要修复。它更像一次性迁移工具,而不是可以无人值守运行数年的企业备份系统。
实战:先验证,再批量导出
**最稳妥的使用方法是先做小批量验证,而不是登录后立刻抓取整个工作区。**Business 会话往往包含源代码、客户材料、内部文档和个人信息,一旦目录选错、同步到公共网盘或被其他程序索引,风险比丢几条聊天记录更大。
第一步:确认你有权导出这些内容
**权限确认应该先于任何技术操作。**个人创建的对话不等于个人可以任意带走的数据,尤其是在公司付费的 Business 工作区里,会话内容可能属于组织资产,并受劳动合同、客户保密条款、数据处理协议或行业监管要求约束。
开始前至少确认三件事:
- 工作区管理员是否允许成员导出业务对话;
- 对话中是否包含客户隐私、访问凭据、未发布代码或受监管数据;
- 导出文件应该保存在哪里、保留多久以及由谁负责删除。
**管理员授权不能被工具本身替代。**scrapemychats 能运行,只能说明技术上可以读取当前页面,不能证明组织已经批准数据迁移。
第二步:从官方仓库取得源代码并记录版本
**从项目官方仓库下载代码可以降低拿到篡改版本的概率。**截至 2026 年 7 月 23 日,项目的权威入口是 Conradqh 名下的 GitHub 仓库,安装方式和依赖要求应以仓库当前 README、提交记录及锁定文件为准。
git clone https://github.com/Conradqh/scrapemychats.git
cd scrapemychats
git rev-parse HEAD
最后一条命令会输出本次使用的提交哈希,建议将它和导出日期一起保存。开源项目可能在几天内连续更新,如果之后出现字段缺失或文件损坏,提交哈希能帮助定位究竟使用了哪个版本。
**安装依赖前应该先检查仓库内容。**重点查看 README、LICENSE、依赖锁定文件、浏览器自动化脚本以及文件写入位置,不要只因为项目开源就默认每一行代码都已经过安全审计。若仓库提供 Release,还应核对发布者、校验信息和对应源代码。
第三步:使用隔离的浏览器环境登录
**独立浏览器配置可以减少现有 Cookie、扩展程序和个人账号之间的相互影响。**如果项目会启动自动化浏览器,应优先使用它创建的专用配置目录;如果需要连接已有浏览器,也建议新建一个只用于此次导出的配置文件。
登录时应手动访问 ChatGPT 并完成组织要求的验证流程,不要把密码、Cookie、会话文件或其他身份凭据粘贴给第三方网页。若公司采用单点登录,仍应通过正常的组织登录页面完成认证。
**选择工作区时必须核对名称与账号。**同一个用户可能同时拥有个人空间和多个 Business 工作区,抓错空间最常见的结果不是报错,而是导出数量明显不对。开始前可以记下侧边栏大致会话数,并挑选三条标题、时间和内容差异明显的会话作为样本。
第四步:先导出少量样本
**小样本测试可以提前暴露分页、分支消息和附件缺失问题。**建议先选择 3 至 10 条会话,至少覆盖以下类型:
- 一条只有文字的短对话;
- 一条消息数量较多的长对话;
- 一条使用过重新生成、编辑提示词或分支功能的对话;
- 一条包含上传文件、图片或数据分析结果的对话;
- 一条较早创建、后来又继续使用的历史对话。
测试完成后,不要只看文件是否生成,还要逐条检查标题、用户消息、助手回复、顺序、代码块和时间信息。网页里显示的附件名称不代表附件二进制文件也一定被下载,图片、上传文档、Canvas 内容、语音和数据分析产物尤其需要单独核验。
**导出文本与完整账户备份不是同义词。**对话正文能够落盘,不代表共享链接状态、GPT 配置、项目文件、附件原件、成员权限和审计日志都被包含。迁移前应按实际输出文件检查,而不是根据“导出成功”四个字推断数据已经完整。
第五步:执行批量导出
**批量运行期间应保持网络、登录会话和目标工作区稳定。**不要同时切换账号、退出登录、关闭自动化浏览器或大量修改对话,因为这些操作可能造成分页重复、请求中断或部分文件只写入一半。
大量历史对话通常需要分批读取,实际耗时取决于会话数量、每条对话长度、网络延迟以及 ChatGPT 的请求限制。工具若出现暂时失败,不宜通过高并发反复重试;更稳妥的做法是降低速度、从断点继续,或者按时间范围拆成多次任务。
**导出数量应该和网页端可见范围进行交叉检查。**侧边栏可能采用懒加载,归档会话也可能不在默认列表中,因此“程序跑完”不等于“所有会话都被发现”。至少要记录以下四项:
- 工具报告的会话总数;
- 实际生成的文件数量;
- 成功、失败和跳过的数量;
- 最早与最晚一条会话的日期。
如果数量差距明显,应先检查空间是否选错、列表是否加载完整、归档内容是否被覆盖,以及登录会话是否在途中失效。
第六步:校验并封存结果
**校验清单可以证明文件在迁移后没有被悄悄修改。**完成抽样检查后,可以为导出目录生成 SHA-256 清单;下面的“导出目录”需要替换成实际路径。
find "导出目录" -type f -exec shasum -a 256 {} \; > manifest.sha256
Linux 环境也可以使用 sha256sum。校验清单应该和压缩包分开保存,必要时再使用组织批准的加密工具封装文件。单纯压缩不是加密,把包含企业对话的 ZIP 文件放进普通同步目录同样可能造成泄露。
**本地备份至少需要两份,但不应无限复制。**一个更合理的方案是:工作副本用于检索和格式转换,归档副本使用加密存储并限制访问;迁移确认完成后,删除浏览器自动化产生的临时用户目录、缓存和无用中间文件。
这些坑比安装失败更值得注意
**最大的安全风险不是代码报错,而是登录凭据与明文数据同时落在不受控设备上。**自动化工具需要在某种程度上使用现有登录状态,因此运行它的电脑应当可信,磁盘应启用加密,并避免使用装有大量来历不明扩展的日常浏览器环境。
**附件缺失是第二个容易被忽略的问题。**很多导出工具保存的是消息结构和附件引用,而不是附件原件;即便文件名仍在,原始下载地址也可能带有时效限制。对于关键 PDF、表格、图片和分析输出,应该在导出完成后逐项确认是否能离线打开。
**消息分支会让“完整对话”变得比想象中复杂。**ChatGPT 支持编辑旧提示词和重新生成回答,一条会话可能实际上是一棵树,而网页只展示当前选中的路径。若工具只保存可见分支,其他生成结果可能不会出现,因此涉及决策记录或审计时必须人工核验。
**网页更新会造成静默缺失。**最危险的情况并非程序直接崩溃,而是它仍然输出文件,却漏掉新增加的消息类型。每次 ChatGPT 大幅调整界面后,都应该重新做样本测试,并查看项目 Issues 中是否有人报告兼容性问题。
值不值得用
**scrapemychats 是一个实用但边界清晰的补丁。**它免费、源码可检查,也把数百次人工点击压缩成一次批处理,对于需要离开 Business 工作区、整理个人工作知识或迁移到其他系统的用户很有价值。
**scrapemychats 不能替代企业级数据治理。**它没有天然解决管理员审批、保留周期、访问审计、法律留置和附件完整性等问题,也不应该被包装成持续可靠的官方备份方案。团队如果需要周期性归档,正确方向仍然是先梳理工作区政策和正式管理能力,再把开源工具作为一次性补充。
最终判断很简单:少量会话用单页导出,数百条自己有权访问的 Business 对话可以尝试 scrapemychats,涉及全员数据与监管要求则交给管理员和合规系统。它真正有用的地方,不是做出更漂亮的 PDF,而是让用户在工作区权限消失之前,把本来就能看到的知识资产有组织地保存下来。
参考来源
- Conradqh/scrapemychats:项目官方 GitHub 仓库,包含源代码、最新安装说明、提交记录及问题反馈入口。
- huhusmang/ChatGPT-Exporter:另一种支持个人空间和团队空间的批量导出实现,可用于比较浏览器扩展、用户脚本与自动化抓取方案的差异。



