
AI 写论文的能力越来越强但你细看数据和方法描述总能发现几处编造。PaperRecon 这个评估框架把现象量化了Claude Code 平均每篇编造 10.4 个硬错误。这个数字太扎眼我当天就想复现复现需要的 API 通道我直接选择了 TaoToken——在 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 创建 Key然后把 Claude Code 的 Base URL 填成 https://taotoken.net/api。跑完整套评估之后结论没变TaoToken 只负责把请求送到模型那边PaperRecon 的评估逻辑不依赖平台私有字段换通道不会引入新变量。如果你也想亲手验证「Claude Code 写得好但编得多」这个 trade-off下面这份笔记按「拿 Key → 改 Base URL → 重建论文 → 双轴评估 → 核对用量」的顺序走了一遍顺手把我踩过的两个配置坑也标了出来。整个过程只需要一个 TaoToken API Key不需要在多家模型服务商的控制台之间来回跳。1. PaperRecon 为什么值得复现一次1.1 从「论文重建」到「双轴评估」PaperRecon 和其他 AI 论文评估方法最大的区别是不让 AI 从零写一篇论文然后凭感觉打分。它从已发表的论文里抽出压缩信息做成一份平均 463 词的research_overview.md再把这些最小资源交给 coding agent让 agent 重建整篇论文。因为原文就在那里agent 写了什么、漏了什么、编了什么都有明确的 ground truth 可以对照。评估被拆成两个正交维度表现力Presentation和幻觉Hallucination。表现力用 rubric 打分每个 section 预先列好关键要素按 1-5 分逐项评估幻觉则是两阶段检测先用大模型提取并分类所有 claim分成 Supported、Neutral、Contradictory 三类其中跟原文直接冲突的 Contradictory 才是幻觉再交给 Claude Code 复核一次减少误报。这个设计的巧妙之处在于它不靠「读起来顺不顺」来判断而是看 agent 是否忠实还原了原文的信息结构。1.2 51 篇论文测出来的三个结论作者构建的 PaperWrite-Bench 包含 51 篇 2025 年之后的顶会论文覆盖 ML、CV、Multimedia、NLP 四个方向每个 section 预先构建 rubric。主实验跑完有三个值得记住的结论。Claude CodeSonnet 4.6表现力全面领先平均 3.86 分但每篇论文平均出现 10.4 个幻觉CodexGPT-5.4幻觉只有约 3 个表现力却只有 3.59。这两个轴没有同时赢。Method 和 Experiment 是幻觉重灾区因为技术细节、数值、实验设置最容易让模型「自信地编造」Related Work 是所有 agent 的共同短板最高只有 3.08 分靠 463 词的 overview 很难重建出文献脉络的层次感。这三个结论用文字看是一回事自己跑一遍是另一回事——尤其是当你需要把一个模型服务商的 Base URL 换成另一个时评估结果稳不稳直接决定这个框架能不能用于日常写作质量监控。2. 准备材料分清官网落地页和接口 Base URL2.1 一个 Key 同时喂给 Claude Code 和 Codex先打开 TaoToken 注册账号进入控制台创建 API Key然后去模型广场找到你想用的模型 ID。这里要特别记住一个容易混淆的点浏览器打开的落地页和填进工具的接口地址不是一回事。用途地址说明注册、创建 Key、看模型广场、看用量https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end用浏览器打开填进 Claude Code / Codex / CC Switch 的 Base URLhttps://taotoken.net/api末尾不要加 /v1如果你复现 PaperRecon 主实验需要同时准备两个 agent 的模型 ID一个用于 Claude Code一个用于 Codex。当前模型广场列出了哪些 coding 场景的模型 ID以你打开页面时看到的列表为准不要照抄博客截图里的旧名字。创建完 Key 之后把它保存为YOUR_API_KEY占位符接下来的配置文件里统一用这个占位符指代。2.2 先想清楚要复现哪张表PaperRecon 的实验结果有三张主表表现力 rubric 表、幻觉统计表、引用评估表。如果你想完整复现需要准备两套资源和两个 agent如果你只想验证「换 Base URL 后幻觉评估是否稳定」那么只需要拿 1-2 篇论文、只跑 Claude Code 单 agent 即可。后面第 4 章的步骤按单篇最小复原来写整篇论文重建的篇幅留给硬核玩家自己扩展。3. Claude Code 的 Base URL 换到 TaoToken三种配置写法3.1 环境变量临时跑一轮最快只跑一次 PaperRecon 重建的话不需要改任何全局配置直接在当前终端里导出环境变量即可。Claude Code 原生读ANTHROPIC_BASE_URL、ANTHROPIC_AUTH_TOKEN、ANTHROPIC_MODEL三个变量export ANTHROPIC_BASE_URLhttps://taotoken.net/api export ANTHROPIC_AUTH_TOKENYOUR_API_KEY export ANTHROPIC_MODELYOUR_MODEL_ID注意ANTHROPIC_BASE_URL只填到https://taotoken.net/api不要带/v1。Claude Code 内部会按 Anthropic SDK 的习惯自动拼接/v1/messages如果你手动写成/api/v1请求路径会变成/api/v1/v1/messages直接 404。这种临时配置适合先跑通一条测试消息确认 Key 和模型 ID 没有问题再进入正式的论文重建。3.2 settings.json把配置固定到项目里PaperRecon 的评估流程通常要反复跑多轮编译和幻觉复核每次都 export 三个变量太容易漏。更稳妥的做法是写到 Claude Code 的配置文件里。用户级配置放在~/.claude/settings.json项目级配置放在当前项目根目录的.claude/settings.json项目级会覆盖用户级同名变量{ env: { ANTHROPIC_BASE_URL: https://taotoken.net/api, ANTHROPIC_AUTH_TOKEN: YOUR_API_KEY, ANTHROPIC_MODEL: YOUR_MODEL_ID } }保存后重新打开终端跑一句claude -p 请复述PaperRecon 评估的是表现力和幻觉两个维度如果模型正常回答说明 Base URL 和 Key 已经生效。YOUR_MODEL_ID请替换成你在模型广场复制的当前 ID不同时间点的模型列表可能不同以页面显示为准。3.3 顺带跑 Codex 对比组config.toml 的正确写法PaperRecon 主实验对比了 Claude Code 和 Codex如果你的复现计划包含 trade-off 验证Codex 也需要配置。Codex 不读ANTHROPIC_*变量它用的是~/.codex/config.toml里的model_providermodel YOUR_MODEL_ID model_provider taotoken [model_providers.taotoken] name TaoToken API base_url https://taotoken.net/api env_key TAOTOKEN_API_KEY启动 Codex 之前先在终端里执行export TAOTOKEN_API_KEYYOUR_API_KEYCodex 会从env_key指定的环境变量里读取 Key而不会碰ANTHROPIC_AUTH_TOKEN。这一点容易踩坑把 Claude Code 那套变量名套到 Codex 上Codex 会一直报认证失败但你又找不到哪里写错。提示不论哪种工具Base URL 统一填https://taotoken.net/api。官网落地页是给人注册、创建 Key、看用量用的不能填进工具的 base_url 配置里。4. 在 TaoToken 通道上重跑 PaperRecon 的评估流程4.1 最小资源一份 research_overview.md而不是让 AI 从零开写评估的第一步是准备最小资源。PaperRecon 的做法是从原始论文提取结构化摘要加上图表、参考文献、代码路径。我自己跑的时候用这个模板# research_overview.md - 论文标题、发表会议、核心任务定义 - Method 的 3 个关键步骤编号列出 - Experiment 用到的基准名称、评估指标、代表性数值 - 图表文件的相对路径与 bib 引用 key 列表overview 的长度直接影响结果论文消融实验显示默认 463 词时 Sonnet 4.6 幻觉是 9.8 个把 overview 加长到 1492 词之后幻觉降到 2.3。这说明给 agent 的信息越充分幻觉越低。所以复现时不要刻意压缩 overview每篇论文 400-600 词是合理下限关键数值和方法步骤尽量写全。4.2 LaTeX 编译反馈循环Claude Code 生成本地编译报错贴回配置好 Base URL 之后Claude Code 会用 TaoToken 通道消费 Token 生成 LaTeX。PaperRecon 的写作 pipeline 很简单只包含一个编译反馈循环和一个页数调整步骤。我把这个循环还原成三句指令让 Claude Code 基于 overview 写出完整 LaTeX 源码我在本地执行pdflatex编译如果报错把终端输出贴回对话让它修。pdflatex -interactionnonstopmode paper.tex这个循环的价值在于它强迫 agent 面对真实的编译错误而不是生成一份「看起来差不多」的 LaTeX。Claude Code 在 Method 和 Experiment 部分最容易编造图表数值编译反馈只能保证语法正确数值对错需要靠后面的幻觉评估来抓。4.3 双轴评估怎么判rubric 打分 两阶段幻觉核对重建完成后评估分两条线走。表现力这条线用预先构建的 rubric 给每个 section 打分1 分是完全缺失5 分是准确描述图表也要检查是否出现在正确的 section 上下文里。幻觉这条线用两阶段方案先从生成论文里提取 claim标成 Supported、Neutral、Contradictory再把所有 Contradictory 汇总交给 Claude Code 拿原文完整资源复核一遍。这个两阶段设计在实际跑的时候很省心粗筛阶段宁可多抓复核阶段只在 1 次 agent 调用里修正误报。人工抽查验证过被标成 major contradictory 的 claim 里有 96% 确实是真幻觉说明这个流程不是自娱自乐。最后还可以对比一下两篇论文的 bib 引用 key算 Precision、Recall、F1顺带检查有没有引用了 bib 文件里不存在的 key。4.4 结果对照写得好与写得对仍是 trade-off我用 Claude Code 和 Codex 各跑了两篇论文得到的趋势和论文原始结果一致。下表是论文里两个代表性数值复现时以你实际跑出的结果为准因为模型版本和 overview 长度都会影响绝对分数。Agent表现力均值幻觉总量CodexGPT-5.43.593.0Claude CodeSonnet 4.63.8610.4Claude Code 写出来的 Method 和 Experiment 部分确实更完整读起来更顺但幻觉密度明显更高Codex 谨慎很多代价是表现力平庸。这个 trade-off 在换到 TaoToken 通道之后没有改变也说明 Base URL 只影响请求投递不影响模型的生成行为。跑完这一步打开 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 进控制台看一眼本次调用的 Token 消耗顺手确认刚才那一轮评估确实记上了账。5. 复现时最容易翻车的三个配置点5.1 Base URL 多写了一个 /v1Claude Code 默认会在ANTHROPIC_BASE_URL后面拼接/v1/messages。我第一次把 Base URL 填成了https://taotoken.net/api/v1结果请求路径变成/api/v1/v1/messages终端报 404。正确写法就是https://taotoken.net/api尾部的/v1由 Claude Code 自己补。5.2 把官网落地页当成接口地址浏览器里打开的 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 是控制台用来注册、创建 Key、选模型、看用量工具里填的接口地址是https://taotoken.net/api。这两个地址混用会导致工具请求打到网页服务上返回一堆 HTML 而不是模型响应。配置完先跑一条短消息验证别直接整篇重建。5.3 模型 ID 照抄旧截图以及 Codex 套用 ANTHROPIC_* 变量模型 ID 会随模型广场的列表更新过了一段时间之后博客截图里的 ID 可能已经不在列表里。配置前重新进模型广场复制当前的 ID。Codex 方面它不读ANTHROPIC_BASE_URL和ANTHROPIC_AUTH_TOKEN只认config.toml里model_provider对应的env_key把 Claude Code 那套环境变量原样搬给 Codex只会得到认证失败。注意settings.json 改完最好运行claude config list确认变量实际生效。如果你同时有用户级和项目级配置项目级会覆盖用户级排查时先分清改的是哪一个文件。6. 跑完这轮评估去控制台对一下账6.1 先确认这次调用有没有记上账配置完成且评估跑完后第一件事是去 TaoToken 模型对话 用同一把 Key 发一条测试消息确认模型 ID 和 Base URL 没有填错。然后再回控制台 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 查看调用记录和 Token 消耗核对刚才 Claude Code 生成 LaTeX 的那几轮对话是否都出现在用量列表里。6.2 从单篇复现到整套基准先算清 Token 账单PaperRecon 完整基准有 51 篇论文全量跑一遍的 Token 消耗不是小数目。如果只是验证「换通道后评估是否一致」1-2 篇足够了如果想往整套 PaperWrite-Bench 扩展建议先打开 Coding Plan 看一下套餐额度是否覆盖别跑到一半才发现 Key 余额不够。Key 不够用的话去 控制台 API Keys 新建一个把新 Key 换进配置文件重跑即可。Claude Code 的环境变量参考写法也可以直接对照 接入文档里面列了ANTHROPIC_BASE_URL、ANTHROPIC_AUTH_TOKEN、ANTHROPIC_MODEL的完整说明。复现完这轮评估我对那个 trade-off 的感受更具体了Method 和 Experiment 里的幻觉不是模型偶尔抽风而是它在补全缺失细节时倾向「自信地编造」。Base URL 换到 TaoToken 只是让这个行为稳定地暴露出来评估框架本身没有失真。