ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

400页书塞不进AI上下文?book-to-skill 节省24-51倍Token的数学原理

400页书塞不进AI上下文?book-to-skill 节省24-51倍Token的数学原理 400页书塞不进AI上下文book-to-skill 节省24-51倍Token的数学原理【免费下载链接】book-to-skillTurn any technical book PDF into a Claude Code skill — ready to study, reference, and use while you work.项目地址: https://gitcode.com/GitHub_Trending/bo/book-to-skill你是不是也有过这种体验把一本 400 页的技术书丢给 AI 助手结果它要么答非所问要么直接说我没有这本书的内容开源项目book-to-skill专门解决这个痛点它能把 PDF、EPUB、DOCX 等技术书转换成一个 AI 智能体技能Agent Skill让 Claude Code、Copilot CLI 等助手按需读取章节、精准作答——实测比整本书塞进上下文节省24–51 倍 Token。这篇文章带你从数学角度拆解这个节省到底是怎么算出来的。为什么 400 页书塞不进 AI 上下文先算一笔账。一本 400 页左右的书转成纯文本大约是200K Token约 15 万个英文单词。直接把它丢进上下文有三个绕不开的问题每一轮对话都要重复付费——大模型按 Token 计费整本书常驻上下文意味着每次提问都重新消耗一遍这笔费用而且是每一轮、永久。注意力稀释Lost in the Middle——上下文塞得越满模型对埋在中部内容的检索精度越低。️塞进去的只是原文——模型每轮还得重新解析原始文本而不是现成的框架和结论。所以真正的问题不是能不能装下而是值不值得每次都装。核心数学原理把成本从运行时搬到编译时book-to-skill 的全部数学其实就藏在一个公式里常驻成本 ≈ SKILL.md 核心~4,000 Token 按需加载的单个章节~1,000 Token≈ 5,000 Token对比一下整书入上下文策略以官方实测的三本书为例书籍整书 Token智能体翻书模式book-to-skill节省倍数Think Python 2小119,26412,152~5,00024×Working Backwards中175,25333,444~5,00035×AI Engineering大256,28777,866~5,00051×两个关键概念值得展开发现循环税Discovery Loop Tax即使不整本书入上下文让 AI 现场翻 PDF也很贵它要反复读目录、定位章节、回退补定义每一轮都在重新支付这些导航 Token。这就是发现循环税。书中章节越大这笔税越重——上表中 AI Engineering 的发现循环高达 77,866 Token。编译一次按需加载book-to-skill 的策略是转换阶段一次性支付结构化成本约 $1/本书生成后常驻上下文的核心只有 ~4K Token章节文件放在磁盘上睡着只有你问到对应主题时才被唤醒加载。于是整书策略成本 256,287 Token /每一轮对话技能策略成本 5,000 Token / 每轮对话256,287 ÷ 5,000 ≈ 51这就是51 倍的来历。书越大倍数越高——因为它只增长分子不增长分母。生成物长什么样小而密的技能包转换完成后你会得到一个目录每个文件都有明确的 Token 预算详见 SKILL.md 中的规格定义文件作用Token 预算SKILL.md核心心智模型 章节/主题索引~4,000chapters/ch01-*.md每章一个文件按需加载各 ~1,000glossary.md全部关键术语带章节引用~1,500patterns.md技巧、算法、设计模式~2,000cheatsheet.md决策表与速查规则~1,000注意设计原则是密度优先于完整性——一个 1,000 Token 的高密度摘要胜过 10,000 Token 的原文摘抄。快速上手三步生成你的书籍技能安装克隆到对应助手的技能目录Claude Code 为例git clone https://gitcode.com/GitHub_Trending/bo/book-to-skill ~/.claude/skills/book-to-skill转换在会话中输入/book-to-skill ~/books/my-book.pdf它会自动判断书籍类型技术书/纯文本书、选择解析工具然后生成技能。使用输入/my-book 主题关键词助手会读取正确的章节、基于真实内容作答。完整用法和示例见 docs/usage.md支持的主机与安装方式见 docs/install.md。这些数字是怎么测出来的文中所有数字均为实测而非估算Token 计数使用tiktokencl100k_base 编码发现循环模型由 tools/discovery_tax.py 实现——它复用提取器的真实章节/目录检测逻辑用书中真实的 Token 尺寸建模并诚实标注了哪些是测量、哪些是带假设的模型。完整方法学与每本书的数据表见 docs/performance.md生成流程的完整步骤见 docs/how-it-works.md。小结400 页书 ≈ 200K Token塞进上下文 每轮对话重复付费book-to-skill 把结构化成本移到编译时一次性约 $1 的转换换来每轮仅 ~5,000 Token 的常驻成本实测节省24–51×vs 整书入上下文和2.4–15.6×vs 现场翻书它做的不是检索而是编译输出的是作者花多年构建的框架、决策规则和反模式供 AI 直接推理使用如果你有一本反复查阅的技术书把它变成技能可能是今年性价比最高的一笔 Token 投资。【免费下载链接】book-to-skillTurn any technical book PDF into a Claude Code skill — ready to study, reference, and use while you work.项目地址: https://gitcode.com/GitHub_Trending/bo/book-to-skill创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表