book-to-skill 实战指南:把任何技术书籍一键转换为多 Agent 按需加载的结构化技能
【免费下载链接】book-to-skillTurn any technical book PDF into a Claude Code skill — ready to study, reference, and use while you work.项目地址: https://gitcode.com/GitHub_Trending/bo/book-to-skill
导读
book-to-skill 是当前仓库的核心项目:一个把 PDF、EPUB、DOCX、HTML、Markdown、RTF、MOBI/AZW 等技术书籍与文档转换为结构化 Agent 技能(SKILL.md)的转换器,其输出可直接运行在 Claude Code、GitHub Copilot CLI、Amp 与 Hermes Agent 等支持开放 Agent Skills 标准的宿主上。读完本文,你将掌握它的核心设计理念("提取结构,而非摘要")、两种安装路径(Agent 技能与独立 CLI)、四种操作模式、按需章节与 token 预算机制,以及它在源码层面的实现证据。
一、为什么需要 book-to-skill:知识的"读过即忘"困境
项目 README(README.md)描述了一个几乎所有技术读者都经历过的场景:你买了一本好书,通读一遍,三个月后却连"第 7 章讲过什么"都记不清了。常规的补救手段各有缺陷:
- "直接搜 PDF":得到的是一串页码,而不是答案;
- "让 Agent 直接回答这本书":Agent 要么幻觉,要么承认自己根本没有这本书的内容;
- "边读边做笔记":最终往往产出一份 200 行的文档,之后再也没打开过。
book-to-skill 的解法是:把书编译成一份结构化技能,让 Agent 按需加载——你只需要输入/your-book-slug 主题,Agent 就会读取正确的章节文件,从真实内容中作答,而不是凭空臆测。
这背后是一个经济学问题:文档(docs/index.md)与性能文档(docs/performance.md)都强调,把整本书塞进上下文,是每一轮对话、每一个会话都要重复支付的 token 账单;而 book-to-skill 只支付一次结构化成本,之后的每次查询都按答案大小计费,实测可比"整本书灌入上下文"节省24×–51×的 token。
二、核心设计理念:Structure, not a summary
SKILL.md(SKILL.md)开头即点明项目哲学:
Transform written knowledge into actionable agent skills by extracting structure — not producing summaries.
提取结构,而不是生成摘要。一份技能不是读书报告,而是一个工具箱,包含:
- 命名框架(Named frameworks)——有明确应用场景的思维模型;
- 可执行原则(Actionable principles)——指导决策的规则;
- 技术方法(Techniques)——逐步的操作方法;
- 反模式(Anti-patterns)——要避免什么、为什么;
- 作者语感校准(Voice calibration)——作者如何思考与表达。
文档特别强调"保留作者的精确表述":框架往往因为特定原因才有特定名字——"5 Whys"不能写成"多问几次为什么",必须捕捉原文的确切表述。这也是SKILL.md质量规则第 1、2 条(Quality Rules)的源码级来源:
- 提取结构而非摘要——捕捉命名框架、精确表述、反模式,而不是章节复述;
- 保留作者的精确性——"The 5 Whys" ≠ "ask why multiple times";
- 绝不复制书中的原始文本——始终综合、总结、提炼信号。
三、四大核心能力拆解
文档首页(docs/index.md)用四张卡片概括了项目价值,下面逐条结合源码展开。
3.1 多格式输入,本地提取,优雅降级
支持格式:PDF、EPUB、DOCX、HTML、Markdown、RTF、MOBI/AZW(经由 Calibre 转换)。
源码中,支持的扩展名集中定义在 book_to_skill/config.py:
TEXT_EXTENSIONS = {".txt", ".text", ".md", ".markdown", ".rst", ".adoc", ".asciidoc"} HTML_EXTENSIONS = {".html", ".htm", ".xhtml"} CALIBRE_EBOOK_EXTENSIONS = {".mobi", ".azw", ".azw3"} SUPPORTED_EXTENSIONS = { ".pdf", ".epub", ".docx", ".rtf", *TEXT_EXTENSIONS, *HTML_EXTENSIONS, *CALIBRE_EBOOK_EXTENSIONS, }解析器按格式逐一模块化,位于 book_to_skill/parsers/:pdf.py、epub.py、docx.py、html.py、rtf.py、calibre.py、text.py。每种格式的提取遵循**"最优工具优先、stdlib 兜底"**的降级策略(README "Requirements" 一节、docs/architecture.md):
| 格式 | 首选工具 | 兜底方案 | 安装命令 |
|---|---|---|---|
| PDF(技术书) | Docling(保留表格与代码块) | pypdf → pdfminer.six | pip3 install docling |
| PDF(文本为主) | pdftotext(poppler) | pypdf → pdfminer.six | sudo apt install poppler-utils |
| EPUB | ebooklib + beautifulsoup4 | stdlibzipfile(内置) | pip3 install ebooklib beautifulsoup4 |
| DOCX | python-docx | stdlib ZIP/XML | pip3 install python-docx |
| HTML | beautifulsoup4([html]额外使用 trafilatura 做正文去噪) | stdlibhtml.parser | pip3 install beautifulsoup4 |
| RTF | striprtf | 正则 | pip3 install striprtf |
| MOBI/AZW/AZW3 | Calibreebook-convert(外部应用) | — | 从 Calibre 官网下载 |
| TXT / Markdown / reStructuredText / AsciiDoc | 内置 | — | — |
可选依赖的探测与--check报告由 book_to_skill/dependencies.py 实现,依赖映射同样定义在 book_to_skill/config.py 的PYTHON_DEPENDENCIES中。README 还给出一个实用技巧:用python3 scripts/extract.py --check一条命令即可查看每种格式已安装/缺失的提取器以及补齐命令,无需任何输入文件。
3.2 结构而非摘要:提取作者的"工具箱"
转换的目标不是复述,而是捕捉作者多年沉淀的命名框架、思维模型、决策规则与反模式,并保留其精确术语。SKILL.md的 Step 7 为每个章节定义了标准模板,其中technical型书籍优先呈现 "Code Examples"、"Reference Tables"、"Commands & APIs",text型书籍则优先 "Frameworks Introduced"、"Mental Models"、"Key Takeaways"。
3.3 按需加载章节:token 花费与问题成正比
这是项目最核心的效率机制。文档首页的说法是:
Per-chapter files load only when the topic is relevant, so a 200-page book costs tokens proportional to the question, not the page count.
转换产物是一个典型结构(README 表格):
| 文件 | 用途 | 体量 |
|---|---|---|
SKILL.md | 核心思维模型 + 章节/主题索引 | ~4,000 tokens |
chapters/ch01-*.md… | 每章一个文件,按需加载 | ~1,000 tokens/个 |
glossary.md | 全部关键术语,按字母排序并带章节引用 | ~1,500 tokens |
patterns.md | 所有技术、算法与设计模式 | ~2,000 tokens |
cheatsheet.md | 决策表与快速参考规则 | ~1,000 tokens |
架构图(docs/architecture.md)把这一机制总结为设计原则第 3 条"On-demand chapters":SKILL.md保持小巧,章节文件只有被读取时才产生 token 成本;第 5 条"Front-loaded SKILL.md"则把最重要内容放在最前面,因为上下文压缩(compaction)会从末尾截断。
3.4 多 Agent 兼容:一个 SKILL.md 全宿主通用
项目遵循开放的 Agent Skills 标准,一份SKILL.md即可在多个宿主运行。SKILL.md的头部注释明确列出了兼容的技能根目录:
- GitHub Copilot CLI:
~/.copilot/skills/、~/.agents/skills/、.github/skills/等; - Amp:
.agents/skills/、~/.config/agents/skills/、~/.config/amp/skills/; - Claude Code:
~/.claude/skills/; - Hermes Agent:
$HERMES_HOME/skills/<category>/(默认~/.hermes/skills/)。
SKILL.md特意省略allowed-tools字段以保持宿主中立:Copilot CLI 用shell/MCP-server 名称、Claude 用Bash/Read/Write/Glob/Grep、Amp 用shell_command,各宿主会在首次使用时自行提示授权。
四、安装:Agent 技能 vs 独立 CLI
安装文档(docs/install.md)开篇就提醒不要混淆两种用法:
- 作为 Agent 技能(在 Claude Code、Copilot CLI、Amp、Codex 或 Hermes Agent 中提供
/book-to-skill斜杠命令)→git clone到你的技能目录;- 作为独立 CLI(仅文本提取引擎)→
pip install从仓库安装,不会注册 Agent 技能。
4.1 一键安装(任意宿主)
npx skills add virgiliojr94/book-to-skillskillsCLI 会解析仓库、检测根级SKILL.md,并把完整技能(含scripts/extract.py与tools/)安装到你选择的每个宿主的技能目录。
4.2 各宿主手动安装
GitHub Copilot CLI(个人技能):
git clone https://github.com/virgiliojr94/book-to-skill.git ~/.copilot/skills/book-to-skill # 然后在 copilot 会话中: /skills reload /skills info book-to-skill跨 Agent 路径(Copilot CLI、Amp、Codex 都能发现):
git clone https://github.com/virgiliojr94/book-to-skill.git ~/.agents/skills/book-to-skillOpenAI Codex直接读取~/.agents/skills且跟随符号链接,也可以本地检出后软链:
ln -s /path/to/book-to-skill ~/.agents/skills/book-to-skillHermes Agent(需放入与主题匹配的类别目录):
git clone https://github.com/virgiliojr94/book-to-skill.git \ "${HERMES_HOME:-$HOME/.hermes}/skills/productivity/book-to-skill"项目级安装则用.hermes/skills/<category>/book-to-skill,并在新会话前显式信任项目:hermes skills trust /path/to/project。
Claude Code:
git clone https://github.com/virgiliojr94/book-to-skill.git ~/.claude/skills/book-to-skill安装后在任意 Agent 会话中调用:
/book-to-skill ~/path/to/your-book.pdf # 或 /book-to-skill ~/path/to/your-book.epub4.3 独立 CLI(pip,可选)
book-to-skill尚未发布到 PyPI,因此 pip 直接从仓库安装:
pip install "book-to-skill[pdf,epub,docx] @ git+https://github.com/virgiliojr94/book-to-skill.git" book-to-skill ~/path/to/book.pdf --mode text # 或:python -m book_to_skill ... book-to-skill --check # 报告哪些提取器已安装安装文档特别提醒:[html]扩展比其他重——它会拉入trafilatura(连同 lxml、日期解析器、时区数据库、URL 分类器等共 17 个包),用于真正的正文/样板检测而非简单剥离<script>/<style>;不需要该能力时用bs4兜底即可(无需[html]扩展,只是不做样板去除)。
五、使用方式与四种操作模式
5.1 命令行形态
使用文档(docs/usage.md)给出统一语法:
/book-to-skill <path-to-document-folder-or-glob>... [skill-name-slug]支持格式:PDF、EPUB、DOCX、TXT、Markdown、reStructuredText、AsciiDoc、HTML、RTF、MOBI/AZW/AZW3。典型示例:
# 多文件合并为一个统一技能 /book-to-skill ~/papers/paper1.pdf ~/notes/export.txt unified-research # 整个文件夹一起处理 /book-to-skill ~/workspace/project-docs/ project-knowledge # glob 通配 /book-to-skill "~/books/*.epub" my-library # 把新素材 fold-in 进已有技能目录(更新模式) /book-to-skill ~/articles/new-paper.pdf ~/.claude/skills/project-knowledge技能生成后的调用方式(SKILL.mdStep 3/9 的索引机制):
/designing-data-intensive-apps # 加载核心思维模型 /designing-data-intensive-apps replication # 查找并解释某个主题 /designing-data-intensive-apps ch05 # 深入第 5 章 /designing-data-intensive-apps "what chapters do you have?" # 浏览索引5.2 四种操作模式(SKILL.mdModes of Operation)
| 模式 | 触发条件 | 执行内容 |
|---|---|---|
| 1. 完整转换(默认) | 用户给出路径且无特殊说明 | 执行 Steps 0–9,产出完整技能(SKILL.md + chapters/ + glossary + patterns + cheatsheet) |
| 2. 仅分析 | 用户说 "analyze" / "just extract" | 执行 Steps 0–3,输出结构化提取报告后停止,不生成技能文件 |
| 3. 基于已有分析生成 | 用户已有分析笔记或跑过仅分析模式 | 跳过 Steps 0–3,以现有分析为输入执行 Steps 4–9 |
| 4. 更新 / Fold-in | 输入指向已有技能目录或已存在的技能 slug | 提取新文件后走 Fold-in 工作流,合并章节、术语表与索引 |
更新(Fold-in)工作流的能力边界在 README 中也有描述:研究报告堆(若干论文 + 自己的笔记)可合并为统一技能,并在新素材到来时持续更新。
5.3 发布生成的技能(可选)
转换完成后,转换器会询问是否将技能发布为 GitHub 仓库。可见性单独作为一个封闭问题询问,且gh repo create默认--private——只有回答是裸词public才会创建公开仓库。SKILL.mdStep 11 强调:"关于来源许可的一句话不是可见性回答——'它是公共领域的'描述的是书,不是仓库,仍会得到私有仓库。" 从第三方版权书籍生成的技能必须保持私有(见下文版权一节)。发布后任意 Agent Skills 宿主可一行安装:
npx skills add https://github.com/<you>/<your-book-slug> --skill <your-book-slug>六、工作原理:确定性提取器 + 规范驱动的生成器
架构文档(docs/architecture.md)把系统划分为两半:
一个确定性的 Python 提取器(文档 → 干净文本 + 元数据)和一个规范驱动的生成器(Agent 遵循
SKILL.md把文本转换为结构化技能)。
6.1 提取器(确定性,Python)
documents → scripts/extract.py (shim) → book_to_skill/ ├─ cli.py · utils.py CLI 解析 · 多源解析 · 运行器 ├─ config.py 支持的扩展名 · 路径 · 依赖 ├─ dependencies.py 可选依赖探测 · --check 报告 ├─ sanitize.py 剥离零宽/不可见 Unicode 字符 └─ parsers/ pdf · epub · docx · html · rtf · calibre · text 输出 → <tempdir>/book_skill_work-<pid>/ full_text.txt (所有源合并,带源标记) metadata.json (页数、词数、token 数、章节、ToC)入口 shim scripts/extract.py 保持旧调用方式可用,实际逻辑在 book_to_skill/cli.py 与 book_to_skill/utils.py。
值得一提的实现细节:工作目录是每次运行唯一的<tempdir>/book_skill_work-<pid>/(book_to_skill/config.py 的default_output_dir()),以避免并发提取互相覆盖——历史版本曾因共享固定路径,导致后完成的运行静默替换前一运行的输出、Agent 轮询到"另一本书"的元数据而构建错误技能。BOOK_SKILL_WORKDIR环境变量可完全覆盖该路径。token 估算方面,config.py区分了空白分词文本(WORDS_PER_TOKEN = 0.75)与 CJK 文本(CJK_CHARS_PER_TOKEN = 1.5,因为 CJK 几乎没有空格,按词切分会严重低估)。
6.2 生成器(Agent 遵循SKILL.md的 Steps 0–11)
SKILL.md定义了从 Step 0(越界检查)到 Step 11(发布)的完整流程,关键节点:
- Step 1.5 — 内容类型:先询问用户书籍是technical还是text-heavy,决定提取工具:technical → Docling(表格/代码/公式保留为 markdown,约 1.5s/页);text → pdftotext(瞬时)。
- Step 2.5 — 成本预估:生成前先给出 token 与成本估算,等待用户确认。
- Step 2.6 — 大书 REPL 式访问:超过 ~50k tokens 的书籍不整本
Read,而是用wc -w、grep -n "Chapter"、sed -n '<start>,<end>p'按需拉取片段——200 页书约 75k tokens,若每章重读一遍(28 遍)将消耗约 2M 输入 tokens,grep+sed 让生成成本与输出成正比。 - Step 4 — 目的 → DEPTH:根据用户回答推断
DEPTH=reference(精简快速查阅)或DEPTH=study(更深入、含完整推导的章节),不再单独追问。 - Step 7 — 章节预算矩阵(
SKILL.md的 Token Budget Rule):
DEPTH=reference | DEPTH=study | |
|---|---|---|
BOOK_TYPE=text | 800–1,200 tokens | 1,000–1,800 tokens |
BOOK_TYPE=technical | 1,200–1,800 tokens | 2,000–3,000 tokens |
预算按需自适应:study深度必须靠真实内容达标(复现一个 worked example、把每个框架的 "How" 展开为显式步骤、为 Top 框架补 "Why it works / failure mode"),而非凑字数;reference深度则刻意省略 worked example。
- Step 8 — 支持文件:
glossary.md(≤1,500 tokens,术语按字母排序)、patterns.md(≤2,000 tokens)、cheatsheet.md(≤1,200 tokens)。SKILL.md特别强调 cheatsheet 是"最有差异化的决策层"——优先级依次为:决策规则("当 X 时做 Y,因为 Z")→ 决策树 → 权衡矩阵 → 阈值与默认值 → 信号与陷阱(tells & smells),并明确"裸术语→定义行"属于 glossary,不是 cheatsheet。 - Step 9 — 主 SKILL.md:正文须保持在 4,000 tokens 以内,包含 Core Frameworks(约 2,000 tokens)、章节索引表、主题索引、支持文件链接与 Scope & Limits。
- Step 9.5 — 安全扫描:发布/加载前运行
tools/scan_generated_skill.py做建议性提示注入扫描(见下文安全一节)。 - Step 10 — 清理与报告:只删除本次运行实际使用的 workdir(以
Workdir ->输出为准),绝不删除未创建的目录。 - Step 11 — 发布:默认私有,遵守可见性硬规则与版权闸门。
七、性能与成本:Discovery Loop Tax 与实测数据
性能文档(docs/performance.md)强调所有数字均为实测(tiktokencl100k_base 计数、tools/discovery_tax.py建模),可用命令复现。
提取基准(103 页技术书,仅 CPU):
| 方法 | 时间 | Tokens | 表格 | 代码块 |
|---|---|---|---|---|
| pdftotext | 0.1s | 27K | 0 | 0 |
| Docling(技术模式) | 164s | 27K(+1.2%) | 48 | 36 |
真实转换(页数 / 提取 tokens / 自动检测章节数):
| 书 | 格式 | 页数 | Tokens | 章节 |
|---|---|---|---|---|
| Think Python 2 | 244 | 119K | 19 | |
| Working Backwards | 371 | 175K | 10 | |
| Pro Git | 501 | 229K | — † | |
| Moby-Dick | EPUB | — | 301K | 133 |
† 章节自动检测依赖显式的Chapter N/Capítulo N标题;Pro Git 用节标题、Moby-Dick 用章标题/罗马数字(但其罗马数字目录可被检测出 133 章)。提取与转换仍可用,只是需要手动指向分节。
Discovery Loop Tax(回答一个目标问题的入上下文 tokens):
| 书(章节大小) | 上下文倾倒 | 发现循环 | book-to-skill | 对比倾倒 / 循环 |
|---|---|---|---|---|
| Think Python 2(小) | 119,264 | 12,152 | ~5,000 | 24× / 2.4× |
| Working Backwards(中) | 175,253 | 33,444 | ~5,000 | 35× / 6.7× |
| AI Engineering(大) | 256,287 | 77,866 | ~5,000 | 51× / 15.6× |
book-to-skill 只加载驻留核心(~4K)+ 一个编译好的章节(~1K)≈ 5,000 tokens。可复现命令:
python3 tools/discovery_tax.py --full-text /tmp/book_skill_work/full_text.txt --target-chapter 5- 上下文倾倒优势(24–51×)是最强声明:该成本在每一轮对话都重复;
- **发现循环优势(2.4–15.6×)**是一次性成本,随章节大小缩放。
生成成本(一次性完整转换,Claude Sonnet 4.5,$3/$15 每 MTok 输入/输出估算):Think Python 2 约 $0.88、Working Backwards 约 $0.96、Pro Git 约 $1.23、Moby-Dick 约 $1.42——平均每本书约 1 美元,一次付清,远低于每个会话重读 PDF 的长期成本。
输出质量对照(自适应深度变更 v1.0.0 前后,单章):章节文件从 473 tokens 增至 1,219 tokens、补上 worked example、cheatsheet 决策规则从 0 增至 32 条、关键字/定义行从 9 降至 0——印证了"cheatsheet 是决策层而非术语表"的设计转向。
八、安全与隐私:从文档到上下文的供应链防护
架构文档(docs/architecture.md)指出:不可信文档会流入 Agent 上下文、再进入生成技能、之后又被其他 Agent 加载——这是一条"文档 → 上下文"的供应链,因此加固是分层的:
- 提取净化(book_to_skill/sanitize.py):在每个解析器输出进入指标统计或
full_text.txt之前,剥离零宽字符(U+200B/200C/200D/2060/FEFF)与 Unicode 标签块(U+E0000–E007F),防止文档携带的不可见指令抵达 Agent;报告移除数量,并拒绝"无可见内容"的源。 - DOCX XXE / Billion-Laughs 防护(
parsers/docx.py):解析前拒绝声明了 DTD 或实体的任何 XML 部件。 - 子进程参数注入防护:文件路径在到达
pdftotext/pdfinfo/ebook-convert前先绝对化,避免-开头的文件名被当作 flag 解析。 - 生成技能扫描(tools/scan_generated_skill.py):生成器 Step 9.5 的建议性步骤,对生成的
SKILL.md、chapters/*.md、glossary.md、patterns.md、cheatsheet.md标记指令覆盖短语、模型控制标签、残留不可见 Unicode、扩权 frontmatter 与类外泄内容;发现只报规则名与文件位置,绝不回显匹配文本。扫描非零退出时停止并交人工复核,不得静默改写或加载/发布。 - CI 层:CodeQL、Bandit(HIGH 级别门禁)、Zizmor 与依赖 CVE 审查。
隐私方面,README 的 Copyright & fair use 一节明确:处理全程本地进行,工具本身不会上传你的文件(若 Agent 的模型运行在云端,你喂给它的文本遵循该提供商的数据条款,与普通提示词相同)。
九、FAQ 中的关键判断:技能 vs 上下文倾倒、RAG、大上下文窗口
FAQ 文档(docs/faq.md)回应了最常见的质疑,值得在设计选型时参考:
"直接把 PDF 丢进项目上下文不行吗?"可以,但每一轮对话都要烧掉那份 token 预算。400 页的书约 200K tokens;技能只加载相关章节(~4K 核心 + ~1K 单章)。本质是摊还,不是大小问题:倾倒的账单"每一轮、每一会话、永远"重复;book-to-skill 只付一次。
"1M 上下文窗口还不够大吗?"更大的窗口改变的是"装得下",不是"更聪明":每 token 每调用都要付费;模型在接近满的上下文中检索特定事实的精度会下降("lost in the middle");窗口 ≠ 结构——原始文本每轮都要重新解析,而技能交付的是预提取的框架。
"这不就是 RAG 吗?"RAG 在查询时工作(分块 → 嵌入 → 相似检索 → 注入提示),优化目标是"找到讲 X 的那段";book-to-skill 在编译时工作,一次深度分析提取出作者的框架并命名、描述适用场景、捕捉反模式。二者互补:宽而浅的书库检索用 RAG,窄而深的"工作中要应用的框架"用 book-to-skill。
"热门书 Claude 的训练数据里就有,何必费事?"训练数据是"全网讨论的压缩平均",可能幻觉具体引文与章节位置;book-to-skill 以你的真实副本为准,每个框架名、反模式清单、章节号都锚定在你提供的文本上,对 Claude 完全陌生的内容(小众技术参考、公司内部文档、新近出版物、译本)尤其有价值。
"PDF 是扫描件,提取为何立即停止?"扫描 PDF 是纯图像、没有文本层,任何工具都提取不出内容。提取器检查前几页就停下并说明原因,让你一秒失败而不是花一整轮处理 400 页后得到空技能。先 OCR 再转换:
ocrmypdf input.pdf output.pdfbook-to-skill 有意不自带 OCR(重依赖 + 慢且损失质量,交给专用工具更好);同样,图中文字(图表/图示中的文本)在任何格式下都不提取。
十、版权与合理使用:转换器不携带任何书籍内容
README 明确指出book-to-skill 不随附任何书的内容——一页都没有。它只是一个指向你自己拥有的文件的转换器:
- 处理在本地进行,你的文件不会由此工具上传;
- 用你自己的副本:买来的书、公司拥有的文档、你有权阅读的论文;
- 输出是你的笔记:生成的技能是结构化的合成衍生品(框架名、定义、要点),不是原文复制——
SKILL.md质量规则第 7 条明确禁止复制原始段落,应视同手写学习笔记; - 不要分发:发布或分享受版权作品衍生技能可能侵权。第三方版权书籍生成的技能务必保持私有;内部文档、你自己的写作与开放许可材料可在许可范围内分享。
十一、如何继续深入
本篇文章以项目文档首页(docs/index.md)为核心骨架展开。若需进一步深入,推荐按以下路径阅读当前仓库:
- 架构与组件映射:docs/architecture.md(提取器/生成器分界、安全设计、如何扩展新格式)
- 逐步工作流(Steps 0–10)与 token 预算:SKILL.md(生成器规范本体)
- 安装与宿主路径细节:docs/install.md
- 全部运行模式与实战示例:docs/usage.md
- 实测基准与成本模型:docs/performance.md
- 常见问题与选型判断:docs/faq.md
- 提取器实现:book_to_skill/config.py、book_to_skill/parsers/、book_to_skill/sanitize.py
- 配套工具:tools/discovery_tax.py(成本测量)、tools/validate_skill.py(技能校验,
--lens claude|copilot|amp|hermes)、tools/scan_generated_skill.py(安全扫描)
一句话总结:book-to-skill 的核心竞争力在于"编译期结构化"——把一本书变成一份可推理、按需加载、多宿主通用的技能资产,而不是一次性的摘要或可检索的文本库。它解决的不是"找到那段话",而是"让 Agent 用作者的框架思考"。
【免费下载链接】book-to-skillTurn any technical book PDF into a Claude Code skill — ready to study, reference, and use while you work.项目地址: https://gitcode.com/GitHub_Trending/bo/book-to-skill
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考