Science Skills 文献搜索四合一:PubMed、OpenAlex、arXiv 与 bioRxiv 智能体文献检索实战技巧
【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30+ other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills
想让 AI 智能体替你查文献?Science Skills 正是为此而生——这个科学工作流技能包把PubMed 文献搜索、OpenAlex 学术数据库检索、arXiv 预印本查询、bioRxiv/medRxiv 预印本浏览四大文献能力装进同一个 AI 智能体,覆盖从"发现论文"到"下载全文、追踪引用"的完整链路,让文献调研又快又省 Token 📚
📋 先认识 Science Skills:为什么文献检索要"技能化"
| 概念 | 说明 |
|---|---|
| Skill(技能) | 一个包含SKILL.md指令文件 + 辅助脚本 + 参考文档的目录,教会 AI 智能体完成一项专门任务 |
| 文献四件套 | 本仓库中与文献搜索直接相关的 4 个技能:PubMed、OpenAlex、arXiv、bioRxiv |
| 配套技能 | EuropePMC(开源全文与 PDF 下载)、credentials(API 密钥安全管理)、uv(Python 依赖管理) |
每个技能都是"即插即用"的:AI 读取 SKILL.md 中的结构化指令后,自动调用对应的 CLI 脚本完成检索、限速、结果落盘,你只需要用自然语言下需求。
上图是 Science Skills 科学技能生成的基因剪接效应分析图(COL6A2,ALT/REF 对照轨道)——文献检索与这类数据技能配合,构成完整的科研工作流。
🧭 一键上手:安装 Science Skills 与准备 API 密钥
安装:在终端执行一条命令即可安装整个技能包:
npx skills add google-deepmind/science-skills/或使用 Google Antigravity:在插件设置中下载Science插件。首次触发技能时,智能体经你同意后自动安装 uv 包管理器,建议之后重启一次。
API 密钥(均可选,但有它更快更稳):
| 技能 | 密钥 | 作用 |
|---|---|---|
| PubMed | NCBI_API_KEY(免费注册) | 请求限速从 3 次/秒提升到 10 次/秒 |
| OpenAlex | OPENALEX_API_KEY(免费注册) | 解锁更高配额,支持 PDF 下载 |
| arXiv / bioRxiv | 无需密钥 | 脚本内置限速 |
密钥统一写入~/.env文件,智能体会按照 credentials 技能的安全协议引导你完成,无需手动管理。
🗂️ 四大文献技能怎么选:一张表看懂
| 技能 | 数据源 | 擅长 | 亮点能力 | CLI 入口 |
|---|---|---|---|---|
| PubMed | NCBI E-utilities / PMC BioC | 已发表医学/生物文献 | 摘要、全文、跨库链接、拼写校验、引文匹配 | pubmed_api.py |
| OpenAlex | OpenAlex 学术图谱 | 论文/作者/机构/主题多维检索 | DOI 解析、被引数排序、机构影响力聚合、下载 PDF | openalex_cli.py |
| arXiv | arXiv 预印本 | 计算机、物理、数学等 CS 方向 | 字段级查询语法、PDF/HTML 全文下载 | search_arxiv.py |
| bioRxiv | bioRxiv + medRxiv | 生命科学、医学预印本 | 按 DOI 秒查、按日期+分类浏览、本地关键词过滤 | search_by_dates.py |
新手速记口诀:查"已发表"找 PubMed;查"谁写的、被引多少"找 OpenAlex;查"计算机/物理预印本"找 arXiv;查"生物医学新预印本"找 bioRxiv。
🔬 PubMed:医学与生物文献的主力检索器
PubMed 技能(skills/pubmed_database/SKILL.md)提供 10 个函数,覆盖搜索、抓取、跨库链接、全文、拼写校验、引文匹配与缓存,全部通过一个 CLI 完成。
3 个新手最好用的场景:
- 搜文献 + 取摘要:先
search_pubmed拿一批 PMID,再用fetch_article_abstracts一次性批量取摘要——技能内置的"批量工作流"(references/bulk-workflows.md)会在超过 10 篇时自动走 History Server 通道,避免逐条请求。 - 医学拼写校验:
verify_medical_spelling在搜索前帮你校正生物医学术语,减少"搜不到"的尴尬。 - 引文解析:
match_raw_citations把不完整的书目信息(比如"某年某刊某篇文章")解析成精确 PMID,参考文献列表整理神器 🎯
进阶查询语法(字段限定、布尔组合)见 references/advanced-search.md,跨数据库关联(论文 ↔ 基因/蛋白/化合物)见 references/cross-database-linking.md。
GATA4 基因在心脏组织的表达/剪接位点轨道(±1.5kb 细节视图)——此类基因-文献关联正是 PubMed 跨库链接能力的典型应用。
🌐 OpenAlex:把"学术影响力"纳入检索
OpenAlex 技能(skills/literature_search_openalex/SKILL.md)把论文、作者、机构、主题、出版社、资助方都变成可检索实体,核心命令只有 5 个:resolve(名称转 ID)、get(取单条)、filter(条件筛选)、download-pdf、rate-limit。
新手记住一条黄金规则:先 resolve,再 filter——永远不要拿"名字"直接过滤,先解析成 ID,再按 ID 精确筛选,结果才可靠。
典型玩法(在对话里直接说即可,智能体会生成对应命令):
- "找 Geoffrey Hinton 引用最高的 10 篇论文" →
resolve authors+filter works --sort cited_by_count:desc - "查这个 DOI 的完整元数据" →
get works https://doi.org/...,一次请求拿到标题、年份、被引数、OA 状态 - "MIT 每年的发文量" →
--group-by publication_year一条命令完成聚合
各实体可用的筛选/排序字段有完整文档:works.md、authors.md、institutions.md、taxonomy.md。
💡 小贴士:OpenAlex 按操作计费(
get免费、filter约 $0.0001/次),概览查询记得让智能体加--select与--per-page 5–10,省配额又省 Token。
📄 arXiv:预印本领域的深度检索
arXiv 技能(skills/literature_search_arxiv/SKILL.md)提供"搜索 → 下载 PDF/HTML → 下载 LaTeX 源码"三级能力。它的杀手锏是字段级查询语法(详见 references/query_syntax.md):
| 前缀 | 含义 | 示例 |
|---|---|---|
ti: | 标题 | ti:relativity |
au: | 作者 | au:einstein |
abs: | 摘要 | abs:transformer |
cat: | 学科分类 | cat:cs.AI |
配合AND / OR / ANDNOT、括号分组、双引号短语,以及submittedDate:[...]日期过滤,可以构造出非常精准的检索式,例如:
uv run scripts/search_arxiv.py --query "au:einstein AND ti:relativity" --max_results 5两个新手容易踩的坑:
- 结果别贪多——一次取 100 篇会把上下文撑爆,
--max_results 5起步,不够再翻页(--start)。 - 下载后先验证——PDF 下载完智能体会检查文件非空未损坏;LaTeX 源码解压时务必解到新建目录,不要直接解进工作区。
🧬 bioRxiv / medRxiv:生命科学预印本的"正确打开方式"
bioRxiv 技能(skills/literature_search_biorxiv/SKILL.md)和其他三个不太一样:它不支持服务端关键词搜索。关键词过滤是在本地完成的——脚本会先下载整个日期范围的全部元数据再筛选,所以日期范围太大会导致成百上千次 API 调用甚至被封锁 ⚠️
新手务必掌握的三条军规:
- 有 DOI 就先用 DOI 查——
search_by_doi.py最快最稳,是首选入口; - 关键词搜索必须"窄日期 + 分类":
--start_date/--end_date控制在1–4 周,并加上--category(如genomics、infectious_diseases); - 只看主题没有日期?别硬查——先让 OpenAlex 或 PubMed 找到相关 DOI,再回 bioRxiv 取元数据。
uv run scripts/search_by_dates.py --server medrxiv \ --start_date 2023-11-01 --end_date 2023-11-30 \ --category infectious_diseases \ --keywords "covid" "sars-cov-2" --match_logic OR \ --include_abstracts > covid_papers.json注意该技能不下载 PDF:拿到 DOI 后交给 EuropePMC 技能查 PMCID 再取全文即可,四件套 + 一个配套技能正好补齐全流程。
🚀 组合拳:一个智能体的文献调研流水线
单独每个技能都不弱,但 Science Skills 真正的威力在于智能体自动串联它们。以"调研 CRISPR 最新进展"为例,一条自然语言指令背后发生的事:
① OpenAlex 找高被引代表作(resolve → filter → 按 cited_by_count 排序) ↓ 拿到一批 DOI ② bioRxiv 按 DOI 补充预印本元数据(search_by_doi) ↓ 锁定感兴趣的 DOI/PMID ③ PubMed 取摘要、关联基因/蛋白数据库记录 ↓ 找到 PMC 编号 ④ EuropePMC 下载开源全文 PDF、追踪引用网络全程无需你切换网页、手敲检索式,智能体按各技能 SKILL.md 中的规则自动执行限速、重试和结果落盘。
✅ 高手都在用的 6 条实战技巧
- 结果先落盘再读:所有技能都要求输出重定向到 JSON 文件,再用
jq精简字段后才进上下文——这是"高 Token 效率"的核心设计,你也可以主动要求智能体"先只取标题和摘要字段"。 - 批量操作别逐条:超过 10 个 ID 时,让智能体走 PubMed 的 History Server 缓存通道,一次调用拿全部数据。
- 搜索 3–5 次就收手:技能规范建议,高质量检索式试 3–5 次仍无结果,大概率是没有符合的文献,而不是"再试一次"能解决的。
- 报告要可溯源:各技能都强制要求输出中列出所引用论文的 URL——这是防止 AI"幻觉文献"的重要护栏,保留它。
- 密钥提前配好:开工前把
NCBI_API_KEY、OPENALEX_API_KEY写进~/.env,能显著减少 429 限流等待。 - 许可要留意:每个技能首次使用会提示你确认对应数据源的服务条款并落一个
.licenses/记录文件,请认真阅读后再继续。
📚 延伸阅读与文件导航
- 项目总览与安装说明:README.md
- PubMed 技能:skills/pubmed_database/SKILL.md
- OpenAlex 技能:skills/literature_search_openalex/SKILL.md
- arXiv 技能:skills/literature_search_arxiv/SKILL.md
- bioRxiv 技能:skills/literature_search_biorxiv/SKILL.md
- EuropePMC 配套技能:skills/literature_search_europepmc/SKILL.md
- API 密钥安全协议:skills/credentials/SKILL.md
总结
Science Skills 文献搜索四合一——PubMed 管已发表、OpenAlex 管影响力、arXiv 管理工预印本、bioRxiv 管生命科学预印本——用一套技能把 AI 智能体的文献调研能力拉满。安装只需一行命令,密钥免费注册,剩下的交给智能体:你负责提问题,它负责查文献、读摘要、下全文 🎓
📌 使用提示:本文基于 science-skills 仓库文档整理;各数据源(PubMed、OpenAlex、arXiv、bioRxiv)有其自身许可条款,批量使用前请阅读对应 SKILL_LICENSES.md 与技能内的许可提示。
【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30+ other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考