news 2026/9/29 14:59:22

Science Skills 文献搜索四合一:PubMed、OpenAlex、arXiv 与 bioRxiv 智能体文献检索实战技巧

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Science Skills 文献搜索四合一:PubMed、OpenAlex、arXiv 与 bioRxiv 智能体文献检索实战技巧

Science Skills 文献搜索四合一:PubMed、OpenAlex、arXiv 与 bioRxiv 智能体文献检索实战技巧

【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30+ other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills

想让 AI 智能体替你查文献?Science Skills 正是为此而生——这个科学工作流技能包把PubMed 文献搜索、OpenAlex 学术数据库检索、arXiv 预印本查询、bioRxiv/medRxiv 预印本浏览四大文献能力装进同一个 AI 智能体,覆盖从"发现论文"到"下载全文、追踪引用"的完整链路,让文献调研又快又省 Token 📚

📋 先认识 Science Skills:为什么文献检索要"技能化"

概念说明
Skill(技能)一个包含SKILL.md指令文件 + 辅助脚本 + 参考文档的目录,教会 AI 智能体完成一项专门任务
文献四件套本仓库中与文献搜索直接相关的 4 个技能:PubMed、OpenAlex、arXiv、bioRxiv
配套技能EuropePMC(开源全文与 PDF 下载)、credentials(API 密钥安全管理)、uv(Python 依赖管理)

每个技能都是"即插即用"的:AI 读取 SKILL.md 中的结构化指令后,自动调用对应的 CLI 脚本完成检索、限速、结果落盘,你只需要用自然语言下需求。

上图是 Science Skills 科学技能生成的基因剪接效应分析图(COL6A2,ALT/REF 对照轨道)——文献检索与这类数据技能配合,构成完整的科研工作流。

🧭 一键上手:安装 Science Skills 与准备 API 密钥

安装:在终端执行一条命令即可安装整个技能包:

npx skills add google-deepmind/science-skills/

或使用 Google Antigravity:在插件设置中下载Science插件。首次触发技能时,智能体经你同意后自动安装 uv 包管理器,建议之后重启一次。

API 密钥(均可选,但有它更快更稳):

技能密钥作用
PubMedNCBI_API_KEY(免费注册)请求限速从 3 次/秒提升到 10 次/秒
OpenAlexOPENALEX_API_KEY(免费注册)解锁更高配额,支持 PDF 下载
arXiv / bioRxiv无需密钥脚本内置限速

密钥统一写入~/.env文件,智能体会按照 credentials 技能的安全协议引导你完成,无需手动管理。

🗂️ 四大文献技能怎么选:一张表看懂

技能数据源擅长亮点能力CLI 入口
PubMedNCBI E-utilities / PMC BioC已发表医学/生物文献摘要、全文、跨库链接、拼写校验、引文匹配pubmed_api.py
OpenAlexOpenAlex 学术图谱论文/作者/机构/主题多维检索DOI 解析、被引数排序、机构影响力聚合、下载 PDFopenalex_cli.py
arXivarXiv 预印本计算机、物理、数学等 CS 方向字段级查询语法、PDF/HTML 全文下载search_arxiv.py
bioRxivbioRxiv + medRxiv生命科学、医学预印本按 DOI 秒查、按日期+分类浏览、本地关键词过滤search_by_dates.py

新手速记口诀:查"已发表"找 PubMed;查"谁写的、被引多少"找 OpenAlex;查"计算机/物理预印本"找 arXiv;查"生物医学新预印本"找 bioRxiv。

🔬 PubMed:医学与生物文献的主力检索器

PubMed 技能(skills/pubmed_database/SKILL.md)提供 10 个函数,覆盖搜索、抓取、跨库链接、全文、拼写校验、引文匹配与缓存,全部通过一个 CLI 完成。

3 个新手最好用的场景:

  1. 搜文献 + 取摘要:先search_pubmed拿一批 PMID,再用fetch_article_abstracts一次性批量取摘要——技能内置的"批量工作流"(references/bulk-workflows.md)会在超过 10 篇时自动走 History Server 通道,避免逐条请求。
  2. 医学拼写校验:verify_medical_spelling在搜索前帮你校正生物医学术语,减少"搜不到"的尴尬。
  3. 引文解析:match_raw_citations把不完整的书目信息(比如"某年某刊某篇文章")解析成精确 PMID,参考文献列表整理神器 🎯

进阶查询语法(字段限定、布尔组合)见 references/advanced-search.md,跨数据库关联(论文 ↔ 基因/蛋白/化合物)见 references/cross-database-linking.md。

GATA4 基因在心脏组织的表达/剪接位点轨道(±1.5kb 细节视图)——此类基因-文献关联正是 PubMed 跨库链接能力的典型应用。

🌐 OpenAlex:把"学术影响力"纳入检索

OpenAlex 技能(skills/literature_search_openalex/SKILL.md)把论文、作者、机构、主题、出版社、资助方都变成可检索实体,核心命令只有 5 个:resolve(名称转 ID)、get(取单条)、filter(条件筛选)、download-pdf、rate-limit。

新手记住一条黄金规则:先 resolve,再 filter——永远不要拿"名字"直接过滤,先解析成 ID,再按 ID 精确筛选,结果才可靠。

典型玩法(在对话里直接说即可,智能体会生成对应命令):

  • "找 Geoffrey Hinton 引用最高的 10 篇论文" →resolve authors+filter works --sort cited_by_count:desc
  • "查这个 DOI 的完整元数据" →get works https://doi.org/...,一次请求拿到标题、年份、被引数、OA 状态
  • "MIT 每年的发文量" →--group-by publication_year一条命令完成聚合

各实体可用的筛选/排序字段有完整文档:works.md、authors.md、institutions.md、taxonomy.md。

💡 小贴士:OpenAlex 按操作计费(get免费、filter约 $0.0001/次),概览查询记得让智能体加--select与--per-page 5–10,省配额又省 Token。

📄 arXiv:预印本领域的深度检索

arXiv 技能(skills/literature_search_arxiv/SKILL.md)提供"搜索 → 下载 PDF/HTML → 下载 LaTeX 源码"三级能力。它的杀手锏是字段级查询语法(详见 references/query_syntax.md):

前缀含义示例
ti:标题ti:relativity
au:作者au:einstein
abs:摘要abs:transformer
cat:学科分类cat:cs.AI

配合AND / OR / ANDNOT、括号分组、双引号短语,以及submittedDate:[...]日期过滤,可以构造出非常精准的检索式,例如:

uv run scripts/search_arxiv.py --query "au:einstein AND ti:relativity" --max_results 5

两个新手容易踩的坑:

  1. 结果别贪多——一次取 100 篇会把上下文撑爆,--max_results 5起步,不够再翻页(--start)。
  2. 下载后先验证——PDF 下载完智能体会检查文件非空未损坏;LaTeX 源码解压时务必解到新建目录,不要直接解进工作区。

🧬 bioRxiv / medRxiv:生命科学预印本的"正确打开方式"

bioRxiv 技能(skills/literature_search_biorxiv/SKILL.md)和其他三个不太一样:它不支持服务端关键词搜索。关键词过滤是在本地完成的——脚本会先下载整个日期范围的全部元数据再筛选,所以日期范围太大会导致成百上千次 API 调用甚至被封锁 ⚠️

新手务必掌握的三条军规:

  1. 有 DOI 就先用 DOI 查——search_by_doi.py最快最稳,是首选入口;
  2. 关键词搜索必须"窄日期 + 分类":--start_date/--end_date控制在1–4 周,并加上--category(如genomics、infectious_diseases);
  3. 只看主题没有日期?别硬查——先让 OpenAlex 或 PubMed 找到相关 DOI,再回 bioRxiv 取元数据。
uv run scripts/search_by_dates.py --server medrxiv \ --start_date 2023-11-01 --end_date 2023-11-30 \ --category infectious_diseases \ --keywords "covid" "sars-cov-2" --match_logic OR \ --include_abstracts > covid_papers.json

注意该技能不下载 PDF:拿到 DOI 后交给 EuropePMC 技能查 PMCID 再取全文即可,四件套 + 一个配套技能正好补齐全流程。

🚀 组合拳:一个智能体的文献调研流水线

单独每个技能都不弱,但 Science Skills 真正的威力在于智能体自动串联它们。以"调研 CRISPR 最新进展"为例,一条自然语言指令背后发生的事:

① OpenAlex 找高被引代表作(resolve → filter → 按 cited_by_count 排序) ↓ 拿到一批 DOI ② bioRxiv 按 DOI 补充预印本元数据(search_by_doi) ↓ 锁定感兴趣的 DOI/PMID ③ PubMed 取摘要、关联基因/蛋白数据库记录 ↓ 找到 PMC 编号 ④ EuropePMC 下载开源全文 PDF、追踪引用网络

全程无需你切换网页、手敲检索式,智能体按各技能 SKILL.md 中的规则自动执行限速、重试和结果落盘。

✅ 高手都在用的 6 条实战技巧

  1. 结果先落盘再读:所有技能都要求输出重定向到 JSON 文件,再用jq精简字段后才进上下文——这是"高 Token 效率"的核心设计,你也可以主动要求智能体"先只取标题和摘要字段"。
  2. 批量操作别逐条:超过 10 个 ID 时,让智能体走 PubMed 的 History Server 缓存通道,一次调用拿全部数据。
  3. 搜索 3–5 次就收手:技能规范建议,高质量检索式试 3–5 次仍无结果,大概率是没有符合的文献,而不是"再试一次"能解决的。
  4. 报告要可溯源:各技能都强制要求输出中列出所引用论文的 URL——这是防止 AI"幻觉文献"的重要护栏,保留它。
  5. 密钥提前配好:开工前把NCBI_API_KEY、OPENALEX_API_KEY写进~/.env,能显著减少 429 限流等待。
  6. 许可要留意:每个技能首次使用会提示你确认对应数据源的服务条款并落一个.licenses/记录文件,请认真阅读后再继续。

📚 延伸阅读与文件导航

  • 项目总览与安装说明:README.md
  • PubMed 技能:skills/pubmed_database/SKILL.md
  • OpenAlex 技能:skills/literature_search_openalex/SKILL.md
  • arXiv 技能:skills/literature_search_arxiv/SKILL.md
  • bioRxiv 技能:skills/literature_search_biorxiv/SKILL.md
  • EuropePMC 配套技能:skills/literature_search_europepmc/SKILL.md
  • API 密钥安全协议:skills/credentials/SKILL.md

总结

Science Skills 文献搜索四合一——PubMed 管已发表、OpenAlex 管影响力、arXiv 管理工预印本、bioRxiv 管生命科学预印本——用一套技能把 AI 智能体的文献调研能力拉满。安装只需一行命令,密钥免费注册,剩下的交给智能体:你负责提问题,它负责查文献、读摘要、下全文 🎓

📌 使用提示:本文基于 science-skills 仓库文档整理;各数据源(PubMed、OpenAlex、arXiv、bioRxiv)有其自身许可条款,批量使用前请阅读对应 SKILL_LICENSES.md 与技能内的许可提示。

【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30+ other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 14:58:55

Java物流管理系统毕业设计:JSP+SQL Server从需求到数据库落地

简介:这是一份基于Java的物流管理系统设计与实现的完整文档资料,面向正在学习JavaWeb开发、需要完成毕业设计或课程设计的学生,以及希望了解物流管理系统业务流程的开发人员。文档以JSP技术和B/S结构为核心,系统介绍了客户信息管理…

作者头像 李华
网站建设 2026/9/29 14:56:34

汽车传感器与执行器:从原理到系统的工程解读

1. 为什么汽车工程师都应该吃透这本教材聊到《Automotive Sensors and Actuators: Principles, Systems, and Electronics》这本书,我的第一反应不是"教材"两个字,而是一句话:传感器的数据质量,决定了控制算法的天花板。…

作者头像 李华
网站建设 2026/9/29 14:48:59

工业总线入门:从RS-485到Modbus RTU,一文理清选型与调试

刚入行那会儿,我在一个自动化仓库项目里做调试。柜子里密密麻麻的端子排,看起来像一堵由彩色电线砌成的墙,每根线对应一个传感器、一个电磁阀、一个限位开关。查个断线故障,经常要在几百根线里翻半天。后来项目改造,把…

作者头像 李华
网站建设 2026/9/29 14:41:01

技术博客选题须真实:避免伪技术,从Maven到MySQL的创作原则

抱歉,基于当前提供的项目标题,我无法生成符合要求的 CSDN 技术博客正文。 原因如下: 主题不匹配 :“【lovelive】Mermaid festa vol.1” 是日本 Love Live! 企划中的一首歌曲,属于 ACG/音乐内容,不是技术…

作者头像 李华
网站建设 2026/9/29 14:40:09

GTA6泄密追踪:传票机制与跨平台数字取证全解析

这次我们来看一条和游戏安全、数字取证都强相关的新闻:Take-Two 向微软和 Discord 发出传票,目标非常明确——找到 GTA 6 泄密者身份。很多人看到这种标题只当八卦,但从技术视角拆开,它正好把“第三方平台数据如何成为追踪线索”“…

作者头像 李华