开题时最容易犯的错误,是把“搜到很多论文”当成“问题已经想清楚”。真正有用的初筛应该回答另外几件事:我到底搜了什么、哪些来源真的执行了、结果里有哪些稳定标识符、正式论文与预印本是否混在一起,以及这次失败的来源可能漏掉什么。

Academic Paper Search 把这些信息保留在同一次返回中。下面不是示意图,而是我在 2026-07-31 使用 v0.2.0 对 large language models medical education 进行的真实运行。

大语言模型与医学教育多源开题检索真实结果

这次真实运行说明了什么

本次请求让每个默认来源最多返回 3 条记录。sources_queried 包含 CrossRef、PubMed、arXiv、OpenAlex 和 Europe PMC;其中 CrossRef、arXiv、OpenAlex、Europe PMC 成功,共得到 12 条原始记录,合并后仍为 12 条。PubMed 返回 HTTP 429,系统没有让整次任务失败,也没有把 PubMed 写进成功来源。

这条错误不是无关紧要的技术日志。医学教育主题本来就与 PubMed 高度相关,所以本次输出只能叫“四源成功的初筛”,不能写成“五源已完整覆盖”。更稳妥的后续动作是等待限流恢复后补搜 PubMed,并保存补搜日期与查询式。

结果中出现了三条可以继续核验的早期线索:

  • 10.1371/journal.pdig.0000198 / PMID 36812645:ChatGPT 在 USMLE 上的表现;
  • 10.2196/45312 / PMID 36753318:ChatGPT 在另一组 USMLE 问题上的评估;
  • 10.2196/48291 / PMID 37261894:LLM 在医学教育中的机会、挑战与未来方向。

它们能帮助建立概念地图,却不能直接成为纳入集。查询没有限制日期、研究设计、教育阶段或语言,而且 OpenAlex 的引用次数只是一个来源的动态指标,不代表证据质量。

从候选论文收敛开题问题

先按“研究对象”分组

把结果区分为考试表现、模拟患者、课程设计、教学反馈和风险治理。这样可以看出“LLM 与医学教育”仍然太宽,真正可做的问题通常落在某一类教学任务和某一类学习结果上。

再按“证据类型”分组

观点文章、横断面评测、课程干预、学生调查和预印本承担的证据角色不同。开题报告可以用观点文章搭背景,但不能把观点文章的建议写成已验证效果;预印本也要单独标识版本状态。

最后记录缺口,而不是追求整齐

如果题名相近但 DOI 不同,或者预印本与正式版本的关系不清楚,就保留冲突并进入人工核验。真实开题更需要一张“还不知道什么”的清单,而不是一张看起来没有问题的参考文献表。

可复制任务

1
2
3
4
5
使用 $nature-academic-search 为“生成式 AI 在医学教育中的应用与风险”做开题检索。
先记录检索日期和纳入范围,再使用默认论文源检索;按 DOI、PMID、PMCID、arXiv
和 OpenAlex ID 去重。把正式论文、预印本和未解决记录分开,逐源报告成功、失败与
限流状态。基于研究对象和证据类型整理候选主题,但不要把本次初筛描述成系统综述,
也不要根据引用次数判断证据质量。

安装后也可以先运行 nature-academic-search preflight,确认本地邮箱配置和各来源连通状态。Codex 与 Claude Code 的安装命令见项目 README

证据边界

这套流程适合开题前的探索、证据地图和查询迭代,不替代系统综述方案、订阅数据库、完整检索式审校、双人筛选和偏倚评估。来源成功只说明接口在这次请求中返回了记录,不说明召回已经充分;DOI 能解析也只证明标识符对应某条元数据,不证明论文结论支持你的研究假设。

未发表选题、患者描述和内部研究方案也不应直接放入公共 API 查询。正式引用前,仍要回到 PubMed、出版社页面或合法全文核对作者、版本、研究设计和实际结论。

继续阅读:AI 幻觉引用核验 · PubMed / MeSH 检索 · 完整多源工作流