让 AI 看完几百篇参考文献,再给试着总结出几个选题,常会得到“基于方法A/理论B的任务C的研究”这样的组合。
它们未必一无是处,毕竟很小伙伴,自己的选题习惯也是这样。但这种“公式化”的题目,却很难经住顶刊审稿人接下来的追问:新在哪里?结论靠什么站住?
这时候,我们可以考虑转换一下思路。先把 AI 放进可复现的实验环境中,协助核对论文主张与实现,记录异常,提出彼此竞争的解释。再使你的想法从可验证转向”听上去有趣“。
00|误区纠正
很多朋友的选题被驳回后,可能会尝试追求Attention Is All You Need、Grokking、Scaling Laws 这种,听起来就让人感到耳目一新,”原来还能这样“的选题。
这些新颖选题带来的冲击感当然珍贵,但它不等于审稿标准,更不等于另一套可以直接拿去复用的模板。
Nature 对审稿人的公开要求包括:数据在技术上可靠、结论有强证据、结果具有新颖性,并且对领域重要;Nature Human Behaviour 还进一步指出,概念或方法新颖之外,高严谨度的证据型推进、针对争议问题的严谨复现也很关键。
因此,我们要做的既不是让挖空心思找"偏难怪"选题,更不是化身”反驳型人格“,故意和主流观点唱反调来吸引审稿人。
而是要在真实实现和实验结果中找到值得追问的现象,再把现象压成一组可证伪的假设。真正的亮点可能来自新机制,也可能来自更可靠的证据。
接下来,我们将尝试按照这样的工作流,讲一讲如何让 AI 从代码仓库,到得出一个合适的足够 Novel 的 idea。
01|筛选“值得复现”的代码
判断你的论文是否有价值,当然不会只去摘要看结论,然后你说是什么就是什么。
因此首先,我们要核对代码仓库是否公开、是否有明确许可证、环境说明、训练或评测脚本、预训练权重或数据处理说明、Issue 记录和最近维护状态。输出一张候选清单,而不是“这篇一定可信”的”自卖自夸“。
提示词
```markdown你是科研代码尽调助手。请只根据以下论文链接、代码仓库、README、环境文件、训练/评测脚本和 Issue 页面,建立一张候选复现清单。
对每个项目分别列出:1. 论文主张与仓库中能定位到的对应脚本/配置;2. 许可证、依赖环境、数据获取方式、权重与运行入口;3. 是否存在最小可运行示例、测试、复现实验说明;4. 可能阻塞复现的缺口(私有数据、缺失脚本、版本不明、外部服务等);5. 建议优先级及理由。
不要根据论文摘要推测代码实现;找不到时写“仓库未说明”,并附文件路径或链接。```
02|建立复现契约
说到复现,复现最容易失败在目标含糊。
开始前把论文中的主结果、数据版本、评价指标、随机种子、训练预算和容许误差写成一页契约。它既能防止模型边跑边改标准,也让后续异常有清楚的参照物。
提示词
```markdown
请读取论文的实验部分和仓库配置,为一次 baseline 复现生成“复现契约”。
必须包含:- 要复现的具体表格/图/指标;- 数据集、划分、预处理和版本;- 模型版本、关键超参数、随机种子、硬件与训练预算;- 论文报告值、允许误差范围及误差依据;- 成功、部分成功、失败三种判定;- 尚无法从材料确认的字段。
不要擅自补全缺失参数。输出为可执行检查清单。```
03|主张与代码对应
论文里一句“我们采用xxxx策略”,在代码里可能就要被拆解成数据加载、配置默认值、回调函数和评测脚本等多个模块。我们需要一一对应,解释清楚这里是干什么的,哪里又是干什么的。
先做一张“主张—实现—输出”映射表。它不是解释 why it works,而是让你看清真正参与了结果生成的环节。
提示词
```markdown
请对照论文和仓库,生成“主张—实现—证据位置”映射。
每一行包含:- 论文中的主张或关键实验设定;- 对应的代码文件、函数、配置项和默认值;- 对应的日志、checkpoint、表格或评测输出;- 代码与论文是否一致;- 不确定处及需要人工打开核对的文件。
只引用你实际看到的文件路径、行号或配置键。不要把合理猜测写成代码事实。```
04|记录异常
异常可能是复现失败,也可能是某个组件一改,指标在特定数据、种子或预算下出现不符合预期的变化。
先把异常写全:改变了什么、没改变什么、出现在哪些运行中、是否可重复。没有这一步,后面的机制解释很容易漂浮。
提示词
```markdown下面是 baseline 复现日志、配置差异和结果表。请建立“异常登记卡”。
分别写明:1. 观察到的现象及其量化幅度;2. 与论文报告或内部对照相比的差异;3. 已固定的变量与仍可能变化的变量;4. 复现次数、随机种子和失败运行;5. 三个优先级最高的排查方向。
先描述现象,不要抢先给机制结论。若样本量不足,请标明。```
05|竞争性解释
AI 很擅长把一个结果讲得顺,却未必知道解释是否成立。
我们要主动要求它给出相互竞争的机制假设,并为每个假设写出可被推翻的预测。这样,AI 的“反向解释”才会变成可检验的科学问题。
提示词
```markdown基于以下异常登记卡,请提出 3—5 个彼此可区分的解释假设。
每个假设必须包含:- 假设的机制描述;- 它能解释哪些观察,不能解释哪些观察;- 至少一个可量化、可证伪的预测;- 一个成本尽量低的区分实验;- 可能的混杂因素和控制方式。
不要把“模型学得更好”“表示更强”当作机制解释;避免只换同义词的重复假设。```
06|最小区分实验
新 idea 往往不是一次大改模型,而是一个能明确区分两种解释的小实验。
优先改动一个模块,保留其余设置;报告均值、波动和失败案例。若多个解释都还活着,暂时不要急着写成贡献。
提示词
请把下列竞争性假设转成一个“最小区分实验”计划。 要求:- 每轮只改变一个主要因素,并说明对照组;- 给出数据、指标、种子数、训练预算和停止条件;- 标出每个结果分别支持或削弱哪一个假设;- 同时记录主指标、代价指标和失败模式;- 排序:先做信息增益最高、成本最低的实验。 输出实验矩阵与结果判读规则,不要预设哪一个假设会胜出。
07|Novel ideas
当异常可重复、假设有区分结果后,我们再回到 idea 这个问题本身。
检查你的机制、边界条件和实验设计是否已经被做过。投稿前还应核对代码、数据和方法是否足以让同行解释并复现主要结论。
提示词
请以“审稿前证据审计”的方式检查以下候选贡献。 输出四部分:1. 贡献主张:一句话写清对象、条件、发现和边界;2. 相邻工作:哪些论文可能已经覆盖相同机制、任务或实验设置;3. 证据缺口:哪些结论仍缺少消融、统计、跨数据验证或失败案例;4. 降级表述:若证据不足,如何把强主张改成准确且可支持的表述。 不得把“尚未检索到”写成“首次提出”。对每个判断标注所依据的材料。
尾声
这个世界上,并没有 Idea 自动售货机。因此比起直接逼着AI给你个结论,我们可能腰线花本篇似乎花了更多篇幅用在了复现而不是提出上。
自始至终,最值得留下的不是一条看上去很新的标题,而是一份可回查的证据链:代码版本、配置、日志、异常登记、竞争假设和实验结果。这些才应该是一篇顶刊级论文的真正需要关注的东西。
论文文本呈现的是整理后的论证,代码和实验记录则保留了更多实际决策。把 AI 放在后者里,它能帮你查漏、对照、归纳异常和设计验证;人仍负责选择问题、判断证据是否足够,以及决定哪条线值得投入。