在整个科研过程中,propose 一个 idea,是最核心、最决定你文章价值的部分。如何让大模型 propose 一个有价值的 idea 也是最值得认真去探索的,因此我单独用一个 section 来写。
我自己在上面尝试了很多方式,踩了很多坑,希望我的经验能帮到大家,哪怕只有一点点。
再次说明:这并不是一份指南,也不是一份你可以直接照搬的说明,完全是我的主观个人经验。
§0 前言:从 Evaluate Idea 到 Propose Idea
这是一篇关于"如何让大模型(和我们自己)提出更有价值的研究 idea"的笔记。下面按"先讲评估、再讲提出、最后讲实验中长出来"的顺序展开。
§1 一个更自然的思考框架
引言:为什么我开始把重心从"提出 Idea"转向"评估 Idea"
我实现 idea 的速度一直比较快,即使在 ChatGPT 出现之前,想到一个点子,半个月内就能把 Pipeline 调通,看到初步结果。但我长期被一个问题困扰:如何提出一个真正有价值的 idea?
最近我突然回忆起这件事,事实上我们总觉得大模型很难提出好 idea,其实人类自己也很难提出有价值的 idea。更关键的是,我以前一直忽略了 评估(Evaluate) 这个环节。直到和同学交流后才发现评估的价值。如果我们能把评估做好,就能直接跳进 Karpathy 的 Auto Loop,让大模型海量生成 idea,然后高效过滤,只把精力放在真正有潜力的 idea 上。
§2 如何评估一个 Idea(Evaluate an Idea)
人类目前评估 idea 的常见做法主要有两种:
- 把 idea 丢给 ChatGPT 或 Claude,让模型判断可行性和潜在风险。
- 找同学、导师或同行讨论,获取多角度反馈。
第一种方式本质上是大模型之间在对话,你自己其实只是个协调者。这种方式做的科研并不会显著优于 AutoResearch。第二种方式更有价值,不同的人带来不同的 context,能提供更全面的 review。但依然存在明显局限:人类的评估方差极大。
事实上,即使没有大模型,单凭 idea 本身去精准评估它本来就非常困难。
好消息是:我们并不需要完美评估。我们只需要把明显糟糕的 idea 筛掉就够了,甚至丢掉一些其实还不错的 idea 也没关系。因为 idea 几乎是无限的,丢掉几个并不会阻碍我们探索一个方向,或者达成更现实、更 Personal 的目标:发出一篇有价值的 paper。
§3 评估清晰之后:如何让大模型(和我们自己)提出更有价值的 Idea
当评估的问题被说清楚后,接下来自然就进入了 如何提出(Propose) 的环节。
大模型提出的 idea 经常被批评"缺乏 novelty"。我认为其中一个核心原因是 上下文(context)不足。我们可以把这个过程类比成导师指导学生的经典场景:
- 导师直接给你几篇核心 paper → 你主动给大模型喂高质量上下文;
- 学生自己用 keywords 搜索文献 → 大模型靠自己的知识以及搜索。
刚进入一个领域时,最容易做的一件事就是:只用几个 keywords 搜最相关的几篇 paper,然后基于这些极其有限的信息去 brainstorm idea。这样产生的 idea,自然很难有 novelty 和可行性。此外,这些领域内知名 paper 的真正价值在于你从文章的细节中得到的,paper 的作者遇到困难的时候 decision maker 的过程,而这个内容大模型是很难直接 get 到的。
有经验的研究者之所以能提出更有意思的 idea,是因为他们拥有更丰富的 context:
- 对当前领域如臂使指,掌握大量信息;
- 同时了解交叉领域、相关领域,甚至表面上不相关的领域。
当他们看到一个新问题时,能自然地把过去在强化学习、计算机视觉、NLP 或其他领域的经验"移植"过来。这就是 context 的优势。
提升大模型提出 idea 质量的关键,就在于提升它可用的上下文质量。目前主要有三条路径:
- 优化模型主动搜索的上下文(换 Gemini 搜索、写更好 prompt 等,本质都是在做这件事)。
- Human in the loop:最立竿见影的方式,你作为领域有经验的人,主动给模型注入跨领域知识、引导思考方向。
- 通过真实实验产生的信号来迭代,也是下一个 Section 重点介绍的内容。
第一条路径的延伸:就像导师遇到一个六边形学生:学生自己就能找到高质量 paper、自带跨领域知识、搜索能力,代码能力极强。在这种情况下,学生能提出导师觉得很不错的 idea。但目前看,仅仅切换更强的搜索带来的增益有限。因此我在探索另一种方式,目前有一个粗浅的方案,欢迎交流。
§4 从 Saining 分享中学到的关键启发:Idea 应该从实验中"长出来"
最近我完整听了 Saining 那期 7 小时播客,收获极大(强烈建议听原版,而不是 AI summary)。里面有几个观点彻底改变了我对"提出 idea"的认知,也完美印证了上面"通过实验迭代积累上下文"的思路:
Kaiming 对 Baseline 极致重视
Kaiming 做顶级工作的一个重要秘诀,是在新领域开始时,亲自把 baseline 复现到极致,然后在纯技术层面寻找优化空间——这个过程你得到的结果甚至可以接近 / 超过 SOTA。一个 ResNet 的例子:ResNet strikes back: An improved training procedure in timm。
如果你想出一个 idea,三个月后直接 work 写成 paper:要么你比所有人都聪明很多,要么这不是一个 idea。
科研本质是一个"探索者"(Explorer)的过程
- 先把一个 baseline 或要 follow 的论文完整
reproduce下来; - 简单复现一下 paper,然后去做一些你认为有价值的分析性实验,你会看到一些成功的 signal,但更多的是失败;
- 从成功 / 失败中学习,失败往往带来更大的 gradient,让你学到更多。"如果一个小改动让结果掉了 10 个点,反过来想,我们也许就能提升 10 个点。"
彻底放弃提出一个完美 idea
我们之前大模型 propose idea 的方式,其实带着很强的先验,一次性想出一个 idea,然后通过实验证明他确实 work,这个其实是反常识的,也没有很大价值的事情。好的 idea 更应该从当前任务真正的困难和痛点中自然生长出来。而要发现这些痛点,需要大量的知识、实验信号和失败经历来支撑。直接指望"灵光一闪"既不现实,也不正常。
Human in the loop
同样的,大模型虽然有能力实现所有分析的方式,但是他不一定会主动去做,需要你有一些 insight 告诉他,我们可以尝试用什么手段分析,或者像我一样简单粗暴的用一个 skill 枚举所有的分析方式。
我实际 follow 这个流程去做的时候,通常要求当前 orchestra 将当前实验整理成结构化文档,丢给 GPT-Pro 去分析。让我 exciting 的一件事是,GPT-Pro 会很自然地给我设计更多的分析性实验,并且告诉我他需要这些实验以做出更精准的判断。这个过程通过 pro2api 的方式也可以由模型主动去调用,因此其实也不需要人的参与。事实上我实验的一个 follow CVPR 2026 的一篇 paper 成功通过这种方式的交互,在他的结果上两个数据集分别提升了 6 个点 和 10 个点。
科研从来不是灵光一闪的艺术,而更像一场漫长的、迭代式的探索。Kaiming、Saining 等顶尖研究者反复强调的,其实是同一个朴素却深刻的道理:好的 idea 不是被"想出来"的,而是从大量真实实验产生的信号中,一点点"长出来"的。
§5 后记
这篇文章本应在三天前就发布。但过去几天里,我与多位同行进行了深入交流,每一次对话都带来了新的洞见,也促使我不断修改和完善文稿。
这篇文章也融入了我们组内同学、剑桥(Cam)的同学以及芝加哥大学(UChicago)的同学们在多次讨论中碰撞出的宝贵经验与智慧。衷心感谢他们的慷慨分享与深刻启发。正是这些交流,让这篇内容变得更加丰富、立体。
其中,有些想法我尚未真正付诸实践,有些正在尝试之中,还有一些则是我非常希望继续推进、但目前受限于资源与经验,只能先记录下来、留待未来进一步探索的问题。
而在这些仍有待继续探索的问题中,有一个核心方向是我目前尤其关注的:如何让模型真正获取到更高层次的信息来源,并像一位非常 senior 的 scientist 那样进行思考?我目前有一个粗糙的 idea,非常希望能继续就这一方向展开更多讨论。如果你恰好也在做 NLP / LLM 相关研究,非常期待能与你进行一次正式或非正式的交流,分享我目前的一些思考,也听听你的想法。
本文所有观点均为个人阶段性思考,欢迎批评指正。