# RW Research Skill 是怎样从文献证据中寻找科研创新点的

文献里的 gap 只是证据的空白或冲突,不代表填补它就有学术贡献。把 gap 变成创新点,中间还要经过解释、比较和淘汰。

很多研究者都有过这种体验。文献读了几十篇,提取表格做得密密麻麻,到了要定选题的时候,脑子还是空的。有时候看到作者在 Discussion 部分写“未来需要更多研究探索”,就赶紧记下来。有时候发现某个人群没人碰过,某种方法在这个领域很少用,或者几篇论文得出了截然相反的结论。这些现象都可以叫作 gap。但 gap 只说明现有证据存在缺陷,它没有回答一个更要命的问题:这个空白凭什么值得你去研究?

从 gap 到创新点,中间缺了一段研究判断。

## 不靠 AI 的时候,我们是怎么找创新点的?

人工找创新点其实包含两个动作,一是从文献比对里挑出证据问题,二是围绕问题做研究判断。

没有辅助工具的时候,找创新点全靠人肉堆。先读一个领域的文献,把研究对象、理论框架、研究方法、测量工具、数据特征和最终结果全记下来。读到一定量,开始在心里或者纸上做比对。

为什么两篇研究讨论的是同一个问题,结论却对不上?是研究人群不一样,还是测量工具不同?是观察时间太短没看到长期效应,还是横断面研究本身就没法回答因果问题?是已有的理论兜不住这个结果,还是研究在招募阶段就带了偏倚?

研究者会围绕这些差异提出各种解释,然后拿到组会上讨论,或者找导师碰。讨论完再回头查新文献,把站不住脚的解释一个个砍掉。这个过程拆开看很清楚:比对文献完成的是“发现证据问题”,头脑风暴和经验判断完成的是“提出研究方向并评估价值”。人工比对能做到前半截,后半截全凭研究者的个人功力和运气。很多人的痛苦就在于,问题找出来了,后面怎么走全靠蒙。

## 文献里的 gap 为什么不能直接当成创新点用?

“没有人研究过”听起来非常像创新,但它在现实中往往经不起推敲。

一种可能是检索策略有问题,没用到正确的检索词,或者相关研究发在了另一个学科的期刊上,单一数据库查不出来就下结论,太草率。还有一种情况,gap 确实存在,但研究价值接近于零。比如把一项在欧美已经做得很成熟的研究,原封不动搬到另一个地区。如果新的地区不会改变底层理论、不影响临床决策或实践指导,这种单纯的地理位移很难单独构成学术贡献。

AHRQ 的研究缺口框架把缺口分成了几类:证据不足、结果不精确、存在偏倚、结果不一致、信息不适配。这个框架传达了一个很现实的逻辑:缺口存在是一回事,填补缺口对真实世界的决策有没有用是另一回事。

这也是我决定做 rw-research-novelty 的直接原因。它专门用来处理“发现证据问题”和“确立候选创新点”之间这段最容易被跳过的逻辑推演。

## rw-research-novelty 具体需要你提供什么材料?

它不从一句宽泛的研究兴趣出发猜,必须拿到具体的领域材料与现实约束条件。

别指望丢一句“我想做人工智能医疗”进去,系统就能吐出创新点。它需要你把家底亮出来:想研究的领域是什么,手头有哪些文献、证据图、论文提取表或者种子论文。更关键的是现实条件的限制,你得说明自己能拿到什么数据、能接触到什么人群,以及实验资源和伦理边界在哪。

如果连研究问题都没定型,任务得先退回给 rw-research-question。手里没文献,先去跑 rw-literature-discovery。论文还是大段原文、没形成可比较的结构化字段,得先过 rw-paper-extractor 和 rw-evidence-map。等证据图把空白、冲突、异常全标出来了,rw-research-novelty 才会启动。前置条件没满足,它不会接活。

## 怎样把一个 gap 拆解成“证据问题卡”?

系统不会直接读取一个 gap 然后生成一个听起来很新颖的标题,它的第一步是给每个问题建档,把模糊的空白拆成具体的事实。

每张证据问题卡要记清楚:问题是从哪几篇研究里来的,涉及什么人群、什么构念、用的什么测量工具、时间跨度多长、是什么研究设计。光记这些还不够,它必须把几种在表面上看起来一样、实际上截然不同的情况硬生生拆开。

到底是真的没有任何人研究过这个点,还是你根本没找到全文?是研究做了实验但没在论文里报告这个结果,还是实验设计里压根没测这个变量?几篇论文看起来结论打架,到底是因为它们在讨论同一件事产生了真正冲突,还是各说各的(定义不同,结局指标也不同)?

如果这层区分做不好,后面头脑风暴想得再热闹,也只是在放大前期的误判。我在设计这一步时花的时间最多,因为基础不牢,后面全废。

建议插入一张办公桌上铺满标注过的打印论文和手写笔记的照片,表现人工比对文献的繁琐场景。图片来源:Unsplash

## 头脑风暴怎么做到不天马行空?

系统沿理论、人群、测量、设计等固定维度发散,但每个想法都必须锚定回具体的文献问题。

问题卡建好,开始出主意。这里有个硬约束:不能乱飞。系统会挨个检查理论解释、核心构念、研究人群、使用情境、测量方法、观察时间、研究设计、数据来源和实际实施情况。同一个证据冲突,能长出好几个不同的候选方向。

拿个假设情况来说。现有文献讨论同一个现象,一部分研究用自我报告量表,另一部分用客观生理指标,结果对不上。而且大部分研究都是横断面设计。如果按以前的套路,很多人会写一句“现有研究结果不一致,建议未来开展进一步研究”交差。

rw-research-novelty 不会停在这。它会接着往下逼问:这两种工具测的到底是不是同一个构念?结果差异是不是纯粹因为测量误差?横断面数据根本没有时间先后,怎么确定因果关系?换个人群或者换个应用场景,结果会不会变?

顺着这些问法,就能拆出测量效度验证、纵向追踪、机制探讨、人群差异比较这几个截然不同的候选方向。它们全都是从同一组证据里长出来的,但回答的科学问题不一样,需要的数据类型和实验设计也完全不同。发散是可以的,但每根风筝线都得拴在证据问题卡的那个桩上。

## 候选创新点为什么要先接受“找茬”?

每个候选方向都必须列出替代解释和反例,把“能讲故事的想法”逼成“能被数据反驳的问题”。

候选方向出来了,我不会立刻给它贴“创新点”的标签。这一步叫反驳,也是整套流程里最冷酷的一环。每个方向必须硬性满足几个条件:至少列出两个替代解释,找一个反例,还要说明什么样的结果会直接削弱这个方向。

假如你推测结果冲突是因为测量方法不同。替代解释可能是样本本身有差异,也可能是统计模型没选对。反例可能是:已经有研究用了同一种测量工具,结果还是反的。如果这个反例在文献里真的成立,你原来的“测量解释”就被打穿了,必须修改或者放弃。

很多开题报告被毙,就是因为讲故事讲得太顺,没考虑反例。这一步的作用就是提前把那种“听起来很顺但其实经不起推敲”的想法筛掉,留下能被真实验证或者证伪的硬问题。

## 搜不到相似研究,就能说是“首创”吗?

系统会二次检索,把新颖性严格分成四种状态,“没搜到”绝对不等于“首创”。

候选方向定了,系统会再做一次文献检索。这次的目的和最初了解领域完全不一样,这是专门来“抓重”的。检索完,结果会被分进四个框。

没有发现相似研究。当前还没完成核验。已经有类似工作,但你的新数据、新方法或者新情境还能带来增量贡献。别人已经把这条路走完了,候选点直接淘汰。

我最反感把“我没搜到”包装成“世界首次”。新颖性在二次检索和领域核验没跑完之前,状态只能挂“待核验”。不吹牛,不抢跑。如果一个方向落在第四个框里,哪怕你花了很大力气去构思,该砍还是得砍。

## 创新性、价值和可行性为什么要分开打分?

新不等于重要,重要不等于能做,系统用多维标注代替一个总分,保留每一项的排除理由。

一个方向很新,可能毫无学术价值。一个问题极其重要,你手头可能根本拿不到数据。NIH 的评审框架把研究重要性和创新性放在一起考量,同时又单独检查方法严谨性和可行性。它还特意说明了一件事:就算没用新概念或新方法,只要对领域有实际推动,一样算有价值。

rw-research-novelty 借用了这种分开判断的逻辑。它对着每个候选点,分别查证据基础、潜在贡献、新颖性置信度、可行性、可证伪性、伦理要求和资源限制。

我不喜欢用一张总分表把所有问题盖住。实际情况经常是:A 方向有贡献但你没数据;B 方向好做但纯属重复劳动。系统会把每一项的判断和淘汰理由全留下来。你看到的不是一份按分数排队的题目清单,而是一张带病理报告的体检表,清清楚楚标着死因。

## 这个 Skill 在整个研究流程里处在什么位置?

它夹在证据映射和研究设计之间,前接文献整理,后接方案落地与同行攻击。

它不是单打独斗的。完整的链条是这样咬合的:rw-research-question 先把研究边界圈死;rw-literature-discovery 出去找文献、验文献;rw-paper-extractor 把散装的论文拆成能对比的字段;rw-evidence-map 画出空白和冲突。到这儿,轮到 rw-research-novelty 出场,围绕前面挖出来的问题生成并筛选候选创新点。筛完之后,rw-research-design 接手,看这些方向能不能落地成完整的研究方案。最后 rw-research-referee 扮演杠精,在执行前对着方案狂轰滥炸,查替代解释、查偏倚、查过度外推。

这套流程一次只解决一个阶段的问题。上一个阶段没走完,不往下走。

## 用了这个工具,研究者自己还要干什么?

系统负责整理证据、发散方向和排雷,但领域判断、伦理把关和最终创新裁决仍然由人完成。

你不用再手动逐篇做比对表了,也不必对着空白文档发呆。但你得干几件机器干不了的事。提供输入材料,说清现实条件,这是基础。系统可以帮你扩大搜索、理清证据结构、生成解释、排除重复、检查设计漏洞。

但到底哪个问题值得你投入两三年时间?哪些数据实际上能拿到?哪些伦理红线和行业规矩不能碰?这些得你自己拍板。甚至最终的创新判断,也不能甩给系统。一个候选点对某个具体学科到底算不算贡献,还得结合你在这个领域浸淫多年的直觉、导师的看法、同行的反馈,以及当下的大环境。

RW Research Skill 的本质,是把原来散落在人脑记忆、Excel 表格和组会争吵里的那套隐性过程,给拎出来摆到了台面上。它不会替你宣布“你创新了”。它只是让你看清楚:你手里这个候选点,是从哪块证据里长出来的,挨过哪些反驳,哪里还没查实,下一步该去干嘛。


## 实用摘要 / 操作清单

  1. 收集并结构化文献:在调用 rw-research-novelty 前,确保已经通过 rw-paper-extractor 和 rw-evidence-map 把论文拆成了可比较的字段,并标出了证据空白与冲突。
  2. 梳理现实约束:准备好你能获取的数据类型、可接触的人群、资源预算和伦理限制清单,作为系统输入的硬性边界。
  3. 核实证据问题卡:检查系统生成的卡片是否准确区分了“没研究”与“没找到”、“没报告”与“没测量”、“真冲突”与“假冲突”。
  4. 审视反驳逻辑:对系统给出的候选方向,重点看替代解释是否合理、反例是否成立、削弱条件是否苛刻。
  5. 确认核验状态:对于标记为“待核验”的新颖性判断,手动或借助 rw-literature-discovery 完成二次检索,确认落入四个状态框的哪一个。
  6. 综合多维评分:不要只看总分,单独检查“可行性”和“可证伪性”两项,淘汰那些点子好但做不出来、或者怎么解释都对的伪问题。
  7. 人工终裁:结合导师意见和领域常识,在系统筛出的候选池里做最终选择,系统不承担创新成立的最终责任。

## 一页速览

确定研究边界(rw-research-question)

检索与核验文献

论文结构化提取

绘制证据图,标出空白/冲突/异常

建立证据问题卡,拆解 gap 性质

受证据约束的多维度头脑风暴

对候选方向执行硬性反驳(替代解释+反例+削弱条件)

二次文献检索,判定新颖性状态(未发现/待核验/有增量/已覆盖)

多维度分开打分(证据基础/贡献/新颖性/可行性/可证伪性/伦理/资源)

转译为研究方案

执行前攻击与防御


## 常见疑问解答

rw-research-novelty 能直接根据我的研究兴趣生成选题吗?
不能。它需要你已经整理好的文献提取表、证据图或种子论文,以及明确的现实条件限制,从宽泛兴趣出发的猜测不属于它的处理范围。

如果证据图显示某个方向完全空白,系统能直接判定为高价值创新点吗?
不会。完全空白可能只是检索遗漏或跨学科发表,系统会先建问题卡核实空白性质,再生成候选方向并强制接受反驳,不会跳过验证直接给高评价。

系统提出的替代解释和反例是从哪里来的?
全部来自你输入的已有文献和证据逻辑。它不会凭空捏造反例,而是通过交叉比对输入材料中的研究差异、方法差异和结果差异来构造反驳。

为什么新颖性不直接给一个确定的结论,而是用“待核验”这种中间状态?
因为“没搜到”不等于“不存在”。在二次检索和领域专家核验完成前,直接宣称“首创”是不严谨的,系统必须保留这种不确定性。

如果一个候选点在“创新性”上得分很高,但“可行性”为零,系统会怎么处理?
它不会用总分掩盖问题,而是会保留这个候选点,明确标注“有贡献但缺少可取得的数据”,并给出具体的排除理由,由研究者决定是否调整条件。

这套流程走完,我是不是就不用找导师讨论了?
恰恰相反。系统替代的是做表格、找冲突和初步排雷的体力活,最终的创新判断、学科价值评估和现实决策仍然需要结合导师意见和同行交流来完成。