AI倒查論文100年!99.2%的頂刊都有問題...

程淺 發自 凹非寺

量子位 | 公眾號 QbitAI

誰再說科研已經沒有新問題了論文?好方向全被前人佔滿了??

如果我說——

那些已經發表的頂刊論文裡論文,大多都有問題呢?

AI倒查論文100年!99.2%的頂刊都有問題...

最近論文,有研究者用AI Agent「學術打假」後發現:

2026年國際機器學習大會(ICML)上報告的92篇論文中,有58篇已經無法復現論文

真假??莫非論文,猛發頂刊的機會真的來了?

頂會論文正在集體被AI「打假」

通常一篇論文能夠進入頂級會議,就說明它已經經過了同行評審論文

然而受精力所限,同行評審審稿人幾乎沒有時間從頭下載資料、執行模型或復現實驗,以驗證論文中的每一個實驗結論論文

與此同時隨著AI領域的論文數量爆炸增長,模型越來越複雜,實驗規模越來越大,一篇論文背後的程式碼、資料、引數設定可能涉及數百個細節論文

論文的可驗證性也就變得越發重要論文,論文發表了,但其中的結論能被重新跑出來嗎?

目前,AI Agent大大降低了這種驗證和復現的成本論文

7月22日,美國某研究審查公司用AI Agent對ICML 2026全部168篇口頭報告論文進行了系統性的結果復現審計論文

AI倒查論文100年!99.2%的頂刊都有問題...

展開全文

168篇論文中有92篇擁有至少5條可供驗證的結論性宣告論文

最終的結果是:AI Agent能夠成功復現超過四成結論的,只有34篇;而能復現八成以上結論的,僅有8篇論文

不過需要說明的是,“無法復現”和“研究造假”之間還存在著巨大區別論文

復現失敗的原因包括不限於程式碼缺少關鍵檔案、依賴庫版本斷裂、執行結果與論文不符,還有4篇論文依賴的模型已下線,這意味著實驗結果已經永久性地無法被任何人復現論文

除此外論文,還有一些就錯的比較離譜了——

比如,一篇論文將「僅訓練基礎模型0.77%的引數」作為核心賣點,但其實際開源的checkpoint訓練了6.31%的引數,相差約8倍論文

另一篇論文放了一張基於某評判模型的可靠性表格,但其開原始碼中根本不包含該評判模型,也沒有任何指令碼能夠生成表格裡的結果論文

AI倒查論文100年!99.2%的頂刊都有問題...

無獨有偶,2026年抱抱臉與AlphaXiv聯合發起針對ICML 2026的「Agent Reproduction Challenge」挑戰賽,邀請研究者使用AI Coding Agent對ICML 2026接收的論文進行自動化復現,結果同樣很不樂觀論文

類似的趨勢在論文錯漏檢測中的體現更令人驚異論文

2025年底,一項研究開發了基於GPT-5的論文檢查系統,用於分析已經發表在頂級 AI 會議和期刊上的論文,尋找可以客觀驗證的問題論文。研究者非常明確地表示:

我們只看「客觀錯誤」,我們不管論文的創新性和研究價值論文

最終結果顯示,平均每篇論文被檢測出4.7個客觀錯誤,99.2%的論文至少被標記出了一個問題論文

AI倒查論文100年!99.2%的頂刊都有問題...

△圖片系AI生成

從錯誤型別來看,數學與公式錯誤佔比最高,達到54.0%(包括方程式寫錯、推導邏輯有漏洞、證明中的錯誤假設等)論文

大約30.8%的NeurIPS論文和23.8%的ICLR論文包含至少一個可能影響結果解讀的實質性錯誤論文

更值得注意的是時間趨勢:NeurIPS論文的篇均錯誤數從2021年的3.8個上升至2025年的5.9個,漲幅55.3%論文

或許在今後,論文發表不再意味著研究宣告「勝利」,而只是再次進入了下一輪AI驗證的開始論文

學術萌新重大利好論文,不做實驗也能發頂刊

所以,朋友們,這對正在愁選題的人來說,可能還真是個相當意外的「利好」論文

查文獻挑錯、寫勘誤,本來就是學術圈裡正經八百的產出形式,如今看來,完全的學術藍海啊論文

AI倒查論文100年!99.2%的頂刊都有問題...

具體怎麼下手?給愁選題的學術萌新們支幾招:

第一,轉變研究思路,不卷前沿捲過去論文

從“找新選題”轉向“找舊論文裡的異常點”,重點關注那些被大量引用但爭議較少的經典論文論文。畢竟“99.2%的論文至少有一處錯誤”。

第二,讓AI幫你製作知識地圖和研究譜系論文

這種知識地圖可以幫你理解——哪些是真正的奠基性工作?哪些研究觀點目前還存在爭議?哪些結論被大量引用但缺少驗證?不同論文之間的引用關係是什麼?從而由此找到過去難以發現的連線和異常論文

第三論文,Ask anything.

科學史上的很多重要突破並不來自於提出全新的問題,而來自重新審視一個長期被接受的假設論文

例如:一個經典實驗是否按照今天的標準被驗證過?一個被廣泛引用的結論論文,是否存在未被注意的限制條件?

過去,這種追問成本非常高,研究者需要花費大量時間查閱原始文獻、比較實驗細節,而如今AI讓這種成本幾乎歸零了論文

AI或將開始重整科學史

最近,浙江實驗室理論化學家Pios在使用AI預測分子沸點時,發現結果與一份75年前的化學資料庫存在明顯衝突論文

對此,任何人的第一反應可能都是“那肯定是我錯了唄”論文

Pios也不例外,他連忙檢查自己的模型論文。但在手動回溯了原始文獻之後他發現:天吶,AI竟然是對的那一個。

Pios大為驚訝,隨後用AI繼續核查,竟然還發現了一份約一個世紀前且被學界公認權威的沸點測量值也是錯的論文

要知道,這些資料已經被經年累月地引用、吸納於後代的研究之中論文

這類問題此前長期未被發現可能與科學文獻的規模直接相關論文

AI倒查論文100年!99.2%的頂刊都有問題...

△圖片系AI生成

現代科學論文的數量已經遠遠超出任何個體研究者的閱讀極限,例如,僅一家人工智慧頂會ICLR的年度投稿量就從2018年的1013篇上升至2026年的19619篇論文

在這樣的規模下,一處最初出現在某篇論文中的錯誤一旦被後續文獻反覆引用,就會沿著引用鏈持續傳遞,形成事實上的學術共識論文

由於年代久遠、引用鏈條複雜,加之複核工作耗時巨大而學術回報有限,絕大多數已進入文獻體系的錯誤從未被系統性地審視過論文

但如今一切都鬆動了,至少在技術能力上,人們首次具備了大規模重審過往科學文獻的可能論文

不過,以GPT-5驅動的Paper Correctness Checker為例,其檢測精確率為83.2%,且每次檢測中仍有約四成真實錯誤未被檢出論文

可以說,此類AI事實核查工具本身不足以擔任科學文獻的判官,AI核查工具的輸出結果最後還需要人工來稽覈論文

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://mobile.haizhilanhn.com/tags-%E9%80%99%E7%95%AA.html

🌐 /