
一篇論文即使句句通順,論點、方法和證據仍可能接不上。SciSlop 是一套衡量 AI 生成論文科學內容品質的評估工具,從結構、論證和研究材料三個面向檢查六種問題,而不是只判斷文字像不像 AI 所寫。
配套的 SciSlopBench 收錄 390 組 AI 生成論文與人類撰寫論文,讓研究者比較不同評分方法分辨兩者的能力。已釋出的分數中,SciSlop 的配對準確率為 0.859;作為基準的 Binoculars 為 0.687。這是特定測試集上的結果,不能直接解讀成工具能判定任何論文真偽。
另一部分 SciSlopHarness 會引導固定的大型語言模型修改論文,但只在實驗紀錄能支持修改時才動筆。這個限制有助避免模型為了讓文字看起來更好而擅自改變研究主張;不過,現有說明沒有提供足以判斷修改品質的完整數字。
儲存庫同時提供基準資料、評估程式、比較用的偵測器與自動審稿系統,以及分析 2017 至 2026 年 ICLR 審稿分數和決策的程式。資料以三個 Parquet 表格釋出;安裝 Python 依賴後,可先讀取分數表重算配對準確率與 AUROC,再按文件流程重跑部分確定性指標。GPU 套件屬可選項,模型相關指標則可能需要外部模型呼叫。
- 六項指標涵蓋結構、論證與研究材料。
- SciSlopBench 包含 390 組配對論文。
- 公開分數中的配對準確率為 0.859,高於 Binoculars 的 0.687。
- SciSlopHarness 只在實驗紀錄支持時才修改內容。
對研究團隊而言,這套工具適合用來檢查 AI 輔助寫作是否削弱論證連貫性,也能作為研究論文評估方法的測試材料。項目應視為研究用途,不能取代專家對方法、證據及引用的審閱。