AI-Empowered Academic Research
十七章,從「什麼是 Agent」開始講起。每一章都有動手練習,用你自己的論文與文獻跑一次。
Vista(鄭緯筌)2026.09 v1
01
研究者基地主理人
長期投入 AI 如何真正落地在寫作與研究工作中,而不只是停留在展示技巧的階段。服務對象是研究生、博士後與教研人員。
41所
合作校院與研究機構
學術場域
83場
可查證授課場次
學術場域
21本
出版著作
全領域
1.4萬
練功團成員
全領域
不用 AI 怕落後,用了 AI 又怕被指控代寫。有人乾脆不揭露,把風險留給自己。
AI 幫你寫完初稿,你自己都看不懂邏輯。投稿一被審稿人追問細節就穿幫。
大家都用同一套 AI 產同一種文字,審稿人的閱讀疲勞在惡化,創新性門檻在墊高。
三個現象看起來不同,共同缺陷卻是同一個:把 AI 當代寫者。今天要換一個位置來用它。
AI 不會取代研究者,但善用 AI 的研究者,
會取代不善用 AI 的研究者。
怎麼下 prompt 讓 AI 幫你寫論文。
ChatGPT、Claude 你都會了。單次問答式的用法,不需要一堂課。
一整套可累積、可產生複利、留在你手上的工作流。
差別不在會不會用 AI,在有沒有一套會進化的工作流。
模板會過期,方法論不會。你要帶走的是判斷什麼時候該用哪一支、什麼時候不該用。
核心洞察與研究貢獻,從頭到尾都應該是你的。這也是我選教材的判斷標準。
14 支授權明確的開源 Skills,加上一套你自己就能維護的工作流。
每一層都自成完整,你在任何一層停下來,手上都已經有可以用的東西。
三個名詞、心態邊界、研究工作流全貌,最後把環境裝起來並跑第一支 skill。
找得到、讀得懂、留得下。這是每個研究者天天都在做的事,投報率最高。
寫作前規劃、逐節寫作、兩支改稿工具,再到投稿前自審與回應審稿意見。
文獻回顧報告、提問線、實驗線、四條方法論公式,以及換到別的執行環境。
每一頁左上角都標著層級。看到 LEVEL 1 就是地基,看到 LEVEL 4 就是進階選配。
Agent、Skill、工作流
副駕駛、複利、倫理
八節點與 AI 適用度
你該用哪一個
裝好並跑第一次
paper-navigator
deeppapernote 與 Obsidian
planning 與 writing
sciwrite 與 humanizer
自審與回應審稿意見
research-survey
缺口定位與生題
診斷、管線、程式碼
四條判斷公式
搬到 Codex
PaperBrain 選配
安裝清單與三十天
分散在第 5 到 9 章
我不發統一的範例檔。你帶自己的東西來,離開教室時手上就有真的成果。
練習頁是綠色的。看到綠色那一頁,就是換你動手了。
macOS 或 Windows 都可以。硬碟留 2 GB 以上,而且你有安裝軟體的權限。
公司或學校配發的機器請先確認權限。
至少成功登入過一次,兩步驟驗證的手機在身邊。
帳號與付款問題現場救不了,務必事前確認。
可以是你在寫的稿,也可以是你想讀懂的那一篇。練習時間都靠它。
受試者原始資料今天請不要帶進來。
三個網址開得起來就沒問題:claude.ai github.com npmjs.com
| 你的狀態 | 你現在大概是這樣用 AI | 今天對你最有用的是 |
|---|---|---|
| 完全沒用過 | 連對話框都很少打開,聽同事講過但沒動手。 | 第 1 到 5 章。今天結束你會跑起第一支 skill。 |
| 問答式使用 | 會問 ChatGPT 或 Claude,複製答案貼回文件。 | 第 1、2 章換位置,第 6 到 9 章換工具。 |
| 裝過工具 | 裝過 Claude Code,但不知道 skill 要放哪、怎麼叫。 | 第 4、5 章補洞,之後整條線串起來。 |
| 已經在用 | 有自己的 prompt 收藏夾,但每次都要重講一遍。 | 第 1 章的複利段,以及第 14 章的四條公式。 |
四個階段沒有高下之分。差別只在起跑點,不在終點。
接下來十分鐘沒有任何學術內容。
只有三個名詞。
但這三個名詞不先講清楚,後面十四支 skill 你會不知道自己在裝什麼。
01
這一章沒有任何學術內容。但這三個詞不先講清楚,後面十四支 skill 你會不知道自己在裝什麼。
打開對話框,問一句,複製答案
讓它住進你的電腦,讀你的資料夾,寫出檔案
差別不在模型比較聰明,在於它有沒有手腳,以及你有沒有給它一份規範。
同一個模型,差在能不能動手。這張表是整堂課的前提。
| 維度 | 聊天機器人 | AI Agent |
|---|---|---|
| 你給它什麼 | 一個問題 | 一個目標 |
| 它做什麼 | 回一段文字 | 自己拆解步驟,逐步執行 |
| 能不能讀你的檔案 | 不能,只能你貼給它 | 能,直接讀資料夾 |
| 能不能產生檔案 | 不能,只能你複製貼上 | 能,直接寫進你指定的位置 |
| 能不能執行指令 | 不能 | 能,跑腳本、呼叫 API、查資料庫 |
| 下一次還記得嗎 | 不記得 | 記得,規則寫在檔案裡 |
一句話:聊天機器人給你答案,Agent 幫你把事情做完。而做完的定義是「你的電腦裡多了一個檔案」。
你:「幫我整理這十篇論文的比較表」
你:「把桌面 papers 資料夾裡的十篇做成比較表」
比較表.md,存進你的研究資料夾。注意右邊那句話有多短。你沒有下 prompt,你下的是交辦。這就是 Agent 的意思。
一支 skill,
就是一個資料夾,
裡面放一份寫給 AI 看的說明書。
它不是外掛,不是 App,也不是要付費訂閱的服務。
paper-navigator/ ├── SKILL.md # 必要:說明書本體 ├── scripts/ # 可選:可執行的小程式 ├── references/ # 可選:參考資料 └── assets/ # 可選:範本與素材
沒有程式,沒有編譯,就是 Markdown。你現在就打得開它、讀得懂它、改得動它。這件事很重要,第 15 章講「換一個環境」時,全部建立在這個事實上。
---
name: paper-navigator
description: Find and read academic papers via
Semantic Scholar and arXiv, with citation-graph
search and tiered reading.
---
# 以下是寫給 AI 看的工作流指示
## 執行步驟
1. 先做關鍵字消歧
2. 多來源檢索並追引用網
3. 用 rubric 評分排序
4. 依三層閱讀法分配時間
## 硬規則
每筆書目必附 DOI,且先驗證存在才能列入。
只有兩個欄位必填:name 與 description。AI 靠 description 判斷這次該不該叫這一支。
你怎麼交代助理,就怎麼寫。沒有語法要學,就是一份 SOP,只是讀者是 AI。
每次交辦你都要從頭講一遍:格式、順序、禁忌、要附什麼。講十次就是十次成本。
你只講一次,寫進手冊。之後他自己翻手冊做事,做出來的東西每次一樣。
他哪裡做錯,你就在手冊上補一條。下一次那個錯不會再出現,而且是永久的。
這個比喻幾乎可以整段搬過來用。唯一的差別是:這位助理不會忘記翻手冊。
| 維度 | 存一堆 prompt 模板 | 寫成 skill |
|---|---|---|
| 存在哪 | 記事本、書籤、Notion | 你的電腦,AI 讀得到的位置 |
| 怎麼啟動 | 你要記得它存在,找出來,貼上 | AI 看 description 自己判斷要不要用 |
| 會不會忘記用 | 會,這是最大的問題 | 不會 |
| 改進之後 | 要記得下次貼新版 | 改一次,之後每次都是新版 |
| 能不能加檢查 | 不能 | 能,跑腳本驗證 |
| 能不能給別人 | 貼給他,他還是會忘記用 | 給他一個資料夾就好 |
prompt 是你每次都要重講的話;skill 是你只講一次、之後它自己記得的規矩。
那是綁在某一家平臺的設定。skill 是你電腦裡的檔案,換平臺就搬資料夾。第 15 章會實際搬一次給你看。
MCP 是「接上外部資料源」的插座,例如接你的 Zotero。skill 是「怎麼做事」的說明書。兩者互補,不是替代。
指令檔是永遠生效的全域規矩。skill 是需要時才載入的專項流程。全部塞進指令檔,AI 每次都要讀一大堆無關的東西。
今天講的 14 支全部開源、免費、授權明確。你不會被綁在任何一家的訂閱上。
這六個判斷標準是我實際拆過幾十支之後收斂出來的。順序就是重要性順序。
找不到 LICENSE 檔的,直接跳過。你不知道能不能用、能不能改、能不能給學生。
好的 skill,README 會告訴你它要解決什麼痛點、為什麼不用別的做法。說不出來的,多半只是把 prompt 換個檔名。
只寫優點不寫邊界的,代表作者沒真的用過。好的 skill 會寫「不要拿我做 A、B、C」。
下一頁還有三條,而且那三條更少人注意。
好的 skill 會寫死「證據不足就停下來要更好的材料,不准產出降級成品」。deeppapernote 甚至逐句規定 AI 不准說「已完成」,除非該階段真的跑過。這一條最值錢。
零相依的純 markdown 最好搬,也最不會壞。要裝套件、要申請金鑰的,用之前先確認你真的需要它多出來的那個能力。
不要只看最後更新日期。純規則的 skill 半年沒動可能只代表規則穩定;有腳本、有 API 相依的半年沒動就要小心。看它的性質,不是看 commit 頻率。
一個反例:star 數不是判斷標準。今天講的三支獨立 skill,star 從 825 到 1426 都有,但最好用的那一支不是 star 最多的那一支。
| 判斷標準 | deeppapernote | sciwrite | academic-humanizer |
|---|---|---|---|
| 授權 | MIT,清楚 | CC BY 4.0,散布要署名 | MIT,另含衍生聲明 |
| 設計理念 | README 開篇就講痛點 | 有,而且交代了製作方法 | 有,說明校準方式 |
| 邊界 | 明列三條「不做什麼」 | 明列四條 | 明列,含倫理聲明 |
| 不唬爛 | fail-closed,管到用詞 | 有約束,較輕 | 改寫要覆蓋原文全部內容 |
| 相依 | Python ≥3.10 加 PyMuPDF | 零 | 零 |
| 維護 | 活躍,有 CI 與測試 | 靜態,純規則故合理 | 靜態,純規則故合理 |
三支都通過。但你會發現它們強在不同地方:deeppapernote 是工程最紮實的,sciwrite 是方法論最有來歷的,academic-humanizer 是校準方式最誠實的。
paper-navigator 找文獻的入口
paper-writing 逐節寫作工作流
sciwrite 句級寫作體檢
讀不完 → deeppapernote
題目定不下來 → paper-graph、research-ideation
寫不出來 → paper-planning
要投稿 → paper-review、paper-rebuttal
research-survey 要寫文獻回顧報告
experiment-craft 跑實驗
experiment-pipeline 做管線
experiment-iterative-coder 寫分析程式
academic-humanizer AI 味太重
不要一次裝 14 支。裝太多有兩個具體壞處:一是你分不出哪一支真的有用;二是 skill 清單會佔掉 AI 的閱讀額度,描述被截斷之後,它自動選用的準確率反而下降。
有手腳的 AI。讀得到你的檔案,寫得出檔案,跑得動指令。你給的是目標,不是問題。
一個資料夾加一份 markdown 說明書。只有 name 與 description 是必填。你改得動,也搬得走。
把有效的做法寫成 skill,讓它每次自動生效。這樣每一次研究都墊高下一次的地板。
接下來十六章,都是在把研究流程的每一格,
換成一份你改得動、搬得走的說明書。
02
工具會換,這一章不會。先把位置站對,後面十四支 skill 才有意義。
The point of doing research is not to produce papers.
It is to produce understanding.
如果研究的目的是產出理解,那麼把理解外包出去的每一個動作,都在削弱研究本身。這句話是整套工作流的設計前提。
你沒看過中間過程,只拿到結果。出事的時候,你不知道哪一步錯了,也說不出為什麼要這樣做。
你們看的是同一條路。他提醒你儀表板的異常,但轉不轉彎、踩不踩剎車,永遠是你決定。
今天要教的所有工具,
都是副駕駛,不是代駕。
| 副駕駛:對外可辯護,對內能產生複利 | 代寫:兩者皆無 | |
|---|---|---|
| 順序 | 你先想過,AI 補強或挑戰你 | AI 先產,你事後湊 |
| 判斷 | 每一段 AI 產出都由你判斷、改寫、簽名 | 你不確定為什麼要這樣寫,只是照抄 |
| 辯護 | 產出可以拿去被審稿人追問細節 | 審稿人一問細節你就露餡 |
| 紀錄 | 協作痕跡揭露,方法留下紀錄 | 協作痕跡刻意抹掉,沒有揭露 |
| 長期 | 你的判斷力愈用愈強 | 你的判斷力愈用愈弱 |
判斷標準只有兩條:對外可辯護,對內能產生複利。兩條都過,怎麼用都不會出事;有一條沒過,用得再少都有風險。
丟一句「幫我寫一段文獻回顧」,把輸出直接貼進論文。
論述沒有你的判斷,審稿人追問邏輯就崩塌。
你自己讀不出這一段為什麼要放在這裡。
先自己列出要對話的三組文獻,再讓 AI 補強論述的接縫。
這是最常見、也最容易在口試現場被抓出來的一種。它的代價不是被退稿,是你失去對自己論文的掌握。
請 AI「補幾篇支持這個論點的文獻」,直接照抄書目。
幻覺引用。撞的是學術誠信的第一條紅線。
DOI 打進 Google Scholar 找不到,Semantic Scholar 也查無此文。
每一筆都回 Crossref 或 Google Scholar 人工查證,查不到就標「未驗證」。
每筆書目必附 DOI,且先用 api.crossref.org/works/<DOI> 驗證存在才能列入;
查無此 DOI 一律標註「未驗證」。
這條規則寫進你的指令檔,AI 就不會再編。
同一份稿子讓 AI 換個說法,同時投多個期刊或研討會。
一稿多投、自我抄襲,加上誇大修改幅度。
你說不出這兩個版本的貢獻差在哪裡。
用投稿策略決定去哪一家,而不是用產能決定投幾家。
AI 讓產能變高,但學術界的稀缺資源從來不是產能,是審稿人的注意力。用產能去洗注意力,長期是把自己的信譽折現。
複利不是產出多,是每一次都墊高下一次的地板。
一致的歸檔,才是複利引擎。這句話在第 7 章會再出現一次。
讓 AI 生出你沒讀過的文獻,或直接採用未經查證的書目與 DOI。
讓 AI 生成、補齊或美化實驗數據、受訪者引言、統計結果。
達到實質協助門檻卻不說明,或刻意抹除協作痕跡。
前兩條是造假,第三條是不誠實。三條都不是灰色地帶,也沒有「大家都這樣」的免責空間。
作者身分要能承擔責任,AI 承擔不了。
寫在方法段或致謝,看該刊規定。
包含 AI 產出的每一句。
你的名字掛上去,
就是你要為每一句話負責。
界線不在「用了多少 AI」,在「AI 有沒有參與產生內容與判斷」。拿不準就揭露,成本遠低於被質疑。
避免使用「AI-generated」這種模糊字。寫清楚三件事:AI 做了什麼、你做了什麼、責任在誰。方括號裡的內容要換成你真正做過的事,不要照抄。
歐盟 AI 法第 50 條的透明度要求上路,模型供應商開始在輸出裡嵌入來源標記。
.svg、.png、.jpg 等檔案不要過度解讀。官方目前列為已支援的只有部分新模型;逐字重寫會移除浮水印;記號也不能證明著作權歸屬。
記號不是免罪符,
也不是判罪書。
判斷標準始終沒變:達到實質協助門檻,就主動揭露。
刻意抹除協作痕跡,撞的是第三條紅線。而主動揭露的人,從來不需要擔心別人驗出什麼。
訪談錄音、逐字稿、問卷原始回應、任何可辨識個人的資料,都不該進雲端模型。這與模型好不好無關,是研究倫理審查的範圍。
先去識別再處理,或整套流程留在本機。第 4 章會講清楚哪些環境做得到本機處理。
不確定就先問 IRB。
事後補救比事前確認貴 100 倍。
問 AI 之前先寫下你自己的答案。沒有自己的版本,就沒有判斷 AI 好壞的基準。
每一段 AI 產出都要能回答「這句話的證據在哪裡」。回答不了就不要用。
把有效的流程寫成指令檔或 skill。下一次不必重講,而且會愈用愈準。
每隔一段時間刻意不用 AI 做一次完整流程,確認你的判斷力還在。
03
單點的 AI 沒有複利,整條工作流才有。先看見全貌,才知道每一支 skill 要插在哪裡。
從模糊興趣收斂成可回答的問題
找到該讀的那批,不是最多的那批
讀懂並歸檔成可複用的筆記
選定取徑並自我檢查說服力
實驗、訪談、問卷、檔案
跑出結果並確認可重複驗證
把發現變成可被審查的論述
被審、回應、修改、再投
第 8 節點不是終點。投稿過程中被審稿人逼出來的問題,往往就是下一輪的第 1 節點。
愈靠近表達與探索,AI 可以主導;愈靠近判斷與立場,你要主導。
AI 適合做:把模糊主題展開成候選問題、找出領域缺口、逼你把選擇標準說清楚。
AI 不適合做:替你決定要做哪一題。那牽涉你的興趣、資源與生涯規劃。
對應 Skill paper-graph research-ideation
AI 適合做:關鍵字消歧、文獻追蹤、當前最佳(SOTA, State-of-the-Art)盤點、分層快篩。
AI 不適合做:憑記憶生成書目。每一筆都要回資料庫驗證。
對應 Skill paper-navigator
這兩格是今天 LEVEL 2 文獻線的主場。第 6 章會整章講 paper-navigator。
AI 適合做:重建作者的論證邏輯、標記證據強度、產出格式一致的筆記與比較矩陣。
AI 不適合做:替你判斷這篇跟你的題目有沒有關係。
對應 Skill deeppapernote research-survey
AI 適合做:用領域演化圖譜確認你的方法接在哪一條路線的下一棒,以及研究設計的自我檢查。
AI 不適合做:選定取徑。質性或量化、個案或紮根,這是你的立場。
對應 Skill paper-graph experiment-craft
節點 4 是整條流程裡現成工具最少的一格。paper-graph 幫你定位,但方法的說服力要靠第 14 章的框架自己撐。
AI 適合做:資料清理腳本、格式轉換、結構化的實驗日誌。
AI 不適合做:接觸原始個資。這一格有紅線,見第 2 章。
對應 Skill experiment-craft
AI 適合做:重現基準模型、超參調校、消融實驗的規劃與除錯。
AI 不適合做:下因果宣稱。相關不等於因果,這句話 AI 常常忘記。
對應 Skill experiment-pipeline experiment-iterative-coder
這兩格對應第 13 章的實驗線。做質性研究的人也用得上,只是換一個載體。
AI 適合做:寫作前的故事設計、逐節骨架、句級清理、降低 AI 味。
AI 不適合做:決定你的主張要收多窄。那是你對證據強度的判斷。
對應 Skill paper-planning paper-writing sciwrite academic-humanizer
AI 適合做:投稿前自審、審稿意見分類、逐點回應的結構。
AI 不適合做:代你寫「我們已補做實驗」這種你沒做的事。
對應 Skill paper-review paper-rebuttal
這兩格就是 LEVEL 3,也是今天花最多時間的地方。
愈靠近「表達與探索」,AI 可以主導;
愈靠近「判斷與立場」,你要主導。
要問「這件事屬於表達,還是屬於判斷」。
自動化到判斷那一格就該停,那是你的價值所在。
先看你卡在哪一個節點,只學那一格的。
04
這一章決定後面每一支 skill 跑不跑得起來。環境沒選對,方法論再好也落不了地。
這是最容易混淆的地方。你會遇到的其實是四個不同的東西。
| 名稱 | 實際是什麼 | 跑在哪裡 |
|---|---|---|
| 終端機裡的 Claude Code | 原生型態。一個在命令列跑的 agent | 你的本機 |
| Claude 桌面 App 的 Code 分頁 | 同一個 Claude Code,換上圖形介面 | 你的本機 |
| Claude Code on Web(claude.ai/code) | Claude Code 的雲端版 | Anthropic 管理的沙箱 VM |
| 瀏覽器版 claude.ai 對話 | 不是 Claude Code,是聊天介面 | 雲端 |
多數人說「Claude Code 的 App 版」時,指的是第二個。它就是 Claude Code,只是把終端機換成了圖形介面。所以「不想碰終端機」跟「不能用 Claude Code」是兩回事。
| 能力 | 終端機/PowerShell | 桌面 App Code 分頁 | Claude Code on Web | 瀏覽器版 claude.ai |
|---|---|---|---|---|
| Skills | 支援,本機路徑 | 支援,本機路徑 | 需先進 git repo | 可上傳,限規格內欄位 |
| MCP server | 支援,含本機 stdio | 支援,含本機 stdio | 僅遠端 HTTP | 僅遠端 Connectors |
| 本機檔案系統 | 完全存取 | 完全存取 | 不支援 | 不支援 |
| 執行 shell 指令 | 支援,可自訂權限 | 支援 | 支援,沙箱內 | 不支援 |
| 讀你桌面的 PDF | 可以 | 可以 | 不可以 | 需逐檔上傳 |
| 寫檔進 Obsidian vault | 可以 | 可以 | 不可以 | 不可以 |
| 指令可複製、可存檔重跑 | 可以,逐字留存 | 部分 | 部分 | 不可以 |
| 出錯時看得到原始訊息 | 完整訊息 | 摘要後的訊息 | 摘要後的訊息 | 通常看不到 |
黃色那一欄能做的事最多。但不代表你今天非用它不可,下面兩頁講清楚我為什麼推薦它。
官方的更新、旗標與設定,幾乎都是先在命令列可用,圖形介面再跟上。你在終端機看到的,就是這個工具的完整樣貌。
skill 叫不動、腳本缺套件、路徑打錯,終端機會把原始訊息整段印出來。圖形介面通常只給你一句「發生錯誤」,你連要查什麼都不知道。
skill 放在 ~/.claude/skills/,指令檔是 CLAUDE.md。在終端機裡,這些都是你打一行就能打開來看、改、備份的東西。
一句話:終端機看到的是真相,圖形介面看到的是摘要。學東西的時候,你需要真相。
commands.txt,下個月貼回去就重跑。這一點跟第 2 章的「能產生複利的產出」是同一件事。可複製的指令,就是留得下來的方法。
說清楚立場:你今天用桌面 App 的 Code 分頁,課堂做的事一件都不會少。我推薦終端機,是因為它讓你學得比較快、看得比較清楚,不是因為別的不能用。
不用。
你今天在終端機裡打的每一句,都是中文交辦。真正要記的指令只有三四個,而且都可以抄。
不會。
打錯只會出現一行紅字說找不到指令,什麼事都不會發生。真正有破壞性的指令,你今天一個都不會用到。
那只是配色。
Claude Code 在終端機裡是有排版、有顏色、可以按方向鍵選單的。它跟你想像中的駭客畫面不一樣。
macOS 叫「終端機」(Terminal),Windows 叫「PowerShell」或「Windows 終端機」。兩邊今天要打的指令幾乎一樣。
| 流程段落 | 本機(終端機或桌面 App) | Code on Web | 瀏覽器版 |
|---|---|---|---|
| 安裝 14 支 skill | 可 | 需先 commit | 需檢查欄位 |
| 找論文、寫作、改稿、自審與回應審稿意見 | 可 | 可 | 可 |
| deeppapernote 深讀 | 可 | 部分 | 需手動搬 |
| experiment-iterative-coder 跑測試 | 可 | 沙箱內 | 受限 |
| Zotero MCP 讀文獻庫 | 可 | 不可 | 不可 |
| PaperBrain 全套 | 可 | 不可 | 不可 |
| 產出寫進本機 Obsidian | 可 | 不可 | 不可 |
第二列涵蓋今天大半的內容。也就是說,就算你只有瀏覽器,今天大部分的東西還是學得起來。
你的產出需不需要
變成你電腦裡的檔案?
需要,就用本機環境。只是要一段文字回覆,瀏覽器版就夠。
還有一條反向理由支持留在本機:第 2 章講過,原始逐字稿與受試者資料不要進雲端 AI。做質性研究的人,更該用本機環境。
Agent Skills 是開放標準。claude.ai、Claude Code、Agent SDK 與 Developer Platform 共用同一套 SKILL.md 格式。
claude.ai 上傳與 Skills API 只接受六個欄位:name、description、license、compatibility、metadata、allowed-tools。
invocation control、subagent 執行,以及動態 context 注入。這些欄位帶到 claude.ai 會直接硬錯,不是被忽略。
實務上的一個坑:academic-humanizer 有一個 top-level 的 version: 欄位,不在允許的六個欄位內。要上傳到 claude.ai 得先刪掉那一行,或改放進 metadata 底下。其餘 13 支都在允許範圍內。
claude.aigithub.comnpmjs.com帳號與權限這兩關卡住的話,現場也救不了,因為多半跟付款、驗證信或公司資安政策有關。務必事前確認。
| 需要額外準備的 | 裝什麼 |
|---|---|
| paper-navigator | httpx;S2 金鑰選用 |
| paper-graph | httpx、python-dotenv;S2 金鑰必填 |
| deeppapernote | PyMuPDF |
| experiment-iterative-coder | ruff、pytest |
| 其餘 10 支 | 純提示詞,開箱即用 |
# 兩行裝完 node --version # 需 20 以上 python3 -m pip install httpx python-dotenv PyMuPDF
Node 20 是給第 16 章的 PaperBrain 驗證程式用的。若你不打算用 PaperBrain,這一項可以跳過。
paper-graph 的程式碼裡寫死了 REQUIRED_ENV_VARS = ("S2_API_KEY",),沒有金鑰會直接失敗。
paper-navigator 也吃這個變數,但它是選用的,沒有一樣跑得動,只是速率限制較嚴。
echo 'export S2_API_KEY="你的金鑰"' >> ~/.zshrc source ~/.zshrc
課堂當場申請不一定當場拿得到。Semantic Scholar 的金鑰要人工審核、以 email 寄送,新金鑰起始額度只有 1 RPS。建議提早幾天申請。申請入口:semanticscholar.org/product/api
my-skill/ ├── SKILL.md # 必要:前言設定 + 指令內容 ├── scripts/ # 可選:可執行腳本 ├── references/ # 可選:參考資料 └── assets/ # 可選:範本與素材 # 放進個人 skill 目錄,然後重開 ~/.claude/skills/<skill-name>/SKILL.md
name 與 description。沒有程式,沒有編譯,就是 markdown。這也是它能跨環境搬的根本原因。
安裝或更新 skill 之後必須重開,它才會重新載入 metadata。這一行字,省下最多的「我是不是裝失敗了」。
pwd
終端機永遠站在某一個資料夾裡。這個指令告訴你「我現在站在哪」。
cd ~/Desktop/papers
cd 是 change directory。~ 代表你的家目錄。資料夾名有空白要加引號。
claude
打完按 Enter,它就在這個資料夾裡開工。之後你打的都是中文交辦。
練一次就會了:先 pwd 看自己在哪,再 cd 走到論文資料夾,最後 claude 開工。今天全程就這三步。
| 你要做的事 | macOS 終端機 | Windows PowerShell |
|---|---|---|
| 打開它 | Spotlight 搜「終端機」 | 開始功能表搜「PowerShell」或「終端機」 |
| 看我在哪 | pwd | pwd (一樣可用) |
| 換資料夾 | cd ~/Desktop/papers | cd ~\Desktop\papers (斜線方向相反) |
| 看資料夾內容 | ls | ls (一樣可用) |
| 叫出 Claude Code | claude | claude |
| 設環境變數 | 寫進 ~/.zshrc | 用系統「環境變數」設定面板 |
差別只有路徑斜線方向與環境變數怎麼設這兩件事。其餘今天用得到的指令,兩邊一模一樣。
/skills
應該列出你剛裝的那一支。列不出來,多半是沒重開。
用 paper-navigator 找三篇論文
它會回報自己正在用哪一支。有回報,就代表真的載入了。
ls
最終的驗收標準永遠是這一條:你的資料夾裡多了東西嗎。
三個動作全過,環境才算好。只看到它「說」安裝成功,不算。這也是今天會重複很多次的態度。
它是原生型態,能做的事最多,錯誤訊息最完整,而且指令留得下來變成你的紀錄。
它就是 Claude Code 的圖形介面,本機能力完整,課堂做的事一件都不會少。
這不只是方便的問題,是受試者資料不該進雲端的倫理問題。
環境選好了,下一章我們就真的裝一支起來跑。十分鐘之內,你會看到它在你的資料夾裡留下第一個檔案。
05
前面四章都在講觀念。這一章我們動手,而且只做一件事:讓你的資料夾裡出現第一個 AI 產出的檔案。
十分鐘後,你的桌面上
會多出一個你沒有親手打過字的檔案。
而且那個檔案裡的內容,是你自己的研究主題。
這一章刻意只裝一支、只跑一次。先把「它真的會動」這件事確認完,後面學什麼都比較踏實。
# 在桌面建一個資料夾,名字不要用空白 mkdir -p ~/Desktop/ai-research # 走進去 cd ~/Desktop/ai-research # 確認自己站對地方 pwd
Claude Code 的工作範圍就是你開它的那個資料夾。站在桌面開,它就看得到整個桌面;站在專用資料夾開,它的活動範圍就乾淨。
把你今天要練習的那篇論文 PDF,現在就複製進這個資料夾。待會兒直接用得上。
# skill 就是放進這個目錄的一個資料夾
~/.claude/skills/paper-navigator/SKILL.md
EvoSkills 那個 repo 的 README 上有一鍵安裝指令,照它寫的貼一次就好。本課一律以連結與出處形式提供,你自己前往原始 repo 安裝。
出處:github.com/EvoScientist/EvoSkills Apache-2.0
今天結束前你會知道自己該裝哪幾支。現在裝一堆,只會讓等一下的畫面變得很難看懂。
# 關掉再開一次 claude # 問它現在載入了哪些 skill /skills
paper-navigator,中間是減號。~/.claude/skills/ 底下。這時候你的電腦裡已經多了一份 AI 讀得到的說明書。它會在需要的時候自己拿出來用。
candidates.md,存在目前這個資料夾。注意第 5 點。「存成檔案」這句話一定要講,不然它只會把結果印在畫面上,關掉就沒了。這就是第 1 章講的一次性產出與可產生複利產出的差別。
# 看看資料夾裡多了什麼 ls # 用你慣用的編輯器打開 open candidates.md
那正是第 2 章講的幻覺引用。這不代表工具壞了,代表驗證這一步不能省。第 6 章會講這一支怎麼用規則把它壓下去。
它直接憑自己回答,沒提到 paper-navigator。
解法:在句首明確寫「用 paper-navigator」,或先打 /skills 確認它載入了。
ls 之後什麼都沒有。
解法:問它「檔案存在哪個絕對路徑」。多半是存到別的資料夾去了。
畫面停很久沒動靜。
解法:沒有 S2 金鑰時速率限制很嚴,這是正常的。等一下,或改成一次只查 10 篇。
三種狀況都不是「你做錯了」。它們是這個工具的真實樣貌,早點遇到比較好。
你給的是目標(探索這個主題、輸出清單),不是問題。它自己拆步驟、自己去查、自己寫檔。
你沒有貼任何規則給它。關鍵字怎麼撒、怎麼排序、書目要不要附 DOI,全寫在那份 markdown 裡。
candidates.md 留在你的資料夾裡。下週再查一次,格式一樣,可以直接比較。
整堂課剩下的部分,
都是在重複這一次的經驗,換不同的節點。
01
10 分鐘 | 產出:一份 candidates.md
把上一頁那句交辦裡的主題,換成你自己的。用中文寫沒關係,它看得懂。
一定要講「存成 candidates.md」。跑完用 ls 確認檔案真的在。
從清單裡隨便挑一篇,把標題貼進 Google Scholar。查得到就打勾,查不到就標起來。
用你手上那篇 PDF 的標題當主題就好。這個練習要驗的是流程,不是題目。
先跟旁邊的人一起看他的畫面。流程看懂比自己裝好更重要,安裝回家補得完。
06
從這一章開始,每一章都對應研究流程上的一格。文獻線是投報率最高的一條,因為你每天都在做。
你丟一個主題或一篇論文,它先判斷你到底要什麼,再去 Semantic Scholar 與 arXiv 撒網、沿引用網往前往後爬,最後照你自己寫下的評分表把論文排序。
Apache-2.0。背後有論文:EvoScientist, arXiv:2603.08127。repo 436 stars。
這是 11 支裡版本落差最大的一支,而且上游把評分制度整個換掉了。見本章最後一頁。
no LLM-as-judge is called. You author the rubric, you triage each paper, you sort.
Quote-or-zero. When you claim a paper meets a criterion, quote a ≤80-char span from its abstract / tldr / snippet. No quote → that criterion scores 0.
SKILL.md「Five Red Lines」第 5 條AI 說「這篇很相關」但說不出哪一句相關。這是文獻檢索最常見的幻覺型態:它不是編出不存在的論文,而是對真實論文做出沒有根據的判斷。
Over-collecting a broad pool and dumping it unranked is the dominant failure mode on survey-style queries.
把一大堆論文倒給你,不排序。整套強制檢查清單就是為此而加。
| 分支 | 你的訊號 | 節奏 | 產出 |
|---|---|---|---|
| POINT | 給了引號標題、URL、arXiv/DOI/PMID,或說「讀這篇」 | 1 次呼叫 | 一張 Paper Card |
| LIST 預設 | 「找 X 主題的論文」「有沒有一篇論文做過 Y」 | 2 輪,必要時加 1 輪 | 附逐條件證據的短名單 |
| ITERATIVE | 「survey of X」「30 篇以上的 Y」,或被其他 skill 呼叫 | 最多 3 輪,廣度優先 | 排序表 |
SKILL.md 明文 Default to LIST when unsure. 另外提醒:LIST 查詢不要加 survey 或 review 這種字眼,會把你真正想要的原創論文擠下去。
這是整支最不一樣的地方。它不會替你決定什麼叫相關,它逼你先寫清楚。
RUBRIC for "<你的原始查詢,逐字>" Branch: LIST | ITERATIVE Criteria(2 到 4 條,各自獨立不重疊,權重加總約 1.0): C1 [w=0.45] <這篇論文一定要做到或具備什麼,一句話> C2 [w=0.35] <...> C3 [w=0.20] <...> Named entities to preserve verbatim: [<專有名詞1>, <專有名詞2>] Angle tags(3 到 5 個子主題軸): [method, task, dataset, evaluation, domain] Disqualifiers: [<摘要出現這個就自動剔除>]
三條規則:準則必須原子且互不重疊;每個專有名詞都要在某一輪查詢裡逐字出現;同一輪的兩條查詢不得共用同一個 angle tag。
| 級別 | 條件 | 要不要附引句 |
|---|---|---|
| PERFECT | 每條高權重準則都 ✓,任何一條都沒有 ✗ | 每條準則各一句 80 字內引句 |
| GOOD | 每條高權重(w ≥ 0.3)至少 ~,高權重無 ✗ | 每條 ✓ 準則各一句引句 |
| WEAK | 有一條高權重 ✗,或只命中低權重 | 不需要 |
| IRREL | 完全沒命中高權重,或踩到排除條件 | 後續輪次直接剔除 |
飽和關卡是機械式的。第一輪跑完有 1 個以上 PERFECT 才准停;0 個 PERFECT 但有 2 個以上 GOOD 就進第二輪;兩者都沒有,代表你的評分表可能訂錯了。原文:The gate is mechanical — do not skip rounds because "the results look right".
沒有摘要就標 ~,明文 do not infer from training data。不准用訓練記憶補。
只讀標題、摘要、TLDR,瞄一下圖,讀結論。記下主要貢獻、年份、引用數、跟你的關係。
用途:快掃與追蹤趨勢。
目標是看懂 why 與取捨。先讀摘要、引言、結論五分鐘,看圖表講故事,實驗只掃主要結果。
用途:文獻回顧裡的大多數論文屬於這一層。
目標是能重新實作。看方法細節、實驗、補充材料,還要看程式碼驗證理解。
用途:只給你會直接建立在其上的論文。
Vista 心法:我會為每一次探索留下一份「查詢紀錄」:查了什麼詞、用了什麼條件、排除了什麼、為什麼。這份紀錄本身就是 Method 段的初稿。過程留下來,論文就寫了三分之一。
它是文獻線的入口,意思是其他兩支的輸入應該來自它,而不是各自去搜一輪。一致的入口,才有一致的紀錄。
Python 套件 httpx。S2_API_KEY 選用,沒有的話引用網分析會停用。
Semantic Scholar 無金鑰約每 3 秒 1 次且禁平行;有金鑰 100 次/分鐘可平行。
| 項目 | 3.3.0(多數人手上的版本) | 3.4.0(上游最新) |
|---|---|---|
| 評分制度 | 權重加總 1.0,算 weighted_total | 改成 core/secondary 標記,明文 no weights, no math |
| 分類級別 | 四級 PERFECT/GOOD/WEAK/IRREL | 三級 All-core/Partial/Irrelevant |
| 時效判斷 | 無 | 查詢出現「最新/近期/SOTA」就自動設近兩年 |
| 輸出模式 | 單一格式 | 分 Structured(給下游 skill)與 Narrative(給人看) |
| 查詢長度 | 4 到 7 字 | 3 到 6 字 |
為什麼要講這一頁:這正是第 1 章那個判斷標準的實例。skill 會演化,所以你要看的是它的設計理念,不是背它的操作步驟。作者把整套評分數學拿掉,理由是連言型查詢不能靠兩篇各滿足一半來蒙混。理念沒變,實作換了。
你要的是一篇、一份短名單,還是一整片領域?講清楚,它的節奏就不一樣。
什麼叫相關,只有你知道。寫下來,排序才有意義,紀錄也才留得下來。
這一條擋掉的不是假論文,是對真論文的假判斷。把它抄進你的指令檔。
找到一百篇不難,
難的是說得出為什麼是這三十篇。
02
12 分鐘 | 產出:三條準則與一份排序清單
C1 [w=0.45] 這篇論文一定要 ____________ C2 [w=0.35] 這篇論文一定要 ____________ C3 [w=0.20] 這篇論文一定要 ____________ Disqualifiers:摘要出現 ____________ 就自動剔除
「照這份評分表排序,每一條準則都要附一句 80 字內的原文引句,說不出引句的那條算 0 分。」
三條準則之間不可以重疊。如果你發現 C2 是 C1 的換句話說,那就只有兩條。
把這張評分表存成一個檔案。下次換題目時改三行就能重用,這就是複利的最小單位。
07
多數人卡的不是找不到,是讀完之後沒留下能複用的東西。這一章講怎麼讀,也講讀完要放到哪裡去。
它自稱是「一個由 LLM 維護的學術 wiki 的單篇論文入庫層」。Obsidian 是那些頁面生長的地方,這一支負責讓一篇論文可靠地進入 wiki。
MIT 授權。1042 stars。三支獨立 skill 裡最活躍的一支,有 CI、有 24 支測試、有筆記品質評分表。
v2.3.0 的主題正是「完整英文筆記支援」。若你手上是 v2.0.0,中文輸出偏簡體不是偏好問題,是版本問題。
上游把 SKILL.md 從 repo 根搬到 skills/deeppapernote/,目錄佈局變了。要重跑 npx skills add 917Dhj/DeepPaperNote。
You sit down to study an important paper.
The hard part is not reading it — it is turning what you understood into a note you can still use later.
那層重複、機械、卻意外昂貴的工:在 PDF、Zotero、網頁與筆記軟體之間切換;手動整理書目、摘要、圖表與方法骨幹;理解了一部分,然後花更久把它變成連貫的筆記。
成品要是「一篇論文的深讀筆記」不是摘要改寫;方法、結果、圖表、限制要被解釋而不只是列出;來源不夠好就停下來要更好的材料,不准假裝筆記完整。
不准只看標題摘要就交稿。never finish from title/abstract/headings alone
抽出來的原始段落檔才是正典閱讀材料,不是網頁摘要。
拿不到足夠證據就停下來要更好的來源,不產降級成品。
腳本整理證據,判斷仍歸模型,而模型的判斷要給你看。
先規劃圖表佔位,只有身分比對與視覺可用性兩者都強才換成真圖。
第 3 條是這一支最值錢的地方。大部分工具會給你一個看起來完整、其實沒根據的成品;這一支寧可停下來跟你要材料。
它有一整段規定 AI 不准亂講「做完了」。這是我看過寫得最好的一份反唬爛條款。
say「筆記已完成」 only when the required workflow is actually complete say「已生成初稿」 when drafting is done but lint or save is still pending say「已通過校驗」 only when lint has actually been run and passed say「已保存到 Obsidian」 only when the write step has actually succeeded lint is a floor, not the writing objective
還有一條全域規則:do not treat slowness, inconvenience, or temporary uncertainty as permission to bypass a required stage.不准因為慢、麻煩或一時不確定,就跳過必要階段。
把這一段抄進你自己的指令檔,你會發現 AI 唬爛你的次數大幅下降。這跟論文無關,跟你怎麼跟 AI 工作有關。
核心資訊/原文摘要翻譯/創新性/一句話總結/研究問題/資料與任務定義/方法主線/關鍵結果/深度分析/限制/我的筆記/引用。
方法類論文另有「機制流程」小節,要寫成 3 到 4 步,每步含輸入、操作、輸出去向。
> [!figure] Fig. 3 資料分布與品質評估 > 建議位置:資料與任務定義 > 放置原因:這張圖同時展示樣本構成與 > 專家品質檢查結果 > 目前狀態:保留佔位,抽取只拿到局部子圖
圖表佔位有固定語法,三個欄位必填。SKILL.md 甚至明文說 [FIGURE_PLACEHOLDER] 那種寫法是內部遺留格式,不可出現在最終筆記。
成本高:17 個階段每階段都有關卡與檢查,一篇跑完的時間與費用遠高於一般摘要工具。所以更要挑。
相依:Python ≥ 3.10 與 PyMuPDF。一般數位 PDF 不需要金鑰。Zotero 整合與 OCR 是選配。
來源優先序:本機 PDF → 本機 Zotero 項目 → DOI 與出版社書目 → arXiv 或開放取用 → Semantic Scholar 或 OpenAlex 補書目。
中文觸發語也可以:「給這篇論文生成深度筆記」「把這篇文章整理成 Obsidian 筆記」。
Vista 心法:每一份深讀筆記,前言都寫一段「我為什麼讀這篇」。前言就是精讀決策日誌。不寫這段,三個月後你會忘記當初為什麼讀,那份筆記就等於沒有。
前面一直提到它。如果你沒用過,這四頁講完你就會用了。
Obsidian 不是雲端服務,是一個讀你本機資料夾的閱讀器。你的筆記是一堆 .md 檔,躺在你自己硬碟上。
哪天你不想用了,那些 .md 檔用記事本也打得開。這一點對研究資料特別重要。
在筆記裡打兩個方括號就能連到另一篇。久了會長出一張你自己的知識網。
為什麼這堂課要用它:因為 AI 寫得進去。它的筆記就是純文字檔,Claude Code 直接寫檔就到位,不需要任何串接。
到 obsidian.md 下載,個人使用免費。macOS 與 Windows 都有。
它會問你要在哪裡建。挑一個你記得住的位置,例如 ~/Documents/MyVault。
10_Sources、20_Notes、30_Concepts、40_Synthesis。名字前面加數字,順序才不會亂跳。
在交辦時直接寫「存到 ~/Documents/MyVault/20_Notes/」,它就會寫進去。
就這樣,沒有第五步。不需要裝外掛、不需要學語法、不需要註冊帳號。剩下的功能等你真的需要再學。
Cmd/Ctrl + Shift + F
在整個 vault 裡搜一個詞。當你想找「我哪一篇筆記提過這個概念」,這一招最常用。
[[某篇筆記的名字]]
打兩個方括號就會跳出候選。連過去之後,對方那篇也會自動看得到你。
--- citekey: chen2024 year: 2024 status: read ---
寫在檔案最上面。有了它,之後才做得出跨篇的矩陣。
deeppapernote 產出的筆記本來就帶好這些欄位。你要做的只是把它寫進同一個資料夾。
散在信箱、雲端與下載資料夾的筆記,等於沒有。
citekey、year、status、sourceStatus。欄位一致,才跨篇比得起來。
不論你用 Obsidian、Notion 或純資料夾,重點是有一條固定的歸檔路徑。
找到與讀懂都只是當下的事。
一致的歸檔,才是三年後還在替你工作的那部分。
03
15 分鐘 | 產出:一份帶出處的 Markdown 筆記
「給這篇論文生成深度筆記:./你的檔名.pdf」。用本機檔案,不要用網址。
「存到 ~/Documents/MyVault/20_Notes/」。沒有 vault 的人就存在目前資料夾。
這一段 AI 不會幫你寫,也不該幫你寫。三句話就好。
從「關鍵結果」那一節挑一句,回 PDF 找到那一頁。對得上才算數。
如果它跑到一半停下來跟你要更好的來源,那不是失敗,那是第 3 條規則在運作。照它說的做。
08
這是全套裡最多人會天天用到的一章。多數人卡在寫不出來,其實是卡在沒規劃。
它不產出任何一句論文正文,但它決定後面十小時順不順。
把故事線定下來:task、challenge、洞察、contribution、advantage。
比較、消融、示範各要哪些,指標與資料集怎麼配。
Pipeline figure 與 Teaser figure,兩張圖的分工是定死的。
四週倒數,含交給指導教授的硬截止日。
零相依。它的 allowed-tools 連 execute 都沒有,不跑任何腳本。你需要的只是一小時,和誠實面對自己的稿。
先寫下這篇最可能被拒的五個理由,再回頭設計故事。
把主張收到你確定守得住的範圍,然後才開始擴充。
先知道你要拿什麼撐,再決定怎麼說。
主動講出一個限制,比被審稿人挖出來便宜太多。
如果提升不明顯,預先定好第二價值主張:效率、穩健性、假設更少。
第 1 條的順序如果反了,你會寫出一個自己很滿意、但擋不住攻擊的敘事。
| 要素 | 要回答的問題 | SKILL.md 的範例 |
|---|---|---|
| Task | 這篇論文處理什麼問題 | Real-time 3D scene reconstruction |
| Challenge | 為什麼現有方法解不好 | Cannot handle dynamic objects efficiently |
| 洞察 | 什麼關鍵觀察驅動你的做法 | Motion patterns are temporally sparse |
| Contribution | 你提出什麼 | Sparse temporal attention for dynamic regions |
| Advantage | 為什麼你的做法比較好 | Reduces computation while preserving quality |
起手式是先畫 pipeline figure 草圖。原文:Draw it before writing anything. It reveals whether the method is clear enough to explain.畫不出來,代表你還沒想清楚。
它把模糊的不安變成五條可執行的待辦。「我覺得這篇好像哪裡怪怪的」沒辦法行動;「審稿人會說我的基準模型過時」可以行動。
寫作前跑一次,用來排優先序;投稿前再跑一次,用來做最後自審。第 10 章的 paper-review 會再用到同一招。
反直覺原則:narrow before broad,先窄後寬。大方向留給 discussion,主張要收到最窄。收得愈窄,愈難被打。
Pipeline figure 四原則:凸顯創新性而非只畫工作流;跟前作長得不一樣;整體管線若是標準的就放大新模組;把清晰度花在新的部分。
Teaser figure(通常是 Figure 1):放第一頁頂端、要一眼有說服力、要在 Introduction 引用它。
圖與文的分工是定死的:The pipeline figure is for highlighting novelty, not for making readers understand. The Method text is what makes readers understand.
定核心貢獻與模組動機;列比較實驗與消融研究;寫 Introduction 第一版初稿。
定案 pipeline figure 草圖;寫 Method 第一版,未定細節用 \todo{} 標。
寫 Experiments、Abstract、Related Work 的第一版初稿。
修稿、精修 pipeline 與 teaser figure、跑 demo。
SKILL.md 的硬提醒:第三週結束前一定要把 Introduction 與 Method 交給指導教授,否則他不會有足夠時間看完。
| 產物 | 誰用 |
|---|---|
| Story summary(task → challenge → 洞察 → contribution → advantage) | Introduction |
| Module Motivation Mapping table | Method 各子節 |
| Experiment plan(比較 + 消融 + 示範) | Experiments 節 |
| Pipeline figure sketch | Method 概覽與 Figure 2 |
| Claim-to-experiment mapping | Abstract、Introduction、Experiments |
| Fallback narrative | Introduction 或 Conclusion 轉向 |
| Rejection-risk table | 自審優先排序 |
該用:要開始寫一篇新論文、要設計故事與貢獻、要規劃實驗圖表時程、要寫預先拒稿信。別用:已經在寫作中、要跑實驗、要找題目、要自審完稿。
它附 LaTeX 模板,但真正的價值在那個順序。多數人從 Introduction 開始寫,那是最難也最容易寫壞的一節。
Underclaim in prose, overdeliver in evidence. Reduce adjective intensity in Abstract/Introduction; let tables and figures carry the strength.
文字上保守,證據上超額交付。形容詞收斂,讓表格和圖去承擔力道。
Lead with mechanism, not only metric. Reviewers trust causal logic more than isolated gains.
先講機制,不要只給數字。審稿人信因果邏輯,多過信孤立的數字提升。
一句話交代脈絡,不要從盤古開天。
只講一個核心限制,不要列清單。
「所以會怎樣」。沒有後果的限制,審稿人不在乎。
你看到的那件事。這是全段的轉折點。
具體交付了什麼,用動詞開頭。
一個明文反模式:不要寫成「先給天真做法,再給我們的改進」,那會讓你的工作看起來像微調。
資料結構、網路設計、前向流程。寫成「給定 X 輸入,第一步…、第二步…、輸出 Y」。
這個模組為什麼存在。用問題驅動句型:「A remaining challenge is...」。這一項最常被漏掉,也最常被審稿人抓。
這個模組為什麼有效。不是描述它做什麼,是解釋它為何管用。
結構是:先寫一段 Overview(設定 + 核心貢獻 + 章節路線圖),再一個模組一個子節。
Conclusion 裡的 Limitation 有明確定義,很多人寫錯:限制是任務目標與設定上的邊界,不是承認你的方法有缺陷。判斷標準:If our method does not fall below current SOTA metrics, it is not a technical defect.
摘要是全篇的壓縮。全篇還沒定稿就寫摘要,最後一定要重寫。
Introduction 要宣稱的貢獻,取決於 Method 實際做到什麼。方法還在動,引言就會一直改。
它不是文獻回顧,是戰場宣告。列愈多,審稿人愈容易問「那你跟這篇比呢」。
Remove weak but flashy claims. Any claim without direct evidence should be deleted, even if it sounds impressive.
七條反直覺規則第 5 條。聽起來再漂亮,沒有直接證據就刪掉判斷標準很簡單:如果這三句你寫不乾淨,那 Conclusion 還沒好,而且你對自己這篇論文的理解可能也還沒好。寫得出來的話,這三句可以直接當結尾段,或當 Abstract 的最後一句。
這一段是我自己加在 skill 裡的檢查,不在上游版本裡。第 17 章會完整交代我動過哪些地方。
\todo{} 標記都解決或移除If any item is incomplete, finish writing before reviewing.
一句沒改的話,
就是一個你不能捍衛的位置。
04
15 分鐘 | 產出:五條拒稿理由與一張故事表
「假設我這篇(或我正在規劃的這篇)被拒了,審稿人最可能寫哪五段話?每一段對應我哪一節該補強?」
Task 我這篇處理的問題是 ____________ Challenge 現有做法解不好的地方是 ____________ 洞察 我看到的關鍵觀察是 ____________ Contribution 我提出的是 ____________ Advantage 我比較好的地方是 ____________
如果你還沒有稿,用你正在想的題目就好。這張表的價值在於逼你發現哪一格填不出來,那一格就是你接下來要補的。
09
兩支改稿工具,治的是不同的病。界線在毛病的來源:一個治人類學術寫作的通病,一個治 AI 協作特有的病灶。
先講一個一定會卡住的地方:這支有四個名字,而且都不一樣。repo 叫 sciwrite;frontmatter 的 name 是 manuscript-writing-review;README 叫你放進 skills/manuscript-review/;多數人本機的目錄叫 sciwrite。系統以 frontmatter 為準,所以你要打的是 $manuscript-writing-review。14 支裡只有這一支不一致。
喬治華盛頓大學工程教授。825 stars。整個 repo 只有四個檔:README、SKILL.md、HOW-TO-USE、LICENSE。
純 Markdown,無腳本、無套件、無金鑰。README 原文 no dependencies on any specific platform。
四支獨立 skill 裡唯一一支。可商用、可改,但必須署名、附授權連結、註明是否修改過。
Self-editing for clarity is difficult because you already know what you meant to say.
README。這是整個 repo 最好用的一句教學金句多數研究生沒受過正式的科學寫作訓練。原文:Clear writing is not a cosmetic concern in science; it determines whether reviewers and readers can follow your argument.
只改怎麼講,不改講什麼。原文:Importantly, the skill does not alter scientific content, data, or technical claims. It improves how those claims are delivered.
Kristin Sainani 的《Writing in the Sciences》,30 支影片講座,以 CC-BY 授權釋出。這支 skill 是把那門課工程化。
every word must earn its place; every sentence must be stripped to its cleanest components.
Scientific transparency requires accountability. Identify who did what.
不是文法偏好,是誰做了什麼要講清楚。
Provides a review of → Reviews。找出所有「名詞 + of」的結構,看有沒有現成動詞可用。
最有名的一條是 The Banana Rule:Do not call a "banana" an "elongated yellow fruit" to avoid repetition.為了避免重複而把香蕉叫成「細長的黃色水果」,這在文學是修辭,在科學是災難。同一個東西從頭到尾用同一個詞。
上一道沒清乾淨,下一道就白做:先清累贅才輪得到句構。
三張對照表:15 條無用片語(Due to the fact that → Because)、5 條無用開場白、5 條冗詞。
被動轉主動三步驟,加 9 條名詞化對照表。但明訂被動可接受的三種情況。
主詞與主要動詞相隔超過約 12 個字就標為 buried predicate;同段句長全在 ±5 字內也會標出來。
Banana Rule 的執行層。從 Methods 抽出所有關鍵詞,驗證後面各節用字完全一致。
摘要的 N 對得上表 1 嗎、百分比對得上原始數嗎,加上傳話遊戲引用稽核。
第 2 道有一條警告值得記:Do NOT mechanically convert every passive sentence.不要機械式地把每個被動句都改掉。
DNA、RNA、CFD、FEM、PIV 這種。而且每個縮寫要在摘要、正文、以及每一張表與圖說各定義一次。
理由原文:readers do not read linearly。讀者不是從頭讀到尾的,他們會直接跳到表格。
把只透過二手文獻回顧或教科書轉引的統計數字標出來,要你回去查原始文獻。
這是學術寫作裡最常見、也最少被抓到的錯誤來源:一個數字被引用三次之後,往往已經不是原本的意思了。
三級嚴重度:CRITICAL(實際誤導讀者)、MAJOR(顯著損害清晰度)、MINOR(值得改但不妨礙理解)。
| 模式 | 你會怎麼說 | 它會做什麼 |
|---|---|---|
| full-review 預設 | 「review my manuscript」「全篇寫作審查」 | 對全文跑五道 pass,產出結構化報告 |
| section-review | 「review the Introduction」「檢查 Discussion」 | 對單一章節跑五道 pass |
| targeted | 「fix passive voice」「清掉累贅」 | 只跑相關的那一兩道 pass |
| interactive | 「walk me through improving this」 | 逐段帶你走,顯示改前改後與理由 |
常見的誤傳:很多整理會寫成「兩種模式:Full Review 與 Journal-Specific」。Journal-Specific 不是一種模式,它是 README 教你自己在 SKILL.md 裡加一節的客製做法。要對特定期刊,直接在指令裡講就好。
你要為每個 idea 負責;
sciwrite 只為每個字負責。
README 提醒:它標出的「被悶死的動詞」,有時正是你領域的標準術語。用你的判斷。
README 有一整節「How This Skill Was Made」。這一段的價值,可能高於 skill 本身。
從 YouTube 播放清單一次抓齊 30 支影片網址並去掉追蹤參數。原文:In under a minute, the agent produced a clean list of all 30 URLs, a task that would have taken 15–20 minutes of tedious manual work.
把 30 個網址丟進 Gemini Notebook,產出一份 Writing Standards Manual。原文說它抓到了核心觀念,但格式是「人讀的指引」,不是「機器可執行的 skill 檔」。
用 Claude 內建的 skill 產生能力把手冊轉成 skill。作者說這一步 making the process meta in the best sense: an AI tool creating instructions for an AI tool.
作者的總結是:Three different AI tools, each doing what it does best.你也可以這樣做。把你領域的方法論、你指導教授講過的原則、你自己踩過的坑,用同一條路徑變成一支 skill。這才是這堂課真正想給你的東西。
Review the writing quality of draft.tex Review the writing in my Introduction (sections/introduction.tex) Check draft.tex for passive voice and smothered verbs Audit my Results section for keyword consistency — make sure group names and variable names match what I defined in Methods Walk me through improving the writing in my Introduction, paragraph by paragraph Review my manuscript for writing quality. Target journal is the Journal of Fluid Mechanics. They prefer active voice throughout, including in Methods.
Vista 心法:我不會拿整篇跑。只挑三段:Abstract、Introduction 第一段、Conclusion 第一段。這三段決定審稿人的第一印象,也是投報率最高的三段。其餘的等定稿再說。
把 AI 協作產出的論文與計畫書稿,洗掉 AI 腔、對回作者本人的聲音,並強制每一個宣稱都掛到它的證據上。一個數字、一條結果、一筆引用都不動。
三支獨立 skill 裡最高。但注意:star 數不是判斷標準,這是第 1 章講過的。
純 SKILL.md 加範例。frontmatter 自己宣告 compatibility: claude-code codex morphmind opencode。
三支裡最靜態。但它是純規則文件,穩定不等於荒廢。這也是第 1 章的判斷標準六。
To calibrate it, we had the AI compare its own drafts with our team's accepted papers and funded proposals, and we went through the differences by hand.
README「Why we built this」AI 稿又泛又長,而且不像你。原文:generic and verbose, with "In recent years..." openers, inflated phrasing, and over-long sentences. They also drift from the author's own voice.
那些是給部落格與行銷用的。原文:Run one on a paper or an NSF proposal and it flattens the precision along with everything else.學術寫作賴以生存的謹慎措辭,會是第一個被抹平的東西。
作者還說了一句很誠實的話:The rules here reflect one group's voice. Fork the repo and adapt them to your own.
誇大意義、假深度的 -ing 尾巴、宣傳性語言、無出處的模糊歸屬、AI 詞彙表(delve、underscore、tapestry、pivotal…)、填充語、破折號全部移除。
十一個編號子項:過強動詞、意義炒作、空洞強化詞、創新性灌水、公式化開場、連接詞濫用、貢獻條列陳腔、引用傾倒、含糊避險、樣板強調、過長堆疊子句。
這一層是它跟一般 humanizer 的分水嶺。它規定哪些東西不准改。下一頁單獨講。
逐條檢查宣稱有沒有證據撐、動詞強度配不配得上證據。太強就降級。
讀你先前的論文,對上你的句子節奏、連接詞習慣、避險程度。同時對上場域語體。
NSF 與 NIH 專用。規則在這一層整組翻轉,見後兩頁。
常見的誤傳:很多整理把六層寫成「句子節奏/hedging/claim-evidence/術語校對/feasibility/vision」,那是錯的,而且把 Layer 3 整層漏掉了。
一般的 humanizer 沒有這一層,所以它們會把學術寫作的精準度一起抹掉。
保留 suggests、is consistent with、we hypothesize that、may indicate、appears to。
原文警告錯誤修法:把 the results suggest X 改成 the results prove X,這叫做製造過度宣稱。
we 是標準用法,不要改掉Never invent, drop, or alter a number, equation, or citation.
唯一的例外是破折號:Layer 1 與 Layer 3 各聲明一次,破折號無條件全部移除,改用逗號、冒號、括號或拆句。
We prove that our method significantly outperforms all prior approaches.
三個問題:prove 是過強動詞;significantly 沒有檢定或數字支撐;all prior approaches 是無法驗證的全稱宣稱。
Our method improves held-out accuracy by 4–7 points over the strongest prior approach (Table 3); the gain is significant at p < 0.01 by a paired test.
動詞降級、給了範圍與比較對象、指明表格、附上檢定。
它偏好給範圍而不是給單一平均值,而且比較時要先跟最強的競爭者比,不是先跟最弱的基準模型比。
A proposal is not a paper. It is sold on vision plus feasibility, not on finished results. So in proposal mode, do not flatten the vision; enforce a different discipline instead: claim ↔ feasibility.
Layer 6 開場long-term goal、pioneer、transformative、establish a foundation。在論文裡這些是 AI 腔。
前提是有可信的計畫與證據撐住。所以它換成檢查另一件事:你的野心,有沒有對應的可行性。
前三頁定生死:A reviewer unconvinced by page 3 does not recover on page 10.審稿人必須在前兩三頁內掌握五樣東西:hook、gap、central idea、aims、payoff。
「這個議題很重要」但說不出對誰重要、後果是什麼。
把 aim 寫成一個技術,而不是一個問題或一個結果。
Aim 2 與 3 在 Aim 1 失敗時全垮。審稿人會直接標記為脆弱。
野心很大但沒有初步資料、既有方法或合作者撐住。
Aims 頁的假說是可證偽的承諾,不是「我們將探索是否可能」。
一條明文禁令出現了兩次:Never invent preliminary results, prior funding, partners, or letters; if the support does not exist, flag the gap for the author rather than papering over it.沒有就標記出來給作者,不要糊過去。
它動的是語言層,不動內容層。數字被改動就是造假。
For technical writing, neutral and precise is the human voice.
frontmatter 與正文都寫死了這一條。
Using it does not remove your obligation to disclose AI assistance: always follow the disclosure policy of the venue you submit to.
README「Ethics and disclosure」| 維度 | sciwrite | academic-humanizer |
|---|---|---|
| 治的是什麼病 | 人類學術寫作的通病 | AI 協作特有的病灶 |
| 這些病幾歲 | 存在幾十年了 | 2012 年不可能存在 |
| 方法論來源 | Sainani 2012 年的課 | 比對自家已錄取論文與已獲補助計畫書 |
| 會不會對你的聲音 | 不會 | 會,讀你先前的論文去對 |
| 會不會查宣稱撐不撐得住 | 只查數字前後一致 | 會,動詞太強就降級 |
| 能不能處理計畫書 | 不能 | 能,Layer 6 專章 |
| 授權 | CC BY 4.0,散布要署名 | MIT |
先清乾淨,再上色。但兩支規則有直接牴觸:sciwrite 建議用破折號做強調插語,humanizer 要求破折號全刪。這種時候由你裁決,不是由工具裁決。
05
12 分鐘 | 產出:一份改前改後對照
Abstract、Introduction 第一段、或 Conclusion 第一段,三選一。沒有論文的人,用你的研究計畫摘要。
「walk me through improving this paragraph」。逐句看它給的理由,不要只看結果。
它一定會標到某個你領域的標準術語。那一刻就是你在行使判斷權,這才是今天最重要的練習。
提醒:這一支的名字要打 $manuscript-writing-review,不是 sciwrite。
10
兩支接力。投出去之前用 paper-review 自審,收到意見之後用 paper-rebuttal 分類與回應。
它模擬的不是友善的同儕,是會拒稿的審稿人。這是刻意的:友善的意見改不動你。
它明文要求先滿足 paper-writing 的交接清單。原文:If any item is incomplete, finish writing before reviewing.
frontmatter 比其他支多一欄 type: [skill, expert],代表它可以被非同步派遣成一個獨立的審查者,而不只是被載入的說明書。
在家先被拒一次,
比投出去被拒一次便宜太多。
在寫任何正面評語之前,先強迫自己用審稿人的語氣,寫這篇為什麼該被拒。
原文 remove it instead of defending it。刪掉比補一段辯解安全。
分數稍低但公平性與可重複驗證高的做法,審稿結果往往更好。
從附註搬到正文。原文 transparency can increase confidence。
問一句:一個厲害的博士生,一個下午想得出來嗎?
第 5 條如果答案是「想得出來」,就再往下挖,或把創新性宣稱收窄講精確。
"The paper does not provide readers with new knowledge."
失敗案例太常見嗎?改進是可預期的嗎?
"Missing technical details, not reproducible."
讀者能只靠論文重現方法嗎?
只比前人好一點點嗎?即使勝過基準模型,絕對品質對應用場景夠好嗎?
缺消融、缺重要基準模型、缺評估指標、資料太簡單。最常見的拒稿理由之一。
設定不切實際?有技術缺陷?新模組的代價超過好處?
每一個主張問三題:事實正確嗎?有實驗或分析支撐嗎?支撐實驗有被清楚引用嗎?
原文警告:Some reviewers will reject a paper directly for unsupported claims.
Introduction、Method、Experiments 各跑一次,通常十五分鐘就能抓出結構問題。它另有兩份檢查表:圖 7 項(解析度、對色盲友善、有沒有在正文被引用)與表 7 項(caption 在上方、無直線、標出指標方向、caption 描述設定而非描述結果)。
# Self-Review ## Verdict ## 5-Aspect Findings (一個面向一節,各給 1 到 5 分) ## Blocking Issues ## Prebuttal Notes
Prebuttal Notes 是最值錢的一格。它把自審發現的攻擊點,直接寫成回應初稿。真的被攻擊時,你已經有一份打磨過的答案。
The goal is not to defend every point — it's to move scores by addressing the concerns that actually drive them.
SKILL.md 第一句它的第一步不是動筆,是診斷。原文:Before writing a single word, answer: "Why did this reviewer give this exact score?" Not what they wrote — what drove the score. Most researchers skip this and address every comment equally. That is a mistake.
Your rebuttal's real audience is not the negative reviewer — it's the positive one. Your champion argues on your behalf in the AC discussion, often using your exact words.
SKILL.md「The Champion Strategy」每條意見背後都有一個沒說出口的問題。「基準模型過時」真正在問的是:這方法現在還打得贏嗎。
回答那個沒說出口的問題,不是只回答表面的要求。
不用說服他。要做的是給他在討論階段替你辯護的彈藥。
這一檔投報率最高。找出那一兩個疑慮,全力解決。
先判斷可不可解。不可解就別耗,把力氣放別處,或轉戰其他場地。
引導問句是固定的:"What would move this reviewer from their current score to acceptance?"不是「他寫了什麼」,是「什麼驅動了那個分數」。
| 疑慮類型 | 回應策略 |
|---|---|
| 誤解 | 指出論文的具體位置澄清,並重述關鍵論點 |
| 缺實驗 | 可行就直接在回應裡附上實驗;不可行就誠實說明限制 |
| 缺基準模型 | 加上比較,或精確說明為什麼那個基準模型不適用 |
| 寫作清晰度 | 承認,並在回應裡直接給出修訂後的文字 |
| 根本性疑慮 | 用技術論證加上額外證據正面處理,兩者缺一不可 |
| 小問題 | 感謝審稿人,確認會修 |
每一條的三段結構:① 先承認(一句話證明你讀懂了)② 再回應(證據、數據、新實驗)③ 最後說明改了什麼(指出哪一節、哪張表)。
整封信的順序:先感謝全體 → 處理共通主題 → 再按紅橘灰逐條。不要照審稿人寫的順序回。
| 審稿人說 | 怎麼回 |
|---|---|
| Limited novelty | 講清楚那個具體洞察;展示前人做不到什麼;把宣稱收窄講精確 |
| Marginal improvement | 改打其他優勢(速度、泛化、簡潔);加更難的測試案例 |
| Missing ablations | 直接在回應裡附上消融表 |
| Missing baselines | 加比較,或精確說明為何不適用 |
| Not reproducible | 補實作細節;承諾程式碼釋出並給明確時程 |
| Limited evaluation | 加資料集或指標;不可行就誠實說明資源限制 |
| No limitation discussed | 修訂版加限制節,承認這是疏忽 |
| Overclaimed results | 把宣稱弱化到與證據相符,並展示改後的措辭 |
| Unfair comparison | 改用標準評估協定;補上常被報告的基準模型 |
| Engineering, not research | 指出設計背後的科學洞察,說明為何這個選擇並不顯然 |
| Metrics don't match claims | 把每個宣稱對到一個具體指標;可行就補上缺的指標 |
| Related work incomplete | 補上缺的引用,並說明它們與你的關係 |
就算拿到 3/8/8,那個 3 分也要認真回。負面審稿人在討論階段可能被判定為離群值,但前提是你交了回應。不交,編輯手上什麼都沒有。
承認一個小弱點,會讓你對大論點的辯護更可信。全面防守、零讓步,讀起來像不客觀。
Reviewers are trained to be skeptical of arguments. They are not trained to be skeptical of data.
還有一條給未來的你:最好的回應在投稿前就寫好了。那叫 prebuttal,兩個好處:你常會在寫的過程發現攻擊確實成立而先修好;真的被攻擊時你已經有打磨過的回應。這也是上一支 paper-review 的產物之一。
定稿前跑一次中立第三方測驗:找一個沒讀過你論文的人,只給他看審稿意見與你的回應,問他「你看得出這些疑慮被解決了嗎」。看不出來就重寫。
| 審稿人說 | 真正的問題 | 回去用哪一支 |
|---|---|---|
| Contribution unclear | 貢獻沒講清楚 | paper-review |
| Method not persuasive | 方法說服力不足 | experiment-craft(第 13 章) |
| RQ too small/no gap | 題目太小或沒缺口 | paper-graph(第 12 章) |
| Writing not sharp | 寫作不夠鋒利 | sciwrite + academic-humanizer |
| Novelty overclaimed | 創新性宣稱過頭 | paper-review 的攻擊創新性那一招 |
被拒不是終點,是把你送回工作流上游的訊號。這張表的用途,是告訴你該回到哪一站。而如果同一個理由出現兩次,那就不是運氣問題了。
11
文獻線的第三支。它不是把三十篇摘要串起來,而是一條有次序的六階段管線。
Cluster papers by technical mechanism, not chronology. This is the defining characteristic of a survey vs. a summary.
SKILL.md不依年代排列。這就是文獻回顧與摘要的分界。照年份排出來的那份東西,叫做編年紀事,不叫文獻回顧。
每一個方法都要分析:為什麼有效、做了什麼取捨、在哪裡會失敗。原文說這一條把「文獻回顧級寫作」和「淺層摘要」分開。
先辨識領域慣例,再產帶指示的藍圖。
用最相關的 top-30 篇寫完整初稿。
用全部文獻逐節展開,這步才長出深度。
每節收斂成 150 到 300 字。
用節摘要重寫摘要、引言、結論。
依大綱順序合併並產書目。
為什麼第一階段要先分兩相?原文:Different fields have different survey conventions — a clinical systematic review looks nothing like a CS methods survey.醫學要 PRISMA 流程圖,材料要結構與性質關係,人類受試研究要倫理章節。先定領域,再產大綱。
| 章節類型 | 目標長度 |
|---|---|
| Methods(每個典範章) | 6000 字以上 |
| Evaluation | 3500 字以上 |
| Challenges | 3000 字以上 |
| Applications | 3000 字以上 |
| Problem Definition | 2000 字以上 |
| 其他 | 2500 字(預設) |
30–120
輸入篇數
20–40
輸出頁數
≥3
每段引用密度
零相依。它不跑腳本、不用金鑰。真正的前置是 paper-navigator 要先把論文找齊。
| 維度 | research-survey | 論文的 Related Work |
|---|---|---|
| 篇幅 | 20 到 40 頁 | 2 到 4 頁 |
| 讀者 | 整個領域 | 這一篇的審稿人 |
| 目的 | 建立領域全貌 | 標定你要對話的那一組 |
| 修改週期 | 不進修改循環 | 會跟 Introduction 與 Method 一起改 |
| 寫作時機 | 研究早期,或獨立發表 | 論文成形之後 |
Vista 心法:寫文獻回顧比寫論文簡單,但複利更長。一篇好的文獻回顧,會在你之後的每一篇論文裡被自己引用,也會被別人引用。它是研究生涯裡投報率最高的一種寫作。
12
順序很重要。先用 paper-graph 定位缺口,再用 research-ideation 生候選題。反過來就是空想。
把一個主題畫成「挑戰 → 解法 → 論文」的世代演化圖。輸出是一份可以直接貼進 GitHub 或 Obsidian 的 Markdown,裡面嵌 Mermaid 圖。
11 支裡唯一還在 0.x 的一支。功能完整但仍在演進,用之前記得看一下有沒有新版。
Mermaid is just text inside fences — the file renders directly in GitHub, Obsidian, VS Code.
這是 14 支裡唯一硬性要求金鑰的一支。缺了會明確報錯,不會靜默降級。
No outbound LLM dependency: the skill exposes data fetchers, prompt templates, parsers, and renderers. The host agent is the LLM provider.
SKILL.md「Design notes」第一條它提供的是資料抓取、提示詞模板、解析器與繪圖器。實際去問 AI 的,是你正在用的那個 agent,用你自己的模型與額度。
原文:Failure mode preference: loud over silent.缺金鑰、輸出格式壞掉、搜尋回零篇,一律中止並印出原因,不產出一個看起來完整但其實有問題的成品。
核心文獻。只有這一層會進入分類法,成為圖上的節點。
相鄰但非核心。保留在圖上供參考,不進分類。
判定不相關,而且會告訴你為什麼被排除。
它連自己的分類失敗都想好了:分類驗證失敗時會套用「全部當 CORE」的安全網,並在輸出加上 (FALLBACK: 原因) 後綴。看到這個後綴就重問一次;第二次還是 fallback 就接受並繼續。這是「大聲壞掉」的具體實作。
分群規則也很嚴:每個解法目標 2 到 5 篇論文。只有 1 篇會破壞下游比較,6 篇以上代表分得太寬,兩種情況都要重新平衡分類法。
圖上每一條「A 演化自 B」的連線,都要單獨問一次 AI,並標上證據等級。
摘要裡就找得到證據
內文某一節有證據
只是合理推論,沒有直接證據
找不到支持,不採用
看圖先看標記。INFERRED 只是合理推論,不是事實。把它當事實寫進論文,就是在幫 AI 的猜測背書。解析失敗時預設判 INFERRED,原文說明是 the edge survives rendering but is visibly marked。
另有一條反幻覺規則很值得學:它明文允許「所有論文都是獨立的、沒有演化鏈」這個結果。原文:A flat list of independent papers is perfectly expected and preferred over a forced, fabricated chain.寧可圖不好看,也不要編一條假的演化線。
# 舊版 SKILL.md 裡寫的(會失敗) uv run python EvoScientist/skills/paper-graph/scripts/cli.py # 上游已改成相對路徑(正確) python scripts/cli.py <subcmd>
那個前綴在你實際的安裝位置根本不存在,所以會 file not found。另外,工作目錄要用相對路徑如 ./<name>.work/,不要用 /tmp/...,因為有些環境的 shell 與檔案讀取工具被關在不同的根目錄。
這也是為什麼第 1 章說:要看設計理念,不要背操作步驟。
這張圖不是拿來背,是拿來問
「我要接在哪一條演化路線的下一棒」。
第 4 步是關鍵。那些「還沒被解決的挑戰」就是下一支 skill 的輸入。兩支工具的核心資料結構在這裡接上。
把「我知道大方向但想不出具體題目」變成一條有淘汰機制的流程。九個步驟,從讀文獻到產出一份可送出的研究計畫。
Do NOT generate ideas without real paper grounding. The tree must reference actual papers with titles, authors, and findings. Paper search MUST go through paper-navigator — never use WebSearch/WebFetch as a shortcut.
一般搜尋看不到 Semantic Scholar 的引用結構與學術推薦系統,撈回來的東西沒有辦法建立世代關係。
相依很輕:它自己沒有腳本,全部借 paper-navigator 的。所以只要 paper-navigator 裝好了,它就能用。
Problem selection > solution design
決定「要解什麼」比決定「怎麼解」重要。
If a well-established solution exists, switch problems
改進空間太小,不值得投入。
Generate many candidates before evaluating any
生的時候不要評,評的時候不要生。
The tournament finds surprises. Trust rankings over gut feeling.
相信排名勝過相信直覺。
第 7 條就是接下來六頁要講的東西。它為什麼值得相信,我們一步一步算給你看。
拿到 30 到 50 篇文獻之後,先不要急著生 idea。從每篇抽出「它解決的挑戰」與「它用的關鍵洞察」,再做多對多映射。
unsolved problem。這一格通常就是缺口所在,值得優先看。
cross-domain transfer opportunity。別的領域的解法搬過來可能就成立。
已經被做爛。原文 avoid unless you have a fundamentally new angle。
這一步花的時間會在錦標賽階段全部賺回來。沒有對照樹的候選 idea,多半只是把已知說法換句話講。
看創新性與創造力。高風險高報酬,往沒人做過的方向推。
看可行性。問「這在你的資源下真的做得完嗎」。
看科學價值。問「這真的推進了理解嗎,還是只是換個資料集」。
軌冠軍 = 該軌所有輪次裡最好的那一個。
一條防退化的硬規則:If evaluation says the approach is a dead-end, the persona MUST pivot — refinement is not restricted to patching.評估說這條路走不通,人格必須轉向,不准只打補丁。
不管是棋手還是 idea,一律從 1500 分起跳。沒有人有先天優勢。
而且加的分等於對方扣的分,總分永遠不變。這是一個零和的積分池。
打敗一個大家都覺得弱的對手,幾乎不加分;爆冷贏過高分的,一次就跳上去。
把「棋手」換成「候選研究題目」,整套制度一個字都不用改。research-ideation 做的就是這件事:讓你的 15 到 21 個候選題互相對打。
為什麼值得這樣做:你心裡原本最喜歡的那一個,常常在對打兩輪之後就掉下去了。那個「掉下去」的過程,就是它替你做的事。
六個候選題,每輪兩兩配對打一場,跑四輪。注意每一欄加起來永遠是 9000 分。
| 候選題 | 起始 | 第 1 輪 | 第 2 輪 | 第 3 輪 | 第 4 輪 | 名次 |
|---|---|---|---|---|---|---|
| E 跨域遷移那一題 | 1500 | 1516 | 1532 | 1548 | 1533 | 第 1 |
| A 最初你最喜歡的那一題 | 1500 | 1516 | 1531 | 1512 | 1529 | 第 2 |
| D 一開始被看衰的那一題 | 1500 | 1484 | 1470 | 1489 | 1505 | 第 3 |
| C | 1500 | 1516 | 1499 | 1483 | 1498 | 第 4 |
| B | 1500 | 1484 | 1470 | 1487 | 1471 | 第 5 |
| F | 1500 | 1484 | 1498 | 1481 | 1464 | 第 6 |
看 D 那一列:第 2 輪還在 1470,最後爬到第 3 名。憑直覺先淘汰它,你就不會知道它其實撐得住。
用生活的例子講:叫你替十部電影打 1 到 10 分很難,叫你說「這兩部你選哪一部」很容易。ELO 就是把「很難的絕對評分」換成「很容易的兩兩比較」,再用數學把排名還原出來。
這一題有沒有提出文獻裡沒見過的角度。
用你手上的資源與時間,真的做得完嗎。
它有沒有真的接到你原本想解決的那個缺口。
你能不能在三句話內把它講清楚。
提出文獻中未見的根本新路徑。不是「做得比較好」,是「換了一條路」。
把已知技術套到新場景,並有實質調整。多數人的題目落在這一格。
有了錨點,AI 打分才不會漂。而錨點也同時在告訴你:如果你想要 9 分的題目,需要的是什麼。
欄位固定:Rank/Title/Core Mechanism/創新性/Feasibility/Relevance/Clarity/ELO。
含 Core Idea、Validation Plan,以及 Refinement Summary:改了什麼、為什麼、哪個人格帶來最大改動。
選定之後才展開成完整研究計畫。這是流程裡的人工關卡。
SKILL.md 特別標注 Part 2 是強制的:do NOT skip the full refined ideas or collapse them into the comparison table.理由很實際:你要看的是它怎麼從第一版變成第三版,那才是你學得到的東西。
在「學術寫作與 AI 輔助」這個領域畫出演化圖譜。
發現一條線斷在半路:非母語教師使用 AI 潤稿之後,authorial voice 被稀釋這個現象有人提出,但沒有人做實證。
不是問「給我幾個題目」,而是「針對這個已定位的缺口,用三人格生候選並跑錦標賽」。
你帶去的不是三個想法,是三個想法加上淘汰掉的六個,以及每一個的取捨理由。
文獻不墊底,idea 就是空想;
只看冠軍,你學不到淘汰的理由。
13
做質性研究的人請不要跳過這一章。三支的訓練框架是通用的,換一個載體,心法不變。每一支都會給你質性版的對映。
實驗跑不動的時候用的。它不叫你多跑實驗,它叫你先找到失敗的那一個原子原因。
1. Slow progress: Running random experiments without understanding failure causes.
2. Wasted time: Abandoning good approaches because activation tricks were missed.
第二種特別可惜:好方法被丟掉,只因為漏了某個啟用技巧。
The goal is not to run more experiments. The goal is to run the RIGHT experiments — ones that isolate causes and test specific hypotheses.
零相依。沒有腳本、沒有套件、沒有金鑰。只有一份方法論文件與一份日誌範本。
看實際輸出,不是只看彙總指標。判斷失敗是系統性的還是隨機的。
兩條路:簡化任務,或把你的改動一項項拿掉。
這一步隔離出原因。沒有它,你就只是在猜。
列出所有可能解釋,依可能性排序,設計針對性實驗逐一排除。
修法要對準確認的原因,不是對準表面症狀。
第 2 步有一句話很療癒:There is always a simple enough version that works.永遠存在一個簡單到會動的版本。找到它,就有了比較的基準。
改兩件事成功了你不知道是哪件救的,失敗了你不知道是哪件錯的。單變數每次比較慢,整體比較快。
一個設計良好的診斷實驗,抵十次隨機嘗試。
它們需要特定的啟用技巧(學習率排程、初始化方式、前處理步驟)。別因為一次失敗就丟掉一個技術。
關鍵實作細節常埋在補充材料或程式碼裡,那些技巧就是能不能運作的分水嶺。
Once you've ruled out the impossible, whatever remains must be true.
第 5 條。系統性排除勝過直覺| 欄位 | 要記什麼 |
|---|---|
| Purpose | 為什麼跑這個實驗,你預期學到什麼 |
| Setting | 資料、演算法改動、超參,所有能重現它的東西 |
| Results | 量化指標 + 質性觀察 + 具體的好案例與壞案例 |
| Analysis | 結果符合預期嗎,不符合就列出依可能性排序的假設原因 |
| Next Steps | 依分析決定下一步。你是專案負責人。 |
SKILL.md 特別點名第五欄:Don't wait for someone to tell you what to do next. Analyze your results and propose the next experiment yourself. This is what distinguishes a researcher from a technician.不要等別人告訴你下一步。自己分析、自己提。這就是研究者與技術員的差別。
情境:第一輪編碼的評分者間一致性不到 0.6,怎麼辦。不要急著再編一批,跑五步診斷,只是把五個候選原因換成質性版本。
類目定義夠明確嗎,有沒有模稜兩可的措辭。
兩位編碼者受過同一套訓練嗎,有共同校準過嗎。
試編樣本偏向某一類,導致某些類目沒被練到嗎。
類目之間互斥,還是本來就會重疊。
用 Cohen's kappa 還是 Krippendorff's alpha,選得對嗎。
質性與量化都在做同一件事:找到 WHY。
第 3 步是關鍵。不是把五個原因全查一遍,是先查「便宜又能排除最多可能性」的那一個。這就是診斷與亂試的差別。
主指標落在論文報告值的 2% 內。
找到穩定設定,3 次不同 seed 的變異 < 5%。
主指標勝過調校後的基準模型,且 3 次都一致。
每一條宣稱的貢獻都有對照實驗支撐。
請注意這是預設值,可以覆寫。很多教學範例會寫成 5/8/6/3,那是使用者自訂的小預算,不是 skill 的預設。預設之所以這麼大,是因為基準模型本來就難搞:論文細節缺漏、版本不合、未報告的前處理步驟。
調參的優先順序也寫死了:Learning rate → batch size → loss weights → regularization → architecture-specific params,反映的是典型敏感度。
When you know you have 12 attempts, you design each one to maximize information. Without limits, attempt #47 is rarely more informative than attempt #12 — it's just more desperate.
規則 2跳過階段 1,階段 3 的結果可能因為基準模型壞掉而全錯。跳過階段 2,你的改進可能只是調參調得比較好。沒有捷徑。
每一次失敗都縮小了搜尋空間,也揭露了問題的某個面向。
預算沒用完就停,代表你判斷出繼續下去邊際效益已經很低。
規則 1 那句最值得背:Most "method doesn't work" bugs are actually baseline setup bugs.多數的「我的方法沒用」,其實是基準模型沒架好。
逐一移除各元件,顯示每個元件的邊際貢獻。這是最常見的做法。
從基準模型出發逐一加元件,顯示增量收益。可以看出元件之間有沒有互相依賴。
把你的元件換成替代方案。證明你的元件比替代品好,而不只是比「沒有」好。這一種最能擋審稿人的攻擊。
為什麼消融這麼重要:A method that outperforms the baseline but has no ablation is a method you don't understand. Reviewers know this.勝過基準模型但沒有消融的方法,是一個你自己也不理解的方法。而審稿人知道這件事。
還要檢查一件事:確認沒有任何單一元件被移除後結果反而變好。那會直接推翻你的宣稱。
關卡條件換成評分者間一致性或飽和度指標。預算的概念完全一樣:先講好編幾輪,用完就停下來檢討。
這則指令裡的 5/8/6/3 就是覆寫預設值的寫法。你可以依自己的計算資源調整。
它不追求第一次就寫對。它在 plan → code → evaluate → refine 的圈裡跑檢查,用一個帶硬上限的複合分數決定要不要再跑一輪。
# 依可用的檢查工具,套不同權重
lint + tests 都有:0.2×lint + 0.1×format + 0.3×test + 0.4×self
只有 lint: 0.3×lint + 0.1×format + 0.6×self
只有 tests: 0.4×test + 0.6×self
兩者都沒有: 1.0×self
另有兩條扣分:明顯的邊界情況沒處理扣 0.1,寫死絕對路徑扣 0.05。
目標是 0.85 不是 1.0。原文:Don't gold-plate. Diminishing returns kick in hard above 0.9.
這一章對純質性受眾的直接價值最低,但「先診斷再重跑」與「先講好預算」這兩個習慣,換到哪一種研究都成立。
14
這一章跟前面幾章不同。這裡講的四個是觀念框架,不是可以安裝的 skill,也不在那 14 支開源清單裡。它們處理的是判斷,而判斷沒有辦法外包。
skill 可以幫你生候選題、可以幫你排名,但無法判斷這一題在你的領域裡夠不夠份量。
這是社科領域最常見的拒稿理由,而它問的是你對理論的立場。
skill 可以幫你除錯、跑管線,但無法判斷這個方法是不是這個問題該用的方法。
期刊選擇是策略決定,牽涉你的生涯規劃與時間成本。
接下來四個框架各是一條公式。公式的用途不是計算,是提醒你哪一項是零。任一項接近零,整體就接近零。
| 軸 | 要回答的問題 | 典型反例 | 通過條件 |
|---|---|---|---|
| Gap 研究缺口 | Why is there a gap? | 「我想研究 X」 | 講得出現有研究沒解決什麼,以及為什麼到現在還沒解決 |
| Importance 重要性 | Why does it matter? | 「這個議題很重要」(沒下文) | 說得出對學術的意義與對實務的影響,且有具體後果 |
| Audience 對話對象 | Who cares? | 「對學術界有貢獻」 | 指得出具體的研究社群,以及他們現在正在爭論什麼 |
三軸缺一不可,任一軸接近零,整題就接近零。多數被拒不是寫得不好,是這三軸裡有一軸是空的。
把你現在的研究問題寫下來,三軸各給自己一個評價。誠實一點,這張卡沒有別人會看。
不要三軸一起改。多數人的問題集中在一軸,通常是 Audience。
如果補了 Gap 卻讓 Importance 掉下來,那是把問題搬家,不是解決。
配合使用:這張卡跟第 12 章的 paper-graph 是互補的。paper-graph 幫你看見缺口在哪,三軸評分卡幫你判斷那個缺口值不值得補。看得見不等於值得做。
Method 的價值 = 匹配問題 × 因果邏輯 × 增進研究價值。審稿人看方法時不問「你用了多複雜的統計」,而是問三個問題。三題全 yes 才算過。
Method fits RQ。問題是描述性的卻用因果推論工具,或反過來,都會被抓。
Causal logic。跑出顯著不等於解釋了什麼。
Raise value。換一個更複雜的模型,如果結論一樣,那就沒有增值。
Method ≠ Complexity。用結構方程模型不會讓一個描述性問題變成理論貢獻。方法的複雜度要由問題決定,不是由你想展示什麼決定。
理論貢獻 = 路徑(Extend/Integrate/Meta-theorize) × 機制(X → M → Y)
把既有理論推到新的脈絡、新的對象、新的邊界條件。門檻最低,但要說清楚為什麼這個延伸不是理所當然。
把兩個原本不對話的理論接起來。門檻中等,關鍵在說明為什麼它們該對話。
質疑既有理論的預設。門檻最高,需要很強的證據,但一旦成立影響也最大。
任何一篇研究都該能回答兩題:你走的是哪一條路徑?你解釋了什麼「為什麼會這樣」?第二題答不出來,就只是描述而不是理論。
被接受機率 = 期刊 Fit × 編輯第一印象 × 審稿人信任度 × 修改表現
投稿前最關鍵的決策。fit 不對,後面三個環節做再好也沒用,直接 desk reject。
Cover letter 只佔 5% 影響,卻是最常被敷衍的一環。
第 10 章的 paper-review 就在做這一段:先自己拒一次。
第 10 章的 paper-rebuttal:分數導向的分類與回應。
四個環節缺一就被擋,而且它們是相乘不是相加。期刊選錯這一項是零,其他三項再高,乘出來還是零。所以期刊選擇要花的時間,遠比多數人以為的多。
| 卡在哪裡 | 用哪一條公式檢查 | 最常是零的那一項 |
|---|---|---|
| 題目定不下來 | Good RQ = Gap × Importance × Audience | Audience |
| 方法被質疑 | Method = 匹配問題 × 因果邏輯 × 增進價值 | 因果邏輯 |
| 說不出貢獻 | 理論貢獻 = 路徑 × 機制 | 機制 |
| 不知道投哪裡 | 被接受機率 = Fit × 第一印象 × 信任度 × 修改表現 | Fit |
再強調一次:這四個是觀念,不是可以安裝的 skill。它們不在課程點名的 14 支開源清單裡,也不需要任何環境設定。你需要的只是在動手之前,先用它們問自己一輪。
出處:三軸評分卡、審稿人三問法、三路徑貢獻設計三個框架,整理自謝傳崇教授 2026 年 5 月 1 日於清華大學的演講,依學術慣例標註出處後引用。
15
第 4 章決定你能不能開始,這一章決定你能不能換家。先知道有哪 14 支,才有得搬。
所以不是勉強能跑,請看以下三個證據。
EvoSkills 的 allowed-tools 寫的是 write_file、edit_file、read_file、think_tool、execute,不是 Claude Code 專有的 Read、Write、Bash。
academic-humanizer 的 frontmatter 直接寫著compatibility: claude-code codex morphmind opencode。
paper-review 與 deeppapernote 的目錄裡都已放了 AGENTS.md,那正是 Codex 讀的指令檔。
14
支全部可搬
0
支需要修改 SKILL.md
3
個必做的環境設定
| 項目 | Claude Code | Codex CLI |
|---|---|---|
| skill 路徑(使用者層) | ~/.claude/skills/ | ~/.agents/skills/ |
| skill 路徑(專案層) | .claude/skills/ | .agents/skills/ |
| SKILL.md 必填欄位 | name、description | name、description |
| 呼叫方式 | /skill-name | 輸入 $ 選用,或 /skills |
| 指令檔 | CLAUDE.md | AGENTS.md |
| MCP 設定 | claude mcp add | codex mcp add 或 config.toml |
| 檔案寫入 | 預設可讀寫 | 預設只可寫工作目錄 |
| 對外網路 | 預設可 | 預設不可 |
必填欄位兩邊一致,這是能複製的技術基礎。最後兩列是唯一要處理的事,也就是接下來四頁要講的沙箱。
~/.codex/skills# Codex 官方文件列出的六個掃描位置 $CWD/.agents/skills $CWD/../.agents/skills $REPO_ROOT/.agents/skills $HOME/.agents/skills # 使用者層,用這個 /etc/codex/skills (以及 OpenAI 內建)
~/.codex/skills 不在清單裡那是 Codex 內建 skill-installer 的預設落點,實務上跑得動,但官方文件沒有收錄。為了穩定,一律用 ~/.agents/skills/。
官方明文寫著「Codex supports symlinked skill folders and follows the symlink target」。所以不要複製檔案,用 symlink。一份原始碼兩個環境共用,日後更新只要更新一處。
版本方面不必擔心:Codex CLI 自 0.65.0 起就支援 SKILL.md,官方沒有訂最低版本。直接升到最新版最省事。
mkdir -p ~/.agents/skills
for s in paper-navigator research-survey research-ideation \
experiment-craft experiment-pipeline experiment-iterative-coder \
paper-planning paper-writing paper-review paper-rebuttal paper-graph \
deeppapernote sciwrite academic-humanizer; do
rm -rf "$HOME/.agents/skills/$s" # 這行不能省,見後面雷點一
ln -sfn "$HOME/.claude/skills/$s" "$HOME/.agents/skills/$s"
done
# 驗收 codex /skills # 應列出這 14 支 $paper-navigator # 打 $ 選用 skill
裝完必須重開 Codex。不重開就不會重新載入 metadata,你會以為安裝失敗。這一行字省下最多的誤判。
沙箱 = 一間只有一扇門、一扇窗的房間。
你把 AI 請進這間房間工作。門決定它能碰到你電腦的哪些資料夾,窗決定它能不能連上網路。
預設狀態是:門只開在它當下的工作資料夾,窗完全關著。這是為了保護你,不是故障。
Claude Code 的預設比較寬,Codex 的預設比較嚴。所以同一套 skill 搬過去,會在這裡卡住,而且卡得莫名其妙。下一頁看兩個真實的卡法。
實際發生的事:你叫它把深讀筆記存進 ~/Documents/MyVault/20_Notes/。那個資料夾不在它的房間裡,所以寫入被擋下來。
你看到的畫面:可能是一行權限錯誤,也可能它默默改存到別的地方。你打開 vault,空的。
實際發生的事:paper-navigator 要連 Semantic Scholar,paper-graph 也要。窗關著,連線直接失敗。
你看到的畫面:它回你一份很短、很空的清單,或者說「目前沒有找到相關文獻」。你會一直去改關鍵字,改到懷疑人生。
這兩種狀況的共同點:錯誤訊息不會告訴你「是沙箱擋的」。所以搬到 Codex 之後第一件事就是設好它,不要等出事再查。
# ~/.codex/config.toml
sandbox_mode = "workspace-write"
approval_policy = "on-request"
[sandbox_workspace_write]
writable_roots = [
"/Users/你的帳號/Desktop",
"/Users/你的帳號/Documents/ObsidianVault",
]
network_access = true
writable_roots 要開哪幾扇門清單裡的資料夾,AI 才寫得進去。把你的桌面與 Obsidian vault 加進去就夠了,不要整顆硬碟都開。
network_access 窗要不要開設成 true,它才連得上 Semantic Scholar 與 arXiv。不開,文獻線的兩支就是廢的。
approval_policy 要不要每次問你on-request 是折衷值:一般動作直接做,遇到超出範圍的事會先問你。
路徑要寫絕對路徑,而且要換成你自己的帳號名。照抄「你的帳號」四個字會失敗。
在 ~/Documents/ObsidianVault/ 建一個 測試.md,裡面寫一行「沙箱測試成功」
然後自己打開 Obsidian 看那個檔在不在。它說成功不算,你看到才算。
用 paper-navigator 查一下 Attention Is All You Need 這篇的引用數
查得到具體數字,就代表網路通了。回你「無法存取外部資源」就是窗還關著。
這兩個動作花不到兩分鐘,但省下的是「為什麼我的 skill 都怪怪的」那種查不完的下午。
補充一句:Claude Code 也有類似的權限設定,只是預設寬鬆,多數人不會遇到。換環境之所以要重驗,就是因為預設值換了一組。
ln -sfn 遇到已存在的實體目錄不會覆蓋,而是把連結建進那個目錄裡面。結果你以為換了新版,實際還在讀舊的。實測過的版本落差可達兩個大版本。
目錄名是 sciwrite,frontmatter 的 name 是 manuscript-writing-review。要打的是 $manuscript-writing-review。14 支裡只有這一支不一致。
可用 skill 清單最多佔 context 的 2%,或 context 未知時佔 8000 字元。裝太多時描述會先被截斷,自動選用的準確率下降。解法是統一用 $ 顯式指定。
雷點二特別容易卡住一整排人。它跟第 9 章講的是同一件事,這裡再說一次,因為換到 Codex 之後更容易忘。
有沒有重開?名字對不對?路徑對不對?是不是舊版實體目錄擋住了?
Codex 的 workspace-write 預設不連網。開 network_access。
同樣是沙箱問題。把 vault 路徑加進 writable_roots。
工具鏈搬家會讓驗證層靜默失效。檢查設定檔的 toolchainRoot 還指得到。
長指令在紙本或 PDF 上會折行。一律從數位檔複製,不要照紙本手打。
資料夾名有空白要加引號。更省事的做法是資料夾名不要用空白。
SKILL.md files from Codex are not directly compatible with Claude Code's plugin format.
OpenAI 官方文件。這句話指的是 Claude 的 plugin 打包格式,不是 skill 本身雙方的必填欄位完全一致,都只有 name 與 description,而且這 14 支的 frontmatter 都沒有用到 Claude Code 專有欄位。
實務上跑得動,但未來版本有可能變動。真的要長期依賴,記得在升級 Codex 之後重跑一次驗收。
16
這一章是選配,而且要先聲明:PaperBrain 是我自己做的工具,不在前面點名的 14 支開源清單裡。它採 Apache-2.0,需要 Node.js 20 以上。前面十五章不裝它也完全走得通。
第 7 章教你怎麼讀、怎麼歸檔。但當筆記累積到三十份以上,新的問題出現:哪一張卡支持哪一個論點?哪些卡彼此矛盾?哪一句話是原文、哪一句是我的推論?
每一張卡的每一個宣稱都帶出處標記,卡與卡之間建立連結,並且由程式而不是模型來檢查完整性。
〔p.12 src〕 原文第 12 頁,有明確出處〔§3.2 src〕 原文第 3.2 節〔inf〕 我的推論,不是作者說的〔n/a〕 作者沒有報告這一項寫論文時只要搜尋 〔inf〕,就知道哪些話是你自己推的、不能當作者的意思引用。
一篇論文 ├── capture ──→ 10_Sources/ 原始檔案與全文 │ 00_Inbox/ 書目暫存 ├── read ────→ 20_Cards/ 研究卡(核心產物) │ 這一步會停下來問你 ├── link ────→ 30_Concepts/ 原子概念筆記 ├── ask ─────→ 只用你的卡回答問題,不寫檔 └── synthesis → 40_Synthesis/ 文獻矩陣、缺口與矛盾
因為證據強度與出處標記需要你判斷。全自動的產出沒有人能為它背書,那就退回第 2 章講的代寫。
40_Synthesis/ 的文獻矩陣是程式直接讀卡片產生的,模型不經手。這樣矩陣裡不會出現卡片上沒有的東西。
# 1. 工具鏈搬到長期位置,之後就別搬 mv ~/Downloads/paperbrain ~/Tools/paperbrain # 2. 建立 vault(--root 一定要寫) node ~/Tools/paperbrain/bin/paperbrain-init.mjs \ --root ~/PaperBrain --mode obsidian --language zh-TW # 3. 安裝 skills,然後重開 cp -r ~/Tools/paperbrain/skills/* ~/.claude/skills/
搬了工具鏈,卡片照樣產出,但沒人檢查了。skill 與工具鏈是兩個不同的絕對路徑,skill 靠設定檔裡的 toolchainRoot 才找得到驗證程式。工具鏈一旦放好就別再搬。
CARD_NO_SOURCE DEAD_LINK
CITEKEY_FILENAME_MISMATCH
STALE_INBOX UNREVIEWED_CARD
在對話裡說一句「檢查我的論文腦」就會跑。程式決定性地掃一遍,AI 不得改寫報告。
低於這個量,用第 7 章的方法加一個資料夾就夠了。
要做文獻回顧、要寫矩陣,這時候卡片網絡才划算。
它的驗證層是本機 Node 程式,瀏覽器版跑不了。見第 4 章。
三個條件不同時成立,就先不要裝。工具的價值來自你的使用量,不是來自它有多完整。前面十五章已經是完整的工作流,PaperBrain 只是在量夠大之後才划算的那一層。
17
安裝清單、三十天起手式、授權義務,以及回去之後怎麼跟上。
判斷標準只有兩條:對外可辯護,對內能產生複利。兩條都過,怎麼用都不會出事;有一條沒過,用得再少都有風險。
複利不是產出多,是每一次都墊高下一次的地板。一致的歸檔,才是三年後還在替你工作的那部分。
先想再問、每段驗證、留下 SOP、定期斷奶。愈靠近判斷與立場,愈要自己來。
| EvoSkills 11 支 | 對應章節 |
|---|---|
| paper-navigator | 第 6 章 |
| research-survey | 第 11 章 |
| paper-graph | 第 12 章 |
| research-ideation | 第 12 章 |
| experiment-craft | 第 13 章 |
| experiment-pipeline | 第 13 章 |
| experiment-iterative-coder | 第 13 章 |
| paper-planning | 第 8 章 |
| paper-writing | 第 8 章 |
| paper-review | 第 10 章 |
| paper-rebuttal | 第 10 章 |
| 獨立開源 3 支 | 對應章節 |
|---|---|
| deeppapernote | 第 7 章 |
| sciwrite | 第 9 章 |
| academic-humanizer | 第 9 章 |
EvoSkills repo 全集共 16 支(2026-09 查證),本課點名其中 11 支,其餘可自行探索。repo 另有 MCP 設定檔,那些不是 skill。
| 來源 | GitHub | 授權 | 再散布的義務 |
|---|---|---|---|
| EvoSkills(11 支) | github.com/EvoScientist/EvoSkills | Apache-2.0 | 附授權全文與版權聲明,修改過的檔案要標示已變更 |
| DeepPaperNote | github.com/917Dhj/DeepPaperNote | MIT | 保留版權聲明與授權全文 |
| sciwrite | github.com/labarba/sciwrite | CC BY 4.0 | 署名 Lorena A. Barba、附授權連結、指出是否修改過 |
| academic-humanizer | github.com/AIScientists-Dev/academic-humanizer | MIT | 保留版權聲明與授權全文 |
最省事的做法是不要打包,給連結就好。授權義務留在上游,你這邊零風險。特別注意 sciwrite 是唯一的 CC BY 4.0,改它的 name 就構成「已修改」,必須註明。
不要 14 支一起裝。一次全用會噎住,而且你分不出哪一支真的有用。
只裝 paper-navigator。用它分層快讀 15 篇你手上正在讀的文獻,並開始留查詢紀錄。
加裝 paper-writing 與 sciwrite。用 11 步工作流寫一節,並只對三個關鍵段落跑句級體檢。
讀不完就加 deeppapernote;題目定不下來就加 paper-graph 與 research-ideation;要投稿就加 paper-review。
三十天之後,你會知道哪三支是你真正天天用的。剩下的等遇到那個節點再裝。
會,而且應該會。但它們是 markdown,你隨時可以改。真正不會過時的是第 1、2、14 章講的東西:判斷標準、工作流結構與方法論框架。學方法論,不要學一次性的提示詞。
可以,也應該改。每一支都是 markdown,你可以依自己的領域客製觸發詞、輸出格式與檢查規則。唯一要注意的是授權:改了要留紀錄,sciwrite 改了還要註明。
這條流程不是套餐,是骨架。
哪一格不順,就換那一格的工具。
你照 GitHub 裝到的,跟我課堂上示範的,有三處不一樣。與其含糊帶過,不如當成「skill 可以怎麼客製」的實例。
常設規則:文獻回顧類任務優先 Q1 與 Q2;Q3 只在帶關鍵證據時收錄並標記;排除 Q4 與 MDPI。附帶的實務理由:那些站臺會擋自動請求,留著會讓後面的 DOI 存活檢查一起壞掉。
五面向自審之後,再派一個獨立的懷疑論者逐節審一遍;投稿前跑一支腳本,把參考書目的每個 DOI 拿去 CrossRef 驗存活。改編自 CYC2002tommy/Deep-Research-Agent,我修掉了原版的編號錯誤,並拿掉「只能用英文審」的限制。
四步填空結構:建立重要性 → 限制與缺口 → 貢獻 → 可量化成果。收錄自王士欣公開的教學文章,來源與連結都寫在檔案裡。
為什麼要專門講這一頁:前面說過「今天介紹的全部是授權明確的開源 skill」,那是對的。但我自己在上面加了三層東西,如果不講,你會以為那些也是原廠功能。而且這三處剛好示範了客製的三種型態:加一條紀律、接一個外部工具、收錄一份別人的方法論。
學員自行前往原始 repo 安裝。本課程不重製、不修改、不打包散布任何第三方程式碼或教材。
第 14 章的三個框架整理自謝傳崇教授 2026 年 5 月 1 日清華大學演講;其餘引言均出自公開出版品,依學術慣例標註出處後引用。
美國賓州大學華頓商學院教授,《Co-Intelligence》
Microsoft Research,How to Write a Great Research Paper
Stanford,Writing in the Sciences。sciwrite 的方法論源頭
AI 賦能學術研究基地。課程、資源庫與文章都在這裡,另有六堂免費線上課共 58 個單元,不需帳號、不需付費。
第 4 章與第 15 章的完整版,含指令速查與錯誤排除,另有獨立的簡報與 PDF 可下載。
有問題直接寫信。也歡迎到臉書社團「博碩士生練功團」交流。
拿起手機
掃一下就到。
或直接輸入網址:
tally.so/r/NpNJqO
你的回饋會直接影響下一版的內容編排。特別想知道:哪一章太快、哪一章太慢、哪一個練習最有用。
Thank you
骨架不變,零件可換。祝你的研究,愈做愈有複利。
Vista(鄭緯筌)researcher.tw 2026.09 v1