從心態到工作流,把 AI 變成你的研究副駕駛
AI 應用講師|內容策略顧問|寫作教練
經濟日報與科技島專欄作家,前《數位時代》雜誌主編、前風傳媒產品總監。著作超過 20 本。
長期把 AI 串成研究與寫作的工作流,協助大學教師、研究生與專業工作者,把素材變成可累積的知識資產。
vista.tw 個人品牌與知識庫researcher.tw 研究者基地iamvista.substack.com 電子報solo.tw AI 一人公司生態系不用 AI 怕落後、用了 AI 又怕被指控代寫;有人乾脆不揭露,把風險留給自己。
AI 幫你寫完 draft、你自己都看不懂邏輯;投稿一被 reviewer 追問細節就穿幫。
大家都用同一套 AI 產同一種文字,reviewer 的閱讀疲勞在惡化,novelty 門檻在墊高。
三個現象看起來不同,共同缺陷卻是同一個:把 AI 當代寫者。今天要換一個位置來用它。
AI 不會取代研究者,但善用 AI 的研究者,會取代不善用 AI 的研究者。 Ethan Mollick 賓州大學華頓商學院教授,《Co-Intelligence》作者
ChatGPT、Claude 你都會了。單次問答式的用法,不需要一堂課。
差別不在會不會用 AI,在有沒有一套會進化的工作流。
模板會過期,方法論不會。你要帶走的是判斷什麼時候該用哪一支、什麼時候不該用。
核心洞察與研究貢獻,從頭到尾都應該是你的。這是選教材的判斷標準。
14 支授權明確的開源 Skills,加上一套你自己就能維護的工作流。
這一章沒有任何學術內容,但不先講清楚,後面十四支 skill 你會不知道自己在裝什麼。三個詞而已,十分鐘講完。
問完就關掉。下一次要用,再從頭解釋一次你的研究題目、你的領域、你的偏好。
它不知道你上次問過什麼,也碰不到你電腦裡的任何檔案。
它記得你的規則,看得到你的 PDF,產出直接落在你的研究資料夾裡。
你教它一次,它就一直照著做。
差別不在模型比較聰明,
在於它有沒有手腳,以及你有沒有給它一份規範。
同一個模型,差在能不能動手。這張表是整堂課的前提。
| 維度 | 聊天機器人 | AI Agent |
|---|---|---|
| 你給它什麼 | 一個問題 | 一個目標 |
| 它做什麼 | 回一段文字 | 自己拆解步驟,逐步執行 |
| 能不能讀你的檔案 | 不能,只能你貼給它 | 能,直接讀資料夾 |
| 能不能產生檔案 | 不能,只能你複製貼上 | 能,直接寫進你指定的位置 |
| 能不能執行指令 | 不能 | 能,跑腳本、呼叫 API、查資料庫 |
| 做錯了會怎樣 | 你自己發現 | 可以設檢查點,讓它自己驗 |
| 下一次還記得嗎 | 不記得 | 記得,規則寫在檔案裡 |
一句話:聊天機器人給你答案,Agent 幫你把事情做完。而做完的定義是「你的電腦裡多了一個檔案」。
比較表.md,存進你的研究資料夾注意右邊那句話有多短。「把桌面 papers 資料夾裡的十篇做成比較表」。你沒有下 prompt,你下的是交辦。這就是 Agent 的意思。
一支 skill,就是一個資料夾,
裡面放一份寫給 AI 看的說明書。
你現在就打得開它、讀得懂它、改得動它。這件事很重要,後面第十一章講「搬到別的環境」時,全部建立在這個事實上。
它不是外掛,不是 App,也不是要付費訂閱的服務。
name 與 description。AI 靠 description 判斷這次該不該叫這支。
沒有語法要學,就是一份 SOP,只是讀者是 AI。你現在就改得動它。
| 維度 | 存一堆 prompt 模板 | 寫成 skill |
|---|---|---|
| 存在哪 | 記事本、書籤、Notion | 你的電腦,AI 讀得到的位置 |
| 怎麼啟動 | 你要記得它存在,找出來,貼上 | AI 看 description 自己判斷要不要用 |
| 會不會忘記用 | 會,這是最大的問題 | 不會 |
| 改進之後 | 要記得下次貼新版 | 改一次,之後每次都是新版 |
| 能不能加檢查 | 不能 | 能,跑腳本驗證 |
| 能不能給別人 | 貼給他,他還是會忘記用 | 給他一個資料夾就好 |
prompt 是你每次都要重講的話;
skill 是你只講一次、之後它自己記得的規矩。
那是綁在某一家平臺的設定。skill 是你電腦裡的檔案,換平臺就搬資料夾。第十一章會實際搬一次給你看。
MCP 是「接上外部資料源」的插座,例如接你的 Zotero。skill 是「怎麼做事」的說明書。兩者互補,不是替代。
指令檔是永遠生效的全域規矩。skill 是需要時才載入的專項流程。全部塞進指令檔會讓 AI 每次都要讀一大堆無關的東西。
今天講的 14 支全部開源、免費、授權明確。你不會被綁在任何一家的訂閱上。
這六個判斷標準是我實際拆過幾十支之後收斂出來的。順序就是重要性順序。
找不到 LICENSE 檔的,直接跳過。你不知道能不能用、能不能改、能不能給學生。
好的 skill,README 會告訴你它要解決什麼痛點、為什麼不用別的做法。說不出來的,多半只是把 prompt 換個檔名。
只寫優點不寫邊界的,代表作者沒真的用過。好的 skill 會寫「不要拿我做 A、B、C」。
好的 skill 會寫死「證據不足就停下來要更好的材料,不准產出降級成品」。deeppapernote 甚至逐句規定 AI 不准說「已完成」除非該階段真的跑過。這一條最值錢。
零相依的純 markdown 最好搬也最不會壞。要裝套件、要申請金鑰的,用之前先確認你真的需要它多出來的那個能力。
不要只看最後更新日期。純規則的 skill 半年沒動可能只代表規則穩定;有腳本、有 API 相依的 skill 半年沒動就要小心。看它的性質,不是看 commit 頻率。
一個反例:star 數不是判斷標準。今天講的三支獨立 skill,star 從 825 到 1426 都有,但最好用的那一支不是 star 最多的那一支。
| 判斷標準 | deeppapernote | sciwrite | academic-humanizer |
|---|---|---|---|
| 授權 | MIT,清楚 | CC BY 4.0,散布要署名 | MIT,另含衍生聲明 |
| 設計理念 | README 開篇就講痛點 | 有,而且交代了製作方法 | 有,說明校準方式 |
| 邊界 | 明列三條「不做什麼」 | 明列四條 | 明列,含倫理聲明 |
| 不唬爛 | fail-closed,管到用詞 | 有約束,較輕 | 改寫要覆蓋原文全部內容 |
| 相依 | Python ≥3.10 加 PyMuPDF | 零 | 零 |
| 維護 | 活躍,有 CI 與測試 | 靜態,純規則故合理 | 靜態,純規則故合理 |
三支都通過。但你會發現它們強在不同地方:deeppapernote 是工程最紮實的,sciwrite 是方法論最有來歷的,academic-humanizer 是校準方式最誠實的。第八章會各自展開。
不要一次裝 14 支。裝太多有兩個具體壞處:一是你分不出哪一支真的有用;二是 skill 清單會佔掉 AI 的閱讀額度,描述被截斷之後,它自動選用的準確率反而下降。
分開看是三個名詞,串起來才是這場演講真正在講的事。
有手腳的 AI。讀得到你的檔案,寫得出檔案,跑得動指令。你給的是目標不是問題。
一個資料夾加一份 markdown 說明書。只有 name 與 description 是必填。你改得動,也搬得走。
把有效的做法寫成 skill,讓它每次自動生效。這樣每一次研究都墊高下一次的地板。
接下來十二章,都是在把研究流程的每一格,
換成一份你改得動、搬得走的說明書。
工具會換,這一章不會。先把位置站對,後面十四支 skill 才有意義。
The point of doing research is not to produce papers.
It is to produce understanding.
Simon Peyton Jones Microsoft Research,How to Write a Great Research Paper
如果研究的目的是產出理解,那麼把理解外包出去的每一個動作,都在削弱研究本身。這句話是整套工作流的設計前提。
你才是駕駛。方向盤永遠在你手上,油門與剎車也是。
你沒看過中間過程,只拿到結果。出事的時候你不知道哪一步錯了。
你們看的是同一條路。他提醒你儀表板的異常,但轉不轉彎是你決定。
這是最常見、也最容易在口試現場被抓出來的一種。它的代價不是被退稿,是你失去對自己論文的掌握。
AI 讓產能變高,但學術界的稀缺資源從來不是產能,是 reviewer 的注意力。用產能去洗注意力,長期是把自己的信譽折現。
複利不是產出多,是每一次都墊高下一次的地板。
讓 AI 生出你沒讀過的文獻,或直接採用未經查證的書目與 DOI。
讓 AI 生成、補齊或美化實驗數據、受訪者引言、統計結果。
達到實質協助門檻卻不說明,或刻意抹除協作痕跡。
前兩條是造假,第三條是不誠實。三條都不是灰色地帶,也沒有「大家都這樣」的免責空間。
作者身分要能承擔責任,AI 承擔不了。
寫在方法段或致謝,看該刊規定。
包含 AI 產出的每一句。
你的名字掛上去,就是你要為每一句話負責。
界線不在「用了多少 AI」,在「AI 有沒有參與產生內容與判斷」。拿不準就揭露,成本遠低於被質疑。
避免使用「AI-generated」這種模糊字。寫清楚三件事:AI 做了什麼、你做了什麼、責任在誰。方括號裡的內容要換成你真正做過的事,不要照抄。
歐盟 AI 法第 50 條的透明度要求上路,模型供應商開始在輸出裡嵌入來源標記。
.svg、.png、.jpg 等檔案claude.com/check-files 免費驗證不要過度解讀。官方目前列為已支援的只有部分新模型(2026 年 8 月 2 日之後推出者),舊模型仍在補;逐字重寫會移除浮水印;記號也不能證明著作權歸屬。
記號不是免罪符,也不是判罪書。
判斷標準始終沒變:達到實質協助門檻,就主動揭露。
刻意抹除協作痕跡,撞的是第三條紅線。而主動揭露的人,從來不需要擔心別人驗出什麼。
訪談錄音、逐字稿、問卷原始回應、任何可辨識個人的資料,都不該進雲端模型。這與模型好不好無關,是研究倫理審查的範圍。
先去識別再處理,或整套流程留在本機。第三章會講清楚哪些環境做得到本機處理。
不確定就先問 IRB。事後補救比事前確認貴 100 倍。
問 AI 之前先寫下你自己的答案。沒有自己的版本,就沒有判斷 AI 好壞的基準。
每一段 AI 產出都要能回答「這句話的證據在哪裡」。回答不了就不要用。
把有效的流程寫成指令檔或 skill。下一次不必重講,而且會愈用愈準。
每隔一段時間刻意不用 AI 做一次完整流程,確認你的判斷力還在。
單點的 AI 沒有複利,整條工作流才有。先看見全貌,才知道每一支 skill 要插在哪裡。
從模糊興趣收斂成可回答的問題
找到該讀的那批,不是最多的那批
讀懂並歸檔成可複用的筆記
選定取徑並自我檢查說服力
實驗、訪談、問卷、檔案
跑出結果並確認可複現
把發現變成可被審查的論述
被審、回應、修改、再投
第 8 節點不是終點。投稿過程中被 reviewer 逼出來的問題,往往就是下一輪的第 1 節點。
接下來每兩個節點講一頁。先看一次全貌,你就知道自己現在站在哪一格。
AI 適合做:把模糊主題展開成候選問題、找出領域缺口、逼你把選擇標準說清楚。
AI 不適合做:替你決定要做哪一題。那牽涉你的興趣、資源與生涯規劃。
對應 Skill:paper-graph research-ideation
AI 適合做:關鍵字消歧、citation traversal、SOTA 盤點、分層快篩。
AI 不適合做:憑記憶生成書目。每一筆都要回資料庫驗證。
對應 Skill:paper-navigator
AI 適合做:重建作者的論證邏輯、標記證據強度、產出格式一致的筆記與比較矩陣。
AI 不適合做:替你判斷這篇跟你的題目有沒有關係。
對應 Skill:deeppapernote research-survey
AI 適合做:用領域演化圖譜確認你的方法接在哪一條路線的下一棒,以及研究設計的自我檢查。
AI 不適合做:選定取徑。質性或量化、個案或紮根,這是你的立場。
對應 Skill:paper-graph experiment-craft
節點 4 是整條流程裡現成工具最少的一格。paper-graph 幫你定位,但方法的說服力要靠第九章的框架自己撐。
AI 適合做:資料清理腳本、格式轉換、結構化的實驗日誌。
AI 不適合做:接觸原始個資。這一格有紅線,見第一章。
對應 Skill:experiment-craft
AI 適合做:復現 baseline、超參調校、消融實驗的規劃與除錯。
AI 不適合做:下因果宣稱。相關不等於因果,這句話 AI 常常忘記。
對應 Skill:experiment-pipeline experiment-iterative-coder
AI 適合做:寫作前的故事設計、逐節骨架、句級清理、降低 AI 味。
AI 不適合做:決定你的主張要收多窄。那是你對證據強度的判斷。
對應 Skill:paper-planning paper-writing sciwrite academic-humanizer
AI 適合做:投稿前的 reject-first 自審、審稿意見分類、逐點回應的結構。
AI 不適合做:代你寫「我們已補做實驗」這種你沒做的事。
對應 Skill:paper-review paper-rebuttal
愈靠近「表達與探索」,AI 可以主導;
愈靠近「判斷與立場」,你要主導。
要問「這件事屬於表達,還是屬於判斷」。
自動化到判斷那一格就該停,那是你的價值所在。
先看你卡在哪一個節點,只學那一格的。
這一章決定後面每一支 skill 跑不跑得起來。環境沒選對,方法論再好也落不了地。
這是最容易混淆的地方。你會遇到的其實是三個不同的東西。
| 名稱 | 實際是什麼 | 跑在哪裡 |
|---|---|---|
| Claude 桌面 App 的 Code 分頁 | Claude Code 的圖形介面 | 你的本機 |
Claude Code on Webclaude.ai/code | Claude Code 的雲端版 | Anthropic 管理的沙箱 VM |
瀏覽器版 claude.ai 對話 | 不是 Claude Code,是聊天介面 | 雲端 |
多數人說「Claude Code 的 App 版」時指的是第一個。它就是 Claude Code,只是把終端機換成了圖形介面。所以「不想碰終端機」跟「不能用 Claude Code」是兩回事。
| 能力 | 桌面 App Code 分頁 | Claude Code on Web | 瀏覽器版 claude.ai |
|---|---|---|---|
| Skills | 支援,本機路徑 | 需先進 git repo | 可上傳,限規格內欄位 |
| MCP server | 支援,含本機 stdio | 僅遠端 HTTP | 僅遠端 Connectors |
| 本機檔案系統 | 完全存取 | 不支援 | 不支援 |
| 執行 shell 指令 | 支援 | 支援,沙箱內 | 不支援 |
| 讀你桌面的 PDF | 可以 | 不可以 | 需逐檔上傳 |
| 寫檔進 Obsidian vault | 可以 | 不可以 | 不可以 |
| 流程段落 | 桌面 App | Code on Web | 瀏覽器版 |
|---|---|---|---|
| 安裝 14 支 skill | 可 | 需先 commit | 需檢查欄位 |
| paper-navigator 找論文、research-survey 綜整、paper-planning 與 paper-writing、sciwrite 與 academic-humanizer、paper-review 與 paper-rebuttal | 可 | 可 | 可 |
| deeppapernote 深讀 | 可 | 部分 | 需手動搬 |
| experiment-iterative-coder 跑測試 | 可 | 沙箱內 | 受限 |
| Zotero MCP 讀文獻庫 | 可 | 不可 | 不可 |
| PaperBrain 全套 | 可 | 不可 | 不可 |
| 產出寫進本機 Obsidian | 可 | 不可 | 不可 |
你的產出需不需要變成你電腦裡的檔案?
需要,就用本機環境。
只是要一段文字回覆,瀏覽器版就夠。
還有一條反向理由支持留在本機:第一章講過,原始逐字稿與受試者資料不要進雲端 AI。做質性研究的人,更該用本機環境。
Agent Skills 是開放標準。claude.ai、Claude Code、Agent SDK 與 Developer Platform 共用同一套 SKILL.md 格式。
claude.ai 上傳與 Skills API 只接受六個欄位:name、description、license、compatibility、metadata、allowed-tools。
invocation control、subagent 執行,以及動態 context 注入。這些欄位帶到 claude.ai 會直接硬錯,不是被忽略。
實務上的一個坑:academic-humanizer 有一個 top-level 的 version: 欄位,不在允許的六個欄位內。要上傳到 claude.ai 得先刪掉那一行,或改放進 metadata 底下。其餘 13 支都在允許範圍內。
claude.aigithub.comnpmjs.com帳號與權限這兩關卡住的話,現場也救不了,因為多半跟付款、驗證信或公司資安政策有關。務必事前確認。
| 需要額外準備的 | 裝什麼 |
|---|---|
paper-navigator | httpx;S2 金鑰選用 |
paper-graph | httpx、python-dotenv;S2 金鑰必填 |
deeppapernote | PyMuPDF |
experiment-iterative-coder | ruff、pytest |
| 其餘 10 支 | 純提示詞,開箱即用 |
Node 20 是給第十一章的 PaperBrain 驗證程式用的。若你不打算用 PaperBrain,這一項可以跳過。
S2_API_KEYpaper-graph 的程式碼裡寫死了 REQUIRED_ENV_VARS = ("S2_API_KEY",),沒有金鑰會直接失敗。
paper-navigator 也吃這個變數,但它是選用的,沒有一樣跑得動,只是速率限制較嚴。
課堂當場申請不一定當場拿得到。Semantic Scholar 的金鑰要人工審核、以 email 寄送,新金鑰起始額度只有 1 RPS。建議提早幾天申請。
沒有程式,沒有編譯,就是 markdown。這也是它能跨環境搬的根本原因。
安裝或更新 skill 之後必須重開,它才會重新載入 metadata。這一行字,省下最多的「我是不是裝失敗了」。
它就是 Claude Code 的圖形介面,本機能力完整,課堂做的事一件都不會少。
方法論類 skill 都能用,但 Zotero MCP、PaperBrain、寫檔進 Obsidian 這三塊做不到。
這不只是方便的問題,是受試者資料不該進雲端的倫理問題。
環境選好了,接下來四章講的十四支 skill 才跑得起來。第十一章會再回到環境,講怎麼把它們整套搬到 Codex。
三支 skill 分別對應「找」「讀」「整」。多數人卡的不是找不到,是讀完之後沒留下能複用的東西。
最常見的錯誤是比例顛倒:對每一篇都做深讀,讀到第八篇就放棄了。先分層,再決定誰值得三十分鐘。
你丟一個主題或一篇論文,它先判斷你到底要什麼,再去 Semantic Scholar 與 arXiv 撒網、沿引用網往前往後爬,最後照你自己寫下的評分表把論文排序。
Apache-2.0。背後有論文:EvoScientist, arXiv:2603.08127。repo 436 stars。
這是 11 支裡版本落差最大的一支,而且上游把評分制度整個換掉了。見本節最後一頁。
SKILL.md 原文:no LLM-as-judge is called. You author the rubric, you triage each paper, you sort.
Quote-or-zero. When you claim a paper meets a criterion, quote a ≤80-char span from its abstract / tldr / snippet. No quote → that criterion scores 0. SKILL.md「Five Red Lines」第 5 條
這是文獻檢索最常見的幻覺型態。它不是編出不存在的論文,而是對真實論文做出沒有根據的判斷。
SKILL.md 原文:Over-collecting a broad pool and dumping it unranked is the dominant failure mode on survey-style queries.整套強制檢查清單就是為此而加。
| 分支 | 你的訊號 | 節奏 | 產出 |
|---|---|---|---|
| POINT | 給了引號標題、URL、arXiv/DOI/PMID,或說「讀這篇」 | 1 次呼叫 | 一張 Paper Card |
| LIST 預設 | 「找 X 主題的論文」「有沒有一篇論文做過 Y」 | 2 輪,必要時加 1 輪 | 附逐條件證據的短名單 |
| ITERATIVE | 「survey of X」「30 篇以上的 Y」,或被其他 skill 呼叫 | 最多 3 輪,廣度優先 | 排序表 |
SKILL.md 明文 Default to LIST when unsure. 另外提醒:LIST 查詢不要加 survey 或 review 這種字眼,會把你真正想要的原創論文擠下去。
這是整支最不一樣的地方。它不會替你決定什麼叫相關,它逼你先寫清楚。
三條規則:準則必須原子且互不重疊;每個專有名詞都要在某一輪查詢裡逐字出現;同一輪的兩條查詢不得共用同一個 angle tag。
| 級別 | 條件 | 要不要附引句 |
|---|---|---|
| PERFECT | 每條高權重準則都 ✓,任何一條都沒有 ✗ | 每條準則各一句 80 字內引句 |
| GOOD | 每條高權重(w ≥ 0.3)至少 ~,高權重無 ✗ | 每條 ✓ 準則各一句引句 |
| WEAK | 有一條高權重 ✗,或只命中低權重 | 不需要 |
| IRREL | 完全沒命中高權重,或踩到排除條件 | 後續輪次直接剔除 |
飽和關卡是機械式的。SKILL.md 原文:The gate is mechanical — do not skip rounds because "the results look right". 第一輪跑完有 1 個以上 PERFECT 才准停;0 個 PERFECT 但有 2 個以上 GOOD 就進第二輪;兩者都沒有,代表你的評分表可能訂錯了。
沒有摘要就標 ~,明文 do not infer from training data。不准用訓練記憶補。
我會為每一次探索留下一份「查詢紀錄」:查了什麼詞、用了什麼條件、排除了什麼、為什麼。這份紀錄本身就是 Method 段的初稿。過程留下來,論文就寫了三分之一。
deeppapernotepaper-writingresearch-ideationresearch-survey它是文獻線的入口,意思是其他兩支的輸入應該來自它,而不是各自去搜一輪。一致的入口,才有一致的紀錄。
Python 套件 httpx 與 deepxiv-sdk。S2_API_KEY 選用,沒有的話引用網分析會停用。
Semantic Scholar 無金鑰約每 3 秒 1 次且禁平行,有金鑰 100 次/分鐘可平行。
| 項目 | 3.3.0(多數人手上的版本) | 3.4.0(上游最新) |
|---|---|---|
| 評分制度 | 權重加總 1.0,算 weighted_total | 改成 core/secondary 標記,明文 no weights, no math |
| 分類級別 | 四級 PERFECT/GOOD/WEAK/IRREL | 三級 All-core/Partial/Irrelevant |
| 時效判斷 | 無 | 查詢出現「最新/近期/SOTA」就自動設近兩年 |
| 輸出模式 | 單一格式 | 分 Structured(給下游 skill)與 Narrative(給人看) |
| 查詢長度 | 4 到 7 字 | 3 到 6 字 |
為什麼要講這一頁:這正是第一章那個判斷標準的實例 —— skill 會演化,所以你要看的是它的設計理念,不是背它的操作步驟。作者把整套評分數學拿掉,理由是連言型查詢不能靠兩篇各滿足一半來蒙混。理念沒變,實作換了。
它自稱是「一個由 LLM 維護的學術 wiki 的單篇論文入庫層」。Obsidian 是那些頁面生長的地方,這一支負責讓一篇論文可靠地進入 wiki。
MIT 授權。1042 stars。三支獨立 skill 裡最活躍的一支,有 CI、有 24 支測試、有筆記品質評分表。
v2.3.0 的主題正是「完整英文筆記支援」。若你手上是 v2.0.0,中文輸出偏簡體不是偏好問題,是版本問題。
上游把 SKILL.md 從 repo 根搬到 skills/deeppapernote/,目錄佈局變了。要重跑 npx skills add 917Dhj/DeepPaperNote。
You sit down to study an important paper. The hard part is not reading it — it is turning what you understood into a note you can still use later. README 開篇第一句
在 PDF、Zotero、網頁與筆記軟體之間切換;手動整理書目、摘要、圖表與方法骨幹;理解了一部分,然後花更久把它變成連貫的筆記。
成品要是「一篇論文的深讀筆記」不是摘要改寫;方法、結果、圖表、限制要被解釋而不只是列出;來源不夠好就停下來要更好的材料,不准假裝筆記完整。
never finish from title/abstract/headings alone。不准只看標題摘要就交稿。
抽出來的原始段落檔才是正典閱讀材料,不是網頁摘要。
拿不到足夠證據就停下來要更好的來源,不產降級成品。
scripts structure evidence, but the model must decide emphasis, contribution, mechanism, limitations。腳本整理證據,判斷仍歸模型,而模型的判斷要給你看。
先規劃圖表佔位,只有身分比對與視覺可用性兩者都強才換成真圖。
它有一整段規定 AI 不准亂講「做完了」。這是我看過寫得最好的一份反唬爛條款。
還有一條全域規則:do not treat slowness, inconvenience, or temporary uncertainty as permission to bypass a required stage.不准因為慢、麻煩或一時不確定,就跳過必要階段。
把這一段抄進你自己的指令檔,你會發現 AI 唬爛你的次數大幅下降。這跟論文無關,跟你怎麼跟 AI 工作有關。
核心資訊/原文摘要翻譯/創新點/一句話總結/研究問題/資料與任務定義/方法主線/關鍵結果/深度分析/限制/我的筆記/引用。
方法類論文另有「機制流程」小節,要寫成 3 到 4 步,每步含輸入、操作、輸出去向。
圖表佔位有固定語法,三個欄位必填。不是 [FIG 1] 這種簡寫。SKILL.md 甚至明文說 [FIGURE_PLACEHOLDER] 那種寫法是內部遺留格式,不可出現在最終筆記。
要口試回答的、要當方法藍本的、要反覆引用的核心文獻。
成本高:17 個階段每階段都有關卡與檢查,一篇跑完的時間與費用遠高於一般摘要工具。所以更要挑。
Python ≥ 3.10 與 PyMuPDF。一般數位 PDF 不需要金鑰。Zotero 整合與 OCR 是選配。
本機 PDF → 本機 Zotero 項目 → DOI 與出版社書目 → arXiv 或開放取用 → Semantic Scholar 或 OpenAlex 補書目。
中文觸發語也可以:「給這篇論文生成深度筆記」「把這篇文章整理成 obsidian 筆記」。
每一份深讀筆記,前言都寫一段「我為什麼讀這篇」。前言就是精讀決策日誌。不寫這段,三個月後你會忘記當初為什麼讀,那份筆記就等於沒有。
它不是把三十篇摘要串起來。六個階段是一條有次序的管線,每一階段的輸出是下一階段的輸入。
SKILL.md 原文:Cluster papers by technical mechanism, not chronology. This is the defining characteristic of a survey vs. a summary.依機制分群,不依年代排列。這就是綜述與摘要的分界。
每一個方法都要分析:為什麼有效、做了什麼取捨、在哪裡會失敗。原文說這一條把「綜述級寫作」和「淺層摘要」分開。
先辨識領域慣例,再產帶指示的藍圖
用最相關的 top-30 篇寫完整草稿
用全部文獻逐節展開,這步才長出深度
每節收斂成 150 到 300 字
用節摘要重寫摘要、引言、結論
依大綱順序合併並產書目
為什麼第一階段要先分兩相?SKILL.md 原文:Different fields have different survey conventions — a clinical systematic review looks nothing like a CS methods survey.醫學要 PRISMA 流程圖,材料要結構與性質關係,人類受試研究要倫理章節。先定領域,再產大綱。
| 章節類型 | 目標長度 |
|---|---|
| Methods(每個典範章) | 6000 字以上 |
| Evaluation | 3500 字以上 |
| Challenges | 3000 字以上 |
| Applications | 3000 字以上 |
| Problem Definition | 2000 字以上 |
| 其他 | 2500 字(預設) |
零相依。它不跑腳本、不用金鑰。真正的前置是 paper-navigator 要先把論文找齊。
| 維度 | research-survey | 論文的 Related Work |
|---|---|---|
| 篇幅 | 20 到 40 頁 | 2 到 4 頁 |
| 讀者 | 整個領域 | 這一篇的 reviewer |
| 目的 | 建立領域全貌 | 標定你要對話的那一組 |
| 修改週期 | 不進 revision 循環 | 會跟 Introduction 與 Method 一起改 |
| 寫作時機 | 研究早期,或獨立發表 | 論文成形之後 |
寫 survey 比寫論文簡單,但複利更長。一篇好的綜述,會在你之後的每一篇論文裡被自己引用,也會被別人引用。它是研究生涯裡投報率最高的一種寫作。
散在信箱、雲端與下載資料夾的筆記,等於沒有。
citekey、year、status、sourceStatus。欄位一致,才跨篇比得起來。
不論你用 Obsidian、Notion 或純資料夾,重點是有一條固定的歸檔路徑。
找到與讀懂都只是當下的事。
一致的歸檔,才是三年後還在替你工作的那部分。
順序很重要。先用 paper-graph 定位缺口,再用 research-ideation 生候選題。反過來就是空想。
把一個主題畫成「挑戰 → 解法 → 論文」的世代演化圖。輸出是一份可以直接貼進 GitHub 或 Obsidian 的 Markdown,裡面嵌 Mermaid 圖。
11 支裡唯一還在 0.x 的一支。功能完整但仍在演進,用之前記得看一下有沒有新版。
SKILL.md 原文:Mermaid is just text inside fences — the file renders directly in GitHub, Obsidian, VS Code.不需要任何渲染服務。
S2_API_KEY 必填這是 14 支裡唯一硬性要求金鑰的一支。缺了會明確報錯,不會靜默降級。
No outbound LLM dependency: the skill exposes data fetchers, prompt templates, parsers, and renderers. The host agent is the LLM provider. SKILL.md「Design notes」第一條
它提供的是資料抓取、提示詞模板、解析器與繪圖器。實際去問 AI 的,是你正在用的那個 agent,用你自己的模型與額度。
原文:Failure mode preference: loud over silent.缺金鑰、輸出格式壞掉、搜尋回零篇,一律中止並印出原因,不產出一個看起來完整但其實有問題的成品。
CORE核心文獻。只有這一層會進入分類法,成為圖上的節點。
ADJACENT相鄰但非核心。保留在圖上供參考,不進分類。
REJECT判定不相關,而且會告訴你為什麼被排除。
它連自己的分類失敗都想好了:分類驗證失敗時會套用「全部當 CORE」的安全網,並在輸出加上 (FALLBACK: 原因) 後綴。看到這個後綴就重問一次;第二次還是 fallback 就接受並繼續。這是「大聲壞掉」的具體實作。
分群規則也很嚴:每個解法目標 2 到 5 篇論文。只有 1 篇會破壞下游比較,6 篇以上代表分得太寬,兩種情況都要重新平衡分類法。
圖上每一條「A 演化自 B」的連線,都要單獨問一次 AI,並標上證據等級。
SUPPORTED_BY_ABSTRACT摘要裡就找得到證據
SUPPORTED_BY_SECTION內文某一節有證據
INFERRED只是合理推論,沒有直接證據
REJECT找不到支持,不採用
看圖先看標記。INFERRED 只是合理推論,不是事實。把它當事實寫進論文,就是在幫 AI 的猜測背書。解析失敗時預設判 INFERRED,原文說明是the edge survives rendering but is visibly marked —— 線還在,但看得出來它可疑。
另有一條反幻覺規則很值得學:它明文允許「所有論文都是獨立的、沒有演化鏈」這個結果。原文:A flat list of independent papers is perfectly expected and preferred over a forced, fabricated chain.寧可圖不好看,也不要編一條假的演化線。
light 或 dark,預設 light相依:httpx、python-dotenv、deepxiv-sdk。不需要任何 AI 供應商的金鑰,因為 AI 呼叫由你正在用的 agent 負責。
那個 EvoScientist/skills/paper-graph/ 前綴,在你實際的安裝位置根本不存在,所以會 file not found。裝完先檢查這一點。
SKILL.md 明文要求用相對於當前目錄的路徑,例如 ./<name>.work/,不要用 /tmp/...。
原因原文:some harnesses sandbox the shell and the file-read tools to different filesystem roots。有些環境的 shell 與檔案讀取工具被關在不同的根目錄,絕對路徑會出現「shell 寫得進去、但讀不到」的怪現象。
paper-navigatordeeppapernoteresearch-survey上游 description 講得更精準:不要用在「要某類東西的清單」這種查詢上。
這張圖不是拿來背,是拿來問
「我要接在哪一條演化路線的下一棒」。
第 4 步是關鍵。那些「還沒被解決的挑戰」就是下一支 skill 的輸入。兩支工具的核心資料結構在這裡接上。
把「我知道大方向但想不出具體題目」變成一條有淘汰機制的流程。九個步驟,從讀文獻到產出一份可送出的 proposal。
SKILL.md 原文:Do NOT generate ideas without real paper grounding. The tree must reference actual papers with titles, authors, and findings. Paper search MUST go through paper-navigator — never use WebSearch/WebFetch as a shortcut.
一般搜尋看不到 Semantic Scholar 的引用結構與學術推薦系統,撈回來的東西沒有辦法建立世代關係。
Problem selection > solution design。決定「要解什麼」比決定「怎麼解」重要。
If a well-established solution exists, switch problems。改進空間太小,不值得投入。
Generate many candidates before evaluating any。生的時候不要評,評的時候不要生。
The tournament finds surprises. Trust rankings over gut feeling.相信排名勝過相信直覺。
拿到 30 到 50 篇文獻之後,先不要急著生 idea。從每篇抽出「它解決的挑戰」與「它用的關鍵洞見」,再做多對多映射。
unsolved problem。這一格通常就是缺口所在,值得優先看。
cross-domain transfer opportunity。別的領域的解法搬過來可能就成立。
已經被做爛。原文 avoid unless you have a fundamentally new angle,除非你有根本上新的角度,否則不要進去。
這一步花的時間會在錦標賽階段全部賺回來。沒有對照樹的候選 idea,多半只是把已知說法換句話講。
看新穎與創造力。高風險高報酬,往沒人做過的方向推。
看可行性。問「這在你的資源下真的做得完嗎」。
看科學價值。問「這真的推進了理解嗎,還是只是換個資料集」。
一條防退化的硬規則:If evaluation says the approach is a dead-end, the persona MUST pivot — refinement is not restricted to patching.評估說這條路走不通,人格必須轉向,不准只打補丁。
為什麼 K 取 32?文件原文說這是新手的標準值,一場比賽最多移動 32 分。對 15 到 21 個候選跑 4 到 5 輪,足以拉開差距又不會失穩。
| 分差 | 高分方勝率 |
|---|---|
| 0 | 50% |
| 100 | 64% |
| 200 | 76% 明顯較強但非壓倒 |
| 400 | 91% |
Novelty/Feasibility/Relevance/Clarity,各 1 到 10 分。
9-10 分是提出文獻中未見的根本新路徑;5-6 分是把已知技術套到新場景並有實質調整。
欄位固定:Rank/Title/Core Mechanism/Novelty/Feasibility/Relevance/Clarity/ELO。
含 Core Idea、Validation Plan,以及 Refinement Summary:改了什麼、為什麼、哪個人格帶來最大改動。
選定之後才展開成完整 proposal。這是流程裡的人工關卡。
SKILL.md 特別標注 Part 2 是強制的:do NOT skip the full refined ideas or collapse them into the comparison table.不准把精煉版縮成表格裡的一格。理由很實際:你要看的是它怎麼從第一版變成第三版,那才是你學得到的東西。
paper-planningpaper-navigatorresearch-survey相依很輕:它自己沒有腳本,全部借 paper-navigator 的。所以只要 paper-navigator 裝好了,它就能用。
注意第 2 步:文獻是你指定的,不是它現去搜的。這樣才能確保生出來的 idea 是站在你已經讀過的東西上面。
在「學術寫作與 AI 輔助」這個領域畫出演化圖譜。
發現一條線斷在半路:非母語教師使用 AI 潤稿之後,authorial voice 被稀釋這個現象有人提出,但沒有人做實證。
不是問「給我幾個題目」,而是「針對這個已定位的缺口,用三人格生候選並跑 ELO」。文獻已經墊在底下了。
你帶去的不是三個想法,是三個想法加上淘汰掉的六個,以及每一個的取捨理由。這是完全不同層級的討論。
文獻不墊底,idea 就是空想;
只看冠軍,你學不到淘汰的理由。
做質性研究的人請不要跳過這一章。三支的訓練框架是通用的,換一個載體,心法不變。每一支都會給你質性版的對映。
實驗跑不動的時候用的。它不叫你多跑實驗,它叫你先找到失敗的那一個原子原因。
SKILL.md 原文:1. Slow progress: Running random experiments without understanding failure causes. 2. Wasted time: Abandoning good approaches because activation tricks were missed.
第二種特別可惜:好方法被丟掉,只因為漏了某個啟用技巧。
原文:The goal is not to run more experiments. The goal is to run the RIGHT experiments — ones that isolate causes and test specific hypotheses.
零相依。沒有腳本、沒有套件、沒有金鑰。只有一份方法論文件與一份日誌範本。
看實際輸出,不是只看彙總指標。判斷失敗是系統性的還是隨機的。
兩條路:簡化任務,或把你的改動一項項拿掉。原文承諾 There is always a simple enough version that works.
原文:The more atomic the identified cause, the more useful the diagnosis.與 This step isolates the cause. Without it, you're guessing.沒有這一步,你就只是在猜。
列出所有可能解釋,依可能性排序,設計針對性實驗逐一排除。明文 don't rely on intuition alone。
修法要對準確認的原因,不是對準表面症狀。修完要回頭確認原本會動的案例還會動。
改兩件事成功了你不知道是哪件救的,失敗了你不知道是哪件錯的。單變數每次比較慢,整體比較快。
一個設計良好的診斷實驗,抵十次隨機嘗試。
它們需要特定的啟用技巧(學習率排程、初始化方式、前處理步驟)。別因為一次失敗就丟掉一個技術。
關鍵實作細節常埋在補充材料或程式碼裡,那些技巧就是能不能運作的分水嶺。
Once you've ruled out the impossible, whatever remains must be true. 第 5 條。系統性排除勝過直覺
| 欄位 | 要記什麼 |
|---|---|
| Purpose | 為什麼跑這個實驗,你預期學到什麼 |
| Setting | 資料、演算法改動、超參,所有能重現它的東西 |
| Results | 量化指標 + 質性觀察 + 具體的好案例與壞案例 |
| Analysis | 結果符合預期嗎,不符合就列出依可能性排序的假設原因 |
| Next Steps | 依分析決定下一步。你是專案負責人。 |
SKILL.md 特別點名第五欄:Don't wait for someone to tell you what to do next. Analyze your results and propose the next experiment yourself. This is what distinguishes a researcher from a technician.不要等別人告訴你下一步。自己分析、自己提。這就是研究者與技術員的差別。
不要急著再編一批。跑五步診斷,只是把五個候選原因換成質性版本。
類目定義夠明確嗎,有沒有模稜兩可的措辭
兩位編碼者受過同一套訓練嗎,有共同校準過嗎
試編樣本偏向某一類,導致某些類目沒被練到嗎
類目之間互斥,還是本來就會重疊
用 Cohen's kappa 還是 Krippendorff's alpha,選得對嗎
質性與量化都在做同一件事:找到 WHY。
第 3 步是關鍵。不是把五個原因全查一遍,是先查「便宜又能排除最多可能性」的那一個。這就是診斷與亂試的差別。
把「跑實驗」變成四道有預算、有關卡的工序。過不了關不准往下。
SKILL.md 原文:Most researchers jump straight to testing their novel method without verifying their baseline setup, then wonder why results don't make sense. Others spend weeks tuning hyperparameters without a budget, hoping the next run will work.
四階段管線同時解決這兩件事:強制順序(每一階段驗證下一階段所依賴的假設),加上嘗試預算(逼你系統性思考,而不是暴力迭代)。
主指標落在論文報告值的 2% 內
找到穩定設定,3 次不同 seed 的變異 < 5%
主指標勝過調校後的 baseline,且 3 次都一致
每一條宣稱的貢獻都有對照實驗支撐
注意這是預設值,可以覆寫。很多教學範例會寫成 5/8/6/3,那是使用者自訂的小預算,不是 skill 的預設。預設之所以這麼大,是因為 baseline 本來就難搞:論文細節缺漏、版本不合、未報告的前處理步驟。
調參的優先順序也寫死了:Learning rate → batch size → loss weights → regularization → architecture-specific params,反映的是典型敏感度。
When you know you have 12 attempts, you design each one to maximize information. Without limits, attempt #47 is rarely more informative than attempt #12 — it's just more desperate. 規則 2。第 47 次嘗試很少比第 12 次更有資訊,只是更絕望
跳過階段 1,階段 3 的結果可能因為 baseline 壞掉而全錯。跳過階段 2,你的改進可能只是調參調得比較好。沒有捷徑。
每一次失敗都縮小了搜尋空間,也揭露了問題的某個面向。
預算沒用完就停,代表你判斷出繼續下去邊際效益已經很低。
規則 1 那句最值得背:Most "method doesn't work" bugs are actually baseline setup bugs.多數的「我的方法沒用」,其實是 baseline 沒架好。
逐一移除各元件,顯示每個元件的邊際貢獻。這是最常見的做法。
從 baseline 出發逐一加元件,顯示增量收益。可以看出元件之間有沒有互相依賴。
把你的元件換成替代方案。證明你的元件比替代品好,而不只是比「沒有」好。這一種最能擋審稿人的攻擊。
為什麼消融這麼重要:SKILL.md 原文 A method that outperforms the baseline but has no ablation is a method you don't understand. Reviewers know this.勝過 baseline 但沒有消融的方法,是一個你自己也不理解的方法。而審稿人知道這件事。
還要檢查一件事:確認沒有任何單一元件被移除後結果反而變好。那會直接推翻你的宣稱。
關卡條件換成 inter-rater agreement 或飽和度指標。預算的概念完全一樣:先講好編幾輪,用完就停下來檢討。
這則指令裡的 5/8/6/3 就是覆寫預設值的寫法。你可以依自己的計算資源調整。
它不追求第一次就寫對。它在 plan → code → evaluate → refine 的圈裡跑檢查,用一個帶硬上限的複合分數決定要不要再跑一輪。
原文:A fast plan → code → evaluate → fix cycle beats spending 30 minutes on a "perfect" first implementation. The evaluate step reveals problems you cannot predict by thinking alone — lint errors, import failures, test regressions, and missing edge cases all surface immediately when you actually run the code.
光靠想是想不出來的,跑一次就全都浮出來。
自評有四項:正確性、完整性、錯誤處理、可讀性。
另有兩條扣分:明顯的邊界情況沒處理扣 0.1,寫死絕對路徑扣 0.05。
目標是 0.85 不是 1.0。原文:Don't gold-plate. Diminishing returns kick in hard above 0.9.
它明文禁止「重複上一輪已經失敗的做法」,並且列表告訴你該怎麼換路。
| 上一輪的失敗 | 這一輪該怎麼規劃 |
|---|---|
| 逾時 | 加 --quick 或 --smoke 模式、縮小資料量、加提早停止 |
| 語法錯誤 | 簡化邏輯,跑之前先用 ast.parse 驗一次 |
| 匯入錯誤 | 查 pip list,只用已安裝的套件,缺的加進需求檔 |
| 測試失敗 | 只針對那個失敗的測試做最小改動 |
| lint 失敗 | 先跑 ruff check --fix . && ruff format .,再動任何邏輯 |
| 自評分數低 | 回頭重讀原始需求,檢查是不是漏做了功能 |
迭代上限:每一相 3 次,全域 10 次。原文說明 If you cannot fix it in 3 targeted iterations, the problem is architectural, not incremental.三次修不好,代表是拆解方式錯了,不是細節錯了。
這是社科研究者最常遇到的資料整理工作,正好是這支的甜蜜點。你不需要會寫 Python,但你需要那段轉換是對的。
一個沒被測過的資料轉換函式,會讓後面所有統計結果都不可信。而你不會發現,因為它不會報錯,只會給你錯的數字。
任務前面加 MODE: MORE_EFFORT,或直接說「用迭代方式把品質做上去」。
ruff 與 pytest。缺哪一個就跳過該項檢查,不算失敗,但會記錄下來。
寫程式的品質,會回頭決定你資料分析的可信度。
experiment-craft 五步診斷experiment-pipeline 四階段加預算experiment-iterative-coderexperiment-craft 編碼一致性診斷experiment-pipeline pilot 到飽和度experiment-iterative-coder 資料整理為主這一章對純質性受眾的直接價值最低,但「先診斷再重跑」與「先講好預算」這兩個習慣,換到哪一種研究都成立。
四支 skill,順序不能亂。先規劃再寫,先清乾淨再上色。這是全套裡最多人會天天用到的一章。
多數人卡在寫不出來,其實是卡在沒規劃。這一支不產出任何一句論文正文,但它決定後面十小時順不順。
把故事線定下來
比較、消融、示範各要哪些
Pipeline figure 與 Teaser figure
四週倒數,含指導教授的截止日
零相依。它的 allowed-tools 連 execute 都沒有,不跑任何腳本。你需要的只是一小時,和誠實面對自己的稿。
先寫下這篇最可能被拒的五個理由,再回頭設計故事。順序反了,你會寫出一個自己很滿意但擋不住攻擊的敘事。
把主張收到你確定守得住的那個範圍,然後才開始擴充。
Design Evidence Before Design Language。先知道你要拿什麼撐,再決定怎麼說。
Buy Trust with Honest Weakness。主動講出一個限制,比被審稿人挖出來便宜太多。
如果 SOTA 提升不明顯,預先定好第二價值主張:效率、穩健性、假設更少、適用更廣。
| 要素 | 要回答的問題 | SKILL.md 的範例 |
|---|---|---|
| Task | 這篇論文處理什麼問題 | Real-time 3D scene reconstruction |
| Challenge | 為什麼現有方法解不好 | Cannot handle dynamic objects efficiently |
| Insight | 什麼關鍵觀察驅動你的做法 | Motion patterns are temporally sparse |
| Contribution | 你提出什麼 | Sparse temporal attention for dynamic regions |
| Advantage | 為什麼你的做法比較好 | Reduces computation while preserving quality |
起手式是先畫 pipeline figure 草圖。SKILL.md 原文:Draw it before writing anything. It reveals whether the method is clear enough to explain.畫不出來,代表你還沒想清楚。它同時也會告訴你哪些模組是新的、哪些是標準元件,以及 Method 節該怎麼分小節。
「我覺得這篇好像哪裡怪怪的」沒辦法行動。「reviewer 會說我的 baseline 過時」可以行動。
寫作前跑,用來排優先序;投稿前跑,用來做最後自審。第九章的 paper-review 會再用到同一招。
反直覺原則:narrow before broad,先窄後寬。大方向留給 discussion,主張要收到最窄。收得愈窄,愈難被打。
Pipeline figure 四原則:凸顯新穎而非只畫工作流;跟前作長得不一樣;整體管線若是標準的就放大新模組;把清晰度花在新的部分。
Teaser figure(通常是 Figure 1):放第一頁頂端、要一眼有說服力、要在 Introduction 引用它。
SKILL.md 強調 Visual polish directly influences review outcomes.
圖與文的分工是定死的:The pipeline figure is for highlighting novelty, not for making readers understand. The Method text is what makes readers understand.
定核心貢獻與模組動機;列比較實驗與消融研究;寫 Introduction 第一版草稿。
定案 pipeline figure 草圖;寫 Method 第一版(未定細節用 \todo{} 標)。
寫 Experiments、Abstract、Related Work 的第一版草稿。
修稿、精修 pipeline 與 teaser figure、跑 demo。
SKILL.md 的硬提醒:By the end of Week 3, you must send the Introduction and Method drafts to your advisor — otherwise the advisor likely will not have enough time to finish reviewing the paper.第三週結束前一定要把 Introduction 與 Method 交給指導教授,否則他不會有足夠時間看完。
| 產物 | 誰用 |
|---|---|
| Story summary(task → challenge → insight → contribution → advantage) | Introduction |
| Module Motivation Mapping table | Method 各子節 |
| Experiment plan(比較 + 消融 + 示範) | Experiments 節 |
| Pipeline figure sketch | Method 概覽與 Figure 2 |
| Claim-to-experiment mapping | Abstract、Introduction、Experiments |
| Fallback narrative | Introduction 或 Conclusion 轉向 |
| Rejection-risk table | 自審優先排序 |
該用:要開始寫一篇新論文、要設計故事與貢獻、要規劃實驗圖表時程、要寫預先拒稿信。
別用:已經在寫作中(paper-writing)、要跑實驗(experiment-pipeline)、要找題目(research-ideation)、要自審完稿(paper-review)。
它附 LaTeX 模板,但真正的價值在那個順序。多數人從 Introduction 開始寫,那是最難也最容易寫壞的一節。
原文:Underclaim in prose, overdeliver in evidence. Reduce adjective intensity in Abstract/Introduction; let tables and figures carry the strength.形容詞收斂,讓表格和圖去承擔力道。
Lead with mechanism, not only metric. Reviewers trust causal logic more than isolated gains.審稿人信因果邏輯,多過信孤立的數字提升。
前段把最熟的先寫掉,後段收斂。
實驗同時平行跑
實驗差不多了才寫
定案 pipeline,做 teaser
列相關論文、分主題、寫段落
用 paper-review
到這裡才寫
先列關鍵字,再組出資訊量高的標題
注意 Method 在第 3 步,Introduction 在第 4 步才修,Abstract 在第 9 步。從你最確定的那一節開始寫,故事才會愈寫愈清楚。而 Abstract 是全篇的壓縮,全篇還在變就寫摘要,等於壓縮一個還在動的東西。
一句話交代脈絡,不要從盤古開天。
只講一個核心限制,不要列清單。
「所以會怎樣」。沒有後果的限制,reviewer 不在乎。
你看到的那件事。這是全段的轉折點。
具體交付了什麼,用動詞開頭。一個明文反模式:不要寫成「先給天真做法,再給我們的改進」,那會讓你的工作看起來像微調。
資料結構、網路設計、前向流程。寫成「給定 X 輸入,第一步…、第二步…、輸出 Y」。
這個模組為什麼存在。用問題驅動句型:「A remaining challenge is...」。這一項最常被漏掉,也最常被審稿人抓。
這個模組為什麼有效。不是描述它做什麼,是解釋它為何管用。
結構是:先寫一段 Overview(設定 + 核心貢獻 + 章節路線圖),再一個模組一個子節。
Conclusion 裡的 Limitation 有明確定義,很多人寫錯:原文 Limitation = task goal / setting limitations (like future work), NOT technical defects,並附一條判斷標準 If our method does not fall below current SOTA metrics, it is not a technical defect。限制是任務目標與設定上的邊界,不是承認你的方法有缺陷。
摘要是全篇的壓縮。全篇還沒定稿就寫摘要,最後一定要重寫。
Introduction 要宣稱的貢獻,取決於 Method 實際做到什麼。方法還在動,引言就會一直改。
它不是文獻回顧,是戰場宣告。列愈多,reviewer 愈容易問「那你跟這篇比呢」。
Remove weak but flashy claims. Any claim without direct evidence should be deleted, even if it sounds impressive. 七條反直覺規則第 5 條。聽起來再漂亮,沒有直接證據就刪掉
還有一條很少人做但很有效:放一個代表性的失敗案例並附診斷。原文說 it signals competence, not weakness。
這是我加在自己那份 skill 裡的檢查,寫完 Conclusion 之後跑一次。
判斷標準很簡單:如果這三句你寫不乾淨,那 Conclusion 還沒好,而且你對自己這篇論文的理解可能也還沒好。寫得出來的話,這三句可以直接當結尾段,或當 Abstract 的最後一句。
\todo{} 標記都解決或移除原文:If any item is incomplete, finish writing before reviewing.
paper-planningpaper-reviewpaper-rebuttalsciwrite一句沒改的話,就是一個你不能捍衛的位置。
先講一個一定會卡住的地方:這支有四個名字,而且都不一樣。repo 叫 sciwrite;frontmatter 的 name 是 manuscript-writing-review;README 叫你放進 skills/manuscript-review/;多數人本機的目錄叫 sciwrite。系統以 frontmatter 為準,所以你要打的是 $manuscript-writing-review。14 支裡只有這一支不一致。
喬治華盛頓大學工程教授。825 stars。整個 repo 只有四個檔:README、SKILL.md、HOW-TO-USE、LICENSE。
純 Markdown,無腳本、無套件、無金鑰。README 原文 no dependencies on any specific platform。
四支獨立 skill 裡唯一一支。可商用、可改,但必須署名、附授權連結、註明是否修改過。
Self-editing for clarity is difficult because you already know what you meant to say. README。這是整個 repo 最好用的一句教學金句
原文:Clear writing is not a cosmetic concern in science; it determines whether reviewers and readers can follow your argument.清楚寫作不是化妝品,它決定審稿人跟不跟得上你的論證。
原文:Importantly, the skill does not alter scientific content, data, or technical claims. It improves how those claims are delivered.
Kristin Sainani 的《Writing in the Sciences》,30 支影片講座,以 CC-BY 授權釋出。這支 skill 是把那門課工程化。
every word must earn its place; every sentence must be stripped to its cleanest components.
Scientific transparency requires accountability. Identify who did what.不是文法偏好,是誰做了什麼要講清楚。
Provides a review of → Reviews。找出所有「名詞 + of」的結構,看有沒有現成動詞可用。
為了避免重複而把香蕉叫成「細長的黃色水果」,這在文學是修辭,在科學是災難。同一個東西從頭到尾用同一個詞。
上一道沒清乾淨,下一道就白做:先清累贅才輪得到句構。
三張對照表:15 條無用片語(Due to the fact that → Because)、5 條無用開場白、5 條冗詞(successful solutions → solutions)。
被動轉主動三步驟,加 9 條名詞化對照表。但明訂被動可接受的三種情況,並警告 Do NOT mechanically convert every passive sentence.
主詞與主要動詞相隔超過約 12 個字就標為 buried predicate;標點效率;同段句長全在 ±5 字內就標出來。
Banana Rule 的執行層。從 Methods 抽出所有關鍵詞,驗證 Results、Discussion、表格、圖說用字完全一致。
摘要的 N 對得上表 1 嗎、百分比對得上原始數嗎、有效位數一致嗎,加上傳話遊戲引用稽核。
DNA、RNA、CFD、FEM、PIV 這種。而且每個縮寫要在摘要、正文、以及每一張表與圖說各定義一次。
理由原文:readers do not read linearly。讀者不是從頭讀到尾的,他們會直接跳到表格。
把只透過二手綜述或教科書轉引的統計數字標出來,要你回去查原始文獻。
這是學術寫作裡最常見、也最少被抓到的錯誤來源:一個數字被引用三次之後,往往已經不是原本的意思了。
三級嚴重度:CRITICAL(實際誤導讀者,例如數字錯、術語不一致到暗示成另一個變項)、MAJOR(顯著損害清晰度)、MINOR(值得改但不妨礙理解)。
| 模式 | 你會怎麼說 | 它會做什麼 |
|---|---|---|
| full-review 預設 | 「review my manuscript」「全篇寫作審查」 | 對全文跑五道 pass,產出結構化報告 |
| section-review | 「review the Introduction」「檢查 Discussion」 | 對單一章節跑五道 pass |
| targeted | 「fix passive voice」「清掉累贅」 | 只跑相關的那一兩道 pass |
| interactive | 「walk me through improving this」 | 逐段帶你走,顯示改前改後與理由 |
常見的誤傳:很多整理會寫成「兩種模式:Full Review 與 Journal-Specific」。Journal-Specific 不是一種模式,它是 README 教你自己在 SKILL.md 裡加一節 ## Journal-Specific Conventions 的客製做法。要對特定期刊,直接在指令裡講就好。
你要為每個 idea 負責;
sciwrite 只為每個字負責。
README 提醒:它標出的「被悶死的動詞」,有時正是你領域的標準術語。用你的判斷。
README 有一整節「How This Skill Was Made」。這一段的價值,可能高於 skill 本身。
用 Perplexity 的 Comet 從 YouTube 播放清單一次抓齊 30 支影片網址並去掉追蹤參數。原文:In under a minute, the agent produced a clean list of all 30 URLs, a task that would have taken 15–20 minutes of tedious manual work.
把 30 個網址丟進 Google NotebookLM,產出一份 Writing Standards Manual。原文說它抓到了核心觀念,但格式是「人讀的指引」,不是「機器可執行的 skill 檔」。
用 Claude 內建的 skill 產生能力把手冊轉成 skill。作者說這一步 making the process meta in the best sense: an AI tool creating instructions for an AI tool.
作者的總結是:Three different AI tools, each doing what it does best.你也可以這樣做。把你領域的方法論、你指導教授講過的原則、你自己踩過的坑,用同一條路徑變成一支 skill。這才是這堂課真正想給你的東西。
我不會拿整篇跑。只挑三段:Abstract、Introduction 第一段、Conclusion 第一段。這三段決定審稿人的第一印象,也是投報率最高的三段。其餘的等定稿再說。
把 AI 協作產出的論文與計畫書稿,洗掉 AI 腔、對回作者本人的聲音、並強制每一個宣稱都掛到它的證據上。一個數字、一條結果、一筆引用都不動。
三支獨立 skill 裡最高。但注意:star 數不是判斷標準,這是第一章講過的。
純 SKILL.md 加範例。frontmatter 自己宣告 compatibility: claude-code codex morphmind opencode。
三支裡最靜態。但它是純規則文件,穩定不等於荒廢。這也是第一章的判斷標準六。
To calibrate it, we had the AI compare its own drafts with our team's accepted papers and funded proposals, and we went through the differences by hand. README「Why we built this」。拿 AI 的稿去比對自己團隊已錄取的論文與已獲補助的計畫書,再一條條人工檢查差異
原文:generic and verbose, with "In recent years..." openers, inflated phrasing, and over-long sentences. They also drift from the author's own voice and lose the precision scholarship depends on.
原文:Run one on a paper or an NSF proposal and it flattens the precision along with everything else. The careful wording academic writing depends on is the first thing to go.學術寫作賴以生存的謹慎措辭,會是第一個被抹平的東西。
作者還說了一句很誠實的話:The rules here reflect one group's voice. Fork the repo and adapt them to your own.這套規則反映的是某一個團隊的聲音,你應該 fork 它並改成你自己的。
誇大意義、假深度的 -ing 尾巴、宣傳性語言、無出處的模糊歸屬、AI 詞彙表(delve、underscore、tapestry、pivotal…)、填充語、破折號全部移除。
十一個編號子項:過強動詞、意義炒作、空洞強化詞、新穎性灌水、公式化開場、連接詞濫用、貢獻條列陳腔、引用傾倒、含糊避險、樣板強調、過長堆疊子句。
這一層是它跟一般 humanizer 的分水嶺。它規定哪些東西不准改。下一頁單獨講。
逐條檢查宣稱有沒有證據撐、動詞強度配不配得上證據。太強就降級。
讀你先前的論文,對上你的句子節奏、連接詞習慣、避險程度。同時對上場域語體。
NSF 與 NIH 專用。規則在這一層整組翻轉,見後兩頁。
常見的誤傳:很多整理把六層寫成「句子節奏/hedging/claim-evidence/術語校對/feasibility/vision」,那是錯的,而且把 Layer 3 整層漏掉了。
一般的 humanizer 沒有這一層,所以它們會把學術寫作的精準度一起抹掉。
保留 suggests、is consistent with、we hypothesize that、may indicate、appears to。
原文警告錯誤修法:把 the results suggest X 改成 the results prove X,這叫做製造過度宣稱(this manufactures over-claiming)。
唯一的例外是破折號:Layer 1 與 Layer 3 各聲明一次,破折號無條件全部移除,改用逗號、冒號、括號或拆句。
We prove that our method significantly outperforms all prior approaches.
三個問題:prove 是過強動詞;significantly 沒有檢定或數字支撐;all prior approaches 是無法驗證的全稱宣稱。
Our method improves held-out accuracy by 4–7 points over the strongest prior approach (Table 3); the gain is significant at p < 0.01 by a paired test.
動詞降級、給了範圍與比較對象、指明表格、附上檢定。
它偏好給範圍而不是給單一平均值(除非你說明了平均方法),而且比較時要先跟最強的競爭者比,不是先跟最弱的 baseline 比。
A proposal is not a paper. It is sold on vision plus feasibility, not on finished results. So in proposal mode, do not flatten the vision; enforce a different discipline instead: claim ↔ feasibility. Layer 6 開場。計畫書賣的是願景加可行性,不是完成的結果
long-term goal、pioneer、transformative、establish a foundation。在論文裡這些是 AI 腔。
前提是有可信的計畫與證據撐住。所以它換成檢查另一件事:你的野心,有沒有對應的可行性。
前三頁定生死:原文 A reviewer unconvinced by page 3 does not recover on page 10.審稿人在 NIH 第 1 頁結束前、NSF 約第 2 到 3 頁結束前,必須已經掌握五樣東西:hook、gap、central idea、aims、payoff。
「這個議題很重要」但說不出對誰重要、後果是什麼。
把 aim 寫成一個技術,而不是一個問題或一個結果。
Aim 2 與 3 在 Aim 1 失敗時全垮。審稿人會直接標記為脆弱。
野心很大但沒有初步資料、既有方法或合作者撐住。
Aims 頁的假說是可證偽的承諾,不是「我們將探索是否可能」。
一條明文禁令出現了兩次:Never invent preliminary results, prior funding, partners, or letters; if the support does not exist, flag the gap for the author rather than papering over it.不准編造初步結果、過往補助、合作夥伴或推薦信。沒有就標記出來給作者,不要糊過去。
它動的是語言層,不動內容層。數字被改動就是造假。
原文:For technical writing, neutral and precise is the human voice.對技術寫作而言,中性且精準就是人的聲音。
frontmatter 與正文都寫死了這一條。
Using it does not remove your obligation to disclose AI assistance: always follow the disclosure policy of the venue you submit to. README「Ethics and disclosure」。用了它,不會免除你揭露 AI 協助的義務
作者還說 it is not about gaming review, defeating detectors, or adding fake novelty。這跟第二章講的三條紅線完全一致。
| 維度 | sciwrite | academic-humanizer |
|---|---|---|
| 治的是什麼病 | 人類學術寫作的通病 | AI 協作特有的病灶 |
| 這些病幾歲 | 存在幾十年了 | 2012 年不可能存在 |
| 方法論來源 | Sainani 2012 年的課 | 比對自家已錄取論文與已獲補助計畫書 |
| 會不會對你的聲音 | 不會 | 會,讀你先前的論文去對 |
| 會不會查宣稱撐不撐得住 | 只查數字前後一致 | 會,動詞太強就降級 |
| 能不能處理計畫書 | 不能 | 能,Layer 6 專章 |
| 授權 | CC BY 4.0,散布要署名 | MIT |
先清乾淨,再上色。但兩支規則有直接牴觸:sciwrite 建議用破折號做強調插語,humanizer 要求破折號全刪。這種時候由你裁決,不是由工具裁決。
兩支接力。投出去之前用 paper-review 自審,收到意見之後用 paper-rebuttal 分類與回應。
它模擬的不是友善的同儕,是會拒稿的審稿人。這是刻意的:友善的意見改不動你。
它明文要求先滿足 paper-writing 的交接清單。原文:If any item is incomplete, finish writing before reviewing.
frontmatter 比其他支多一欄 type: [skill, expert],代表它可以被非同步派遣成一個獨立的審查者,而不只是被載入的說明書。
在家先被拒一次,比投出去被拒一次便宜太多。
在寫任何正面評語之前,先強迫自己寫一段拒稿摘要。用審稿人的語氣,寫這篇為什麼該被拒。
原文 remove it instead of defending it。找不到直接證據的那句話,刪掉比補一段辯解安全。
分數稍低但公平性與可複現性高的做法,審稿結果往往更好。不要為了衝分數犧牲可複現。
從附註搬到正文。原文 transparency can increase confidence。透明度反而提升信心,也堵住審稿人的第一發。
問一句:一個強博士生,一個下午想得出來嗎?想得出來就再往下挖,或把新穎性宣稱收窄講精確。
"The paper does not provide readers with new knowledge."
失敗案例太常見嗎?技術已被廣泛研究嗎?改進是可預期的嗎?做法太直白嗎?
"Missing technical details, not reproducible."
讀者能只靠論文重現方法嗎?每個模組都解釋了「為什麼存在」而不只是「做什麼」嗎?
只比前人好一點點嗎?即使勝過 baseline,絕對品質對應用場景夠好嗎?
缺消融、缺重要 baseline、缺評估指標、資料太簡單。原文說這是最常見的拒稿理由之一。
設定不切實際?有技術缺陷?需要逐場景調參?新模組的代價超過好處?
每一個主張問三題:事實正確嗎?有實驗或分析支撐嗎?支撐實驗有被清楚引用嗎?
原文警告:Some reviewers will reject a paper directly for unsupported claims.有些審稿人會直接因為「宣稱沒有支撐」而拒稿。
Introduction、Method、Experiments 各跑一次,通常十五分鐘就能抓出結構問題。
它另有兩份檢查表:圖 7 項(解析度、對色盲友善、有沒有在正文被引用)與表 7 項(caption 在上方、無直線、標出指標方向 ↑↓、caption 描述設定而非描述結果)。
Prebuttal Notes 是最值錢的一格。它把自審發現的攻擊點,直接寫成回應草稿。真的被攻擊時,你已經有一份打磨過的答案。
The goal is not to defend every point — it's to move scores by addressing the concerns that actually drive them. SKILL.md 第一句。目標不是逐條辯護,是移動分數
它的第一步不是動筆,是診斷。原文:Before writing a single word, answer: "Why did this reviewer give this exact score?" Not what they wrote — what drove the score. Most researchers skip this and address every comment equally. That is a mistake.
Your rebuttal's real audience is not the negative reviewer — it's the positive one. Your champion argues on your behalf in the AC discussion, often using your exact words. SKILL.md「The Champion Strategy」
「baseline 過時」真正在問的是:這方法現在還打得贏嗎。
回答那個沒說出口的問題,不是只回答表面的要求。
引導問句是固定的:"What would move this reviewer from their current score to acceptance?"什麼會把這個人從現在的分數推到接受?不是「他寫了什麼」,是「什麼驅動了那個分數」。
字數預算是這一支最實用的設計。多數人的 rebuttal 把 60% 篇幅花在最容易回的灰色小問題上,因為那寫起來最舒服。真正卡住分數的紅色部分反而草草帶過。
另一條:多位審稿人都提到的同一件事,幾乎肯定是真弱點。把它們整併成一個「共通回應」節,既省字數,也顯示你看懂了模式。
| 疑慮類型 | 回應策略 |
|---|---|
| 誤解 | 指出論文的具體位置澄清,並重述關鍵論點 |
| 缺實驗 | 可行就直接在 rebuttal 裡附上實驗;不可行就誠實說明限制 |
| 缺 baseline | 加上比較,或精確說明為什麼那個 baseline 不適用 |
| 寫作清晰度 | 承認,並在 rebuttal 裡直接給出修訂後的文字 |
| 根本性疑慮 | 用技術論證加上額外證據正面處理,兩者缺一不可 |
| 小問題 | 感謝審稿人,確認會修 |
一句話證明你讀懂了
證據、數據、新實驗
指出哪一節、哪張表
整封信的順序:先感謝全體 → 處理共通主題 → 再按紅橘灰逐條。不要照審稿人寫的順序回。
| 審稿人說 | 怎麼回 |
|---|---|
| Limited novelty | 講清楚那個具體洞見;展示前人做不到什麼;把宣稱收窄講精確 |
| Marginal improvement | 改打其他優勢(速度、泛化、簡潔);加更難的測試案例 |
| Missing ablations | 直接在 rebuttal 裡附上消融表 |
| Missing baselines | 加比較,或精確說明為何不適用 |
| Not reproducible | 補實作細節;承諾程式碼釋出並給明確時程 |
| Limited evaluation | 加資料集或指標;不可行就誠實說明資源限制 |
| No limitation discussed | 修訂版加限制節,承認這是疏忽 |
| Overclaimed results | 把宣稱弱化到與證據相符,並展示改後的措辭 |
| Unfair comparison | 改用標準評估協定;補上常被報告的 baseline |
| Engineering, not research | 指出設計背後的科學洞見,說明為何這個選擇並不顯然 |
| Metrics don't match claims | 把每個宣稱對到一個具體指標;可行就補上缺的指標 |
| Related work incomplete | 補上缺的引用,並說明它們與你的關係 |
就算拿到 3/8/8,那個 3 分也要認真回。負面審稿人在討論階段可能被判定為離群值,但前提是你交了 rebuttal。不交,AC 手上什麼都沒有。
承認一個小弱點,會讓你對大論點的辯護更可信。全面防守、零讓步,讀起來像不客觀。
原文:Reviewers are trained to be skeptical of arguments. They are not trained to be skeptical of data.審稿人被訓練成懷疑論證,但沒有被訓練成懷疑數據。
還有一條給未來的你:最好的 rebuttal 在投稿前就寫好了。那叫 prebuttal,兩個好處:你常會在寫的過程發現攻擊確實成立而先修好;真的被攻擊時你已經有打磨過的回應。這也是上一支 paper-review 的產物之一。
定稿前跑一次中立第三方測驗:找一個沒讀過你論文的人,只給他看審稿意見與你的回應,問他「你看得出這些疑慮被解決了嗎」。看不出來就重寫。
| reviewer 說 | 真正的問題 | 回去用哪一支 |
|---|---|---|
| Contribution unclear | 貢獻沒講清楚 | paper-review |
| Method not persuasive | 方法說服力不足 | experiment-craft |
| RQ too small/no gap | 題目太小或沒缺口 | paper-graph |
| Writing not sharp | 寫作不夠鋒利 | sciwrite + academic-humanizer |
| Novelty overclaimed | 新意宣稱過頭 | paper-review attack novelty |
被拒不是終點,是把你送回工作流上游的訊號。這張表的用途,是告訴你該回到哪一站。而如果同一個理由出現兩次,那就不是運氣問題了。
這一章跟前面五章不同。這裡講的四個是觀念框架,不是可以安裝的 skill,也不在那 14 支開源清單裡。它們處理的是判斷,而判斷沒有辦法外包。
接下來四個框架各是一條公式。公式的用途不是計算,是提醒你哪一項是零。任一項接近零,整體就接近零。
Good RQ = Gap × Importance × Audience
三軸缺一不可,任一軸接近零,整題就接近零。多數被拒不是寫得不好,是這三軸裡有一軸是空的。
| 軸 | 要回答的問題 | 典型反例 | 通過條件 |
|---|---|---|---|
| Gap 研究缺口 | Why is there a gap? | 「我想研究 X」 | 講得出現有研究沒解決什麼,以及為什麼到現在還沒解決 |
| Importance 重要性 | Why does it matter? | 「這個議題很重要」(沒下文) | 說得出對學術的意義與對實務的影響,且有具體後果 |
| Audience 對話對象 | Who cares? | 「對學術界有貢獻」 | 指得出具體的研究社群,以及他們現在正在爭論什麼 |
把你現在的研究問題寫下來,三軸各給自己一個評價。誠實一點,這張卡沒有別人會看。
不要三軸一起改。多數人的問題集中在一軸,通常是 Audience。
重寫之後三軸重新評一遍。如果補了 Gap 卻讓 Importance 掉下來,那是把問題搬家不是解決。
這張卡跟第六章的 paper-graph 是互補的:paper-graph 幫你看見缺口在哪,三軸評分卡幫你判斷那個缺口值不值得補。看得見不等於值得做。
Method 的價值 = 匹配問題 × 因果邏輯 × 增進研究價值
reviewer 看方法時不問「你用了多複雜的統計」,而是問三個問題。三題全 yes 才算過。
Method fits RQ。問題是描述性的卻用因果推論工具,或反過來,都會被抓。
Causal logic。跑出顯著不等於解釋了什麼。
Raise value。換一個更複雜的模型,如果結論一樣,那就沒有增值。
Method ≠ Complexity。用 SEM 不會讓一個描述性問題變成理論貢獻。方法的複雜度要由問題決定,不是由你想展示什麼決定。
理論貢獻 = 路徑(Extend/Integrate/Meta-theorize) × 機制(X → M → Y)
把既有理論推到新的脈絡、新的對象、新的邊界條件。門檻最低,但要說清楚為什麼這個延伸不是理所當然。
把兩個原本不對話的理論接起來。門檻中等,關鍵在說明為什麼它們該對話。
質疑既有理論的預設。門檻最高,需要很強的證據,但一旦成立影響也最大。
任何一篇研究都該能回答兩題:你走的是哪一條路徑?你解釋了什麼「為什麼會這樣」?第二題答不出來,就只是描述而不是理論。
如果把 M 拿掉,你的論文還剩下什麼?如果答案是「還是成立」,那 M 就不是真的機制。
被接受機率 = 期刊 Fit × Editor 第一印象 × Reviewer 信任度 × Revision 表現
投稿前最關鍵的決策。fit 不對,後面三個環節做再好也沒用,直接 desk reject。
Cover letter 只佔 5% 影響,卻是最常被敷衍的一環。
第九章的 paper-review 就在做這一段:先自己拒一次。
第九章的 paper-rebuttal:分數導向的分類與回應。
四個環節缺一就被擋,而且它們是相乘不是相加。期刊選錯這一項是零,其他三項再高,乘出來還是零。所以期刊選擇要花的時間,遠比多數人以為的多。
| 卡在哪裡 | 用哪一條公式檢查 | 最常是零的那一項 |
|---|---|---|
| 題目定不下來 | Good RQ = Gap × Importance × Audience | Audience |
| 方法被質疑 | Method = 匹配問題 × 因果邏輯 × 增進價值 | 因果邏輯 |
| 說不出貢獻 | 理論貢獻 = 路徑 × 機制 | 機制 |
| 不知道投哪裡 | 被接受機率 = Fit × 第一印象 × 信任度 × Revision | Fit |
再強調一次:這四個是觀念,不是可以安裝的 skill。它們不在課程點名的 14 支開源清單裡,也不需要任何環境設定。你需要的只是在動手之前,先用它們問自己一輪。
三軸評分卡、Reviewer 三問法、三路徑貢獻設計三個框架,整理自謝傳崇教授 2026 年 5 月 1 日於清華大學的演講,依學術慣例標註出處後引用。
第四章決定你能不能開始,這一章決定你能不能換家。先知道有哪 14 支,才有得搬。
所以不是勉強能跑。三個證據攤開來看。
EvoSkills 的 allowed-tools 寫的是 write_file、edit_file、read_file、think_tool、execute,不是 Claude Code 專有的 Read、Write、Bash。
academic-humanizer 的 frontmatter 直接寫著compatibility: claude-code codex morphmind opencode。
paper-review 與 deeppapernote 的目錄裡都已放了 AGENTS.md,那正是 Codex 讀的指令檔。
| 項目 | Claude Code | Codex CLI |
|---|---|---|
| skill 路徑(使用者層) | ~/.claude/skills/ | ~/.agents/skills/ |
| skill 路徑(專案層) | .claude/skills/ | .agents/skills/ |
| SKILL.md 必填欄位 | name、description | name、description |
| 呼叫方式 | /skill-name | 輸入 $ 選用,或 /skills |
| 指令檔 | CLAUDE.md | AGENTS.md |
| MCP 設定 | claude mcp add | codex mcp add 或 config.toml |
| 檔案寫入 | 預設可讀寫 | 預設只可寫工作目錄 |
| 對外網路 | 預設可 | 預設不可 |
必填欄位兩邊一致,這是能搬的技術基礎。最後兩列是唯一要處理的事。
~/.codex/skills~/.codex/skills 不在清單裡那是 Codex 內建 skill-installer 的預設落點,實務上跑得動,但官方文件沒有收錄。為了穩定,一律用 ~/.agents/skills/。
好消息:官方明文寫著「Codex supports symlinked skill folders and follows the symlink target」。所以不要複製檔案,用 symlink。一份原始碼兩個環境共用,日後更新只要更新一處。
版本方面不必擔心:Codex CLI 自 0.65.0(2025 年 12 月)起就支援 SKILL.md,官方沒有訂最低版本。直接升到最新版最省事。
不重開就不會重新載入 metadata,你會以為安裝失敗。這一行字省下最多的誤判。
Codex 的沙箱比 Claude Code 嚴格。兩個預設值會讓整條工作流當場卡死。
writable_roots預設只能寫工作目錄,所以寫不進 Obsidian vault,也讀不了桌面的 PDF 資料夾。
network_accessworkspace-write 模式預設不對外連網,所以 paper-navigator 與 paper-graph 打不到 Semantic Scholar。
ln -sfn 遇到已存在的實體目錄不會覆蓋,而是把連結建進那個目錄裡面。結果你以為換了新版,實際還在讀舊的。實測過的版本落差可達兩個大版本。
目錄名是 sciwrite,frontmatter 的 name 是 manuscript-writing-review。要打的是 $manuscript-writing-review。14 支裡只有這一支不一致。
可用 skill 清單最多佔 context 的 2%,或 context 未知時佔 8000 字元。裝太多時描述會先被截斷,自動選用的準確率下降。解法是統一用 $ 顯式指定。
雷點二特別容易卡住一整排人。它跟第八章講的是同一件事,這裡再說一次,因為換到 Codex 之後更容易忘。
有沒有重開?名字對不對?路徑對不對?是不是舊版實體目錄擋住了?
Codex 的 workspace-write 預設不連網。開 network_access。
同樣是沙箱問題。把 vault 路徑加進 writable_roots。
工具鏈搬家會讓驗證層靜默失效。檢查設定檔的 toolchainRoot 還指得到。
長指令在紙本或 PDF 上會折行。一律從 commands.txt 數位複製,不要照紙本手打。
資料夾名有空白要加引號。更省事的做法是資料夾名不要用空白。
SKILL.md files from Codex are not directly compatible with Claude Code's plugin format. OpenAI 官方文件。這句話指的是 Claude 的 plugin 打包格式,不是 skill 本身
雙方的必填欄位完全一致,都只有 name 與 description,而且這 14 支的 frontmatter 都沒有用到 Claude Code 專有欄位。
實務上跑得動,但未來版本有可能變動。真的要長期依賴,記得在升級 Codex 之後重跑一次驗收。
這一章是選配,而且要先聲明:PaperBrain 是我自己做的工具,不在前面點名的 14 支開源清單裡。它採 Apache-2.0,需要 Node.js 20 以上。前面十章不裝它也完全走得通。
第五章教你怎麼讀、怎麼歸檔。但當筆記累積到三十份以上,新的問題出現:哪一張卡支持哪一個論點?哪些卡彼此矛盾?哪一句話是原文、哪一句是我的推論?
每一張卡的每一個宣稱都帶出處標記,卡與卡之間建立連結,並且由程式而不是模型來檢查完整性。
〔p.12 src〕原文第 12 頁,有明確出處
〔§3.2 src〕原文第 3.2 節
〔inf〕我的推論,不是作者說的
〔n/a〕作者沒有報告這一項
這四個標記是整套的核心。寫論文時只要搜尋 〔inf〕,就知道哪些話是你自己推的、不能當作者的意思引用。
因為證據強度與出處標記需要你判斷。全自動的產出沒有人能為它背書,那就退回第二章講的代寫。
40_Synthesis/ 的文獻矩陣是程式直接讀卡片產生的,模型不經手。這樣矩陣裡不會出現卡片上沒有的東西。
skill 與工具鏈是兩個不同的絕對路徑,skill 靠設定檔裡的 toolchainRoot 才找得到驗證程式。工具鏈一旦放好就別再搬。
CARD_NO_SOURCE DEAD_LINK CITEKEY_FILENAME_MISMATCH STALE_INBOX UNREVIEWED_CARD
在對話裡說一句「檢查我的論文腦」就會跑。程式決定性地掃一遍,AI 不得改寫報告。
低於這個量,用第五章的方法加一個資料夾就夠了。
要做綜述、要寫文獻回顧矩陣,這時候卡片網絡才划算。
它的驗證層是本機 Node 程式,瀏覽器版跑不了。見第四章。
三個條件不同時成立,就先不要裝。工具的價值來自你的使用量,不是來自它有多完整。前面十章已經是完整的工作流,PaperBrain 只是在量夠大之後才划算的那一層。
安裝清單、三十天起手式、授權義務,以及回去之後怎麼跟上。
判斷標準只有兩條:對外可辯護,對內能複利。兩條都過,怎麼用都不會出事;有一條沒過,用得再少都有風險。
複利不是產出多,是每一次都墊高下一次的地板。一致的歸檔,才是三年後還在替你工作的那部分。
先想再問、每段驗證、留下 SOP、定期斷奶。愈靠近判斷與立場,愈要自己來。
| EvoSkills 11 支 | 對應章節 |
|---|---|
paper-navigator | 第五章 |
research-survey | 第五章 |
paper-graph | 第六章 |
research-ideation | 第六章 |
experiment-craft | 第七章 |
experiment-pipeline | 第七章 |
experiment-iterative-coder | 第七章 |
paper-planning | 第八章 |
paper-writing | 第八章 |
paper-review | 第九章 |
paper-rebuttal | 第九章 |
| 獨立開源 3 支 | 對應章節 |
|---|---|
deeppapernote | 第五章 |
sciwrite | 第八章 |
academic-humanizer | 第八章 |
EvoSkills repo 全集共 16 支(2026-09 查證),本課點名其中 11 支,其餘可自行探索。repo 另有 MCP 設定檔,那些不是 skill。
| 來源 | GitHub | 授權 | 再散布的義務 |
|---|---|---|---|
| EvoSkills(11 支) | github.com/EvoScientist/EvoSkills | Apache-2.0 | 附授權全文與版權聲明,修改過的檔案要標示已變更 |
| DeepPaperNote | github.com/917Dhj/DeepPaperNote | MIT | 保留版權聲明與授權全文 |
| sciwrite | github.com/labarba/sciwrite | CC BY 4.0 | 署名 Lorena A. Barba、附授權連結、指出是否修改過 |
| academic-humanizer | github.com/AIScientists-Dev/academic-humanizer | MIT | 保留版權聲明與授權全文 |
最省事的做法是不要打包,給連結就好。授權義務留在上游,你這邊零風險。特別注意 sciwrite 是唯一的 CC BY 4.0,改它的 name 就構成「已修改」,必須註明。
不要 14 支一起裝。一次全用會噎住,而且你分不出哪一支真的有用。
只裝 paper-navigator。用它分層快讀 15 篇你手上正在讀的文獻,並開始留查詢紀錄。
加裝 paper-graph 與 research-ideation。先畫一次領域圖譜,再跑一次 ELO,帶 Top-3 去跟指導教授討論。
加裝 paper-writing 與 sciwrite。用 11 步工作流寫一節,並只對三個關鍵段落跑句級體檢。
三十天之後,你會知道哪三支是你真正天天用的。剩下的等遇到那個節點再裝。
會,而且應該會。但它們是 markdown,你隨時可以改。真正不會過時的是第一、二、十章講的東西:判斷標準、工作流結構與方法論框架。學方法論,不要學一次性的提示詞。
可以,也應該改。每一支都是 markdown,你可以依自己的領域客製觸發詞、輸出格式與檢查規則。唯一要注意的是授權:改了要留紀錄,sciwrite 改了還要註明。
這條流程不是套餐,是骨架。哪一格不順,就換那一格的工具。骨架不變,零件可換。你要帶走的是流程,不是某個特定工具。
你照 GitHub 裝到的,跟我課堂上示範的,有三處不一樣。與其含糊帶過,不如當成「skill 可以怎麼客製」的實例。
常設規則:綜整類任務優先 Q1 與 Q2;Q3 只在帶關鍵證據時收錄並標記;排除 Q4 與 MDPI。
附帶的實務理由:那些站臺會擋自動請求,留著會讓後面的 DOI 存活檢查一起壞掉。
五面向自審之後,再派一個獨立的懷疑論者逐節審一遍;投稿前跑一支腳本,把參考書目的每個 DOI 拿去 CrossRef 驗存活。
改編自 CYC2002tommy/Deep-Research-Agent,我修掉了原版的編號錯誤,並拿掉「只能用英文審」的限制。
四步填空結構:建立重要性 → 限制與缺口 → 貢獻 → 可量化成果。
收錄自王士欣公開的教學文章,來源與連結都寫在檔案裡。
為什麼要專門講這一頁:前面說過「今天介紹的全部是授權明確的開源 skill」,那是對的。但我自己在上面加了三層東西,如果不講,你會以為那些也是原廠功能。而且這三處剛好示範了客製的三種型態:加一條紀律、接一個外部工具、收錄一份別人的方法論。
學員自行前往原始 repo 安裝。本課程不重製、不修改、不打包散布任何第三方程式碼或教材。
第十章的三個框架整理自謝傳崇教授 2026 年 5 月 1 日清華大學演講;其餘引言均出自公開出版品,依學術慣例標註出處後引用。
賓州大學華頓商學院教授,《Co-Intelligence》
Microsoft Research,How to Write a Great Research Paper
Stanford,Writing in the Sciences。sciwrite 的方法論源頭
AI 賦能學術研究基地。課程、資源庫與文章都在這裡,另有六堂免費線上課共 58 個單元,不需帳號、不需付費。
第四章與第十一章的完整版,含指令速查與錯誤排除,另有獨立的簡報與 PDF 可下載。
有問題直接寫信。也歡迎到臉書社團「博碩士生練功團」交流。
骨架不變,零件可換。祝你的研究,愈做愈有複利。