Research Second Brain

PaperBrain
論文腦

把讀過的論文,變成能問、會回查、有出處的第二大腦。

擷取批判閱讀連結成網
講者
Vista Cheng(鄭緯筌)

Vista Cheng(鄭緯筌)

AI 應用講師|內容策略顧問|寫作教練

《經濟日報》與《科技島》專欄作家、前《風傳媒》產品總監、《數位時代》雜誌主編。著作超過 20 本,長期把 AI 串成研究與寫作的工作流,協助大學教師、研究生與專業工作者把素材變成可累積的知識資產。

議程

今天會走完的七段路

01心智模型指令層與驗證層,兩層缺一不可
02研究卡與出處標記八個段落、四種語言中性標記
03安裝Claude Code 版與 Codex 版,兩條路都走一遍
04在 Obsidian 搭建 vault兩種佈局、六個必改設定
05實戰從一篇 PDF 到一份綜整
06健檢與長期維護三個嚴重度、五個健檢代碼
07誠信邊界哪些是機械保證,哪些不是
為什麼需要它
🌀

三週後,你只剩下一句「我好像看過」

你讀了一篇論文,當下覺得懂了。三週後同事問起,你打開資料夾,看到 PDF 躺在那裡,檔名是 2405.12345v2.pdf。你不記得它講什麼,也不記得當初為什麼下載。

問題不在你記性差,在於你沒有把閱讀變成可回查的東西。

為什麼需要它

寫摘要解決不了的三件事

📄

摘要沒有出處

三個月後想引用其中一句,還是得回去翻原文找頁碼。

🔗

摘要彼此不相連

第十篇跟第三篇講的是同一件事,但沒有人告訴你。

🤖

分不出誰說的

如果摘要是 AI 生的,你無法分辨哪句是論文說的、哪句是模型腦補的。

為什麼需要它
🎯

它不主打快

它主打三件事:可信、可回查、可累積。AI 的角色從「幫你生東西」,改成「幫你整理但不准亂講」。

註:如果你要的是三十分鐘讀完五十篇,這套工具不適合你。

章節
01

心智模型:兩層架構

理解這件事之後,後面全部都好懂。

01 心智模型

兩層架構:誰負責做,誰負責檢查

指令層(skills)

  • 七份 SKILL.md,寫給 AI 看的操作規範
  • 它們才是產品本體
  • 告訴 AI 該怎麼讀、怎麼標出處
  • 可讀、可改、可自己調整

驗證層(程式)

  • 一組零依賴的 Node 程式
  • 機械檢查 AI 的產出
  • AI 說「我標了出處」不算數
  • 程式驗過才算
01 心智模型
🔩

AI 產出可信,不靠自律,靠機械檢查

再往前一步:能用程式決定性產生的,就不要讓 AI 生。文獻矩陣由程式直接讀卡片產出,模型完全不經手,所以矩陣裡的內容在結構上不可能是捏造的。

01 心智模型

資料流:一篇論文會經過什麼

一篇論文

capture10_Sources/ 原始檔案與全文,查證的權威依據 / 00_Inbox/ 書目暫存,做成卡片後會被刪掉
read20_Cards/ 研究卡(核心產物)。這一步會停下來問你
link30_Concepts/ 原子概念筆記,並建立卡片之間的連結
ask只用你的卡回答問題,不寫檔
synthesis40_Synthesis/ 文獻矩陣、缺口與矛盾

你的 vault 就是一堆純 markdown 檔。沒有資料庫、沒有專有格式、沒有鎖定。

01 心智模型

五個資料夾,各有各的職責

  • 00_Inbox/擷取後還沒做成卡的書目暫存。卡片產出後會被刪掉,所以它是選填欄位唯一的備份來源
  • 10_Sources/原始 PDF 與轉檔全文。這是查證的權威依據,永遠不要手動編輯
  • 20_Cards/研究卡,核心產物。你唯一該動手改的是「我的評註」那一欄
  • 30_Concepts/原子概念筆記。它們是 graph 上的樞紐,多篇論文靠它們聚成主題
  • 40_Synthesis/跨卡綜整。同一天同一主題重跑會自動遞增版本,不覆蓋
章節
02

研究卡與出處標記

每一行事實主張,都要說得出它從哪裡來。

02 研究卡

一張研究卡的八個段落

四個事實區(必須帶出處)

  • 研究問題:這篇在問什麼
  • 方法與族群:怎麼做的、對象是誰
  • 結果:發現了什麼
  • 限制:這篇的限制

四個屬於你的區塊

  • 一句話:全卡的 TL;DR
  • 關鍵概念:抽出來連到概念筆記
  • 與我的連結:呼應、延伸或矛盾
  • 我的評註:AI 不該替你填這欄
02 研究卡

一張卡實際長什麼樣

markdown
---
citekey: otsuka2024chatgpt
title: "100 天挑戰"
year: 2024
status: read
reviewed: true
sourceStatus: full
---

## 結果
<!-- pb:findings -->
- 完成 100 個 App〔p.5 src〕

## 限制
<!-- pb:limitations -->
- 未報告對照組〔n/a〕
- 作者可能有選擇性回報〔inf〕

標題下一行的 pb 錨點是語言中性的,驗證程式靠它認段落,所以卡片換語言也驗得動。Obsidian 閱讀模式不會顯示它。

02 研究卡

四種出處標記,語言中性

無論卡片是中文、英文還是日文都長一樣,因為驗證程式要跨語言用同一把尺。

📖

〔p.12 src〕

出自原文第 12 頁。來源有頁碼時用。

📍

〔§3.2 src〕

出自原文某章節。來源沒有頁碼時用,例如 arXiv 的 HTML。

🧠

〔inf〕

AI 的推論,不是原文說的。

🚫

〔n/a〕

原文沒有提到這件事。

02 研究卡
🕊️

定位符的存在,是為了解除捏造壓力

如果規格硬性要求每條出處都要有頁碼,那麼遇到根本沒有頁碼的 HTML 來源時,就是逼 AI 在「編一個頁碼」與「卡住不動」之間二選一。給它一個誠實的第三條路,它就不必說謊。

與其要求模型不要犯錯,不如把犯錯的動機拿掉。

02 研究卡
💚

inf 與 n/a 是這套系統的良心

一個誠實說「這是我推論的」、「論文沒講這件事」的工具,比一個什麼都答得出來的工具有用得多。跑完之後回報會告訴你這張卡有幾條 src、幾條 inf、幾條 n/a。

註:inf 特別多,代表這張卡多是 AI 推論而非原文事實,判讀時要打折。

02 研究卡

三個選填欄位,缺了不會擋你,但會咬你

  • sourceStatusfull 或 partial。缺了,日後無從得知這張卡的出處鏈是不是來自不完整的來源
  • doi缺了,綜整時這篇論文真實的 DOI 會被判成虛構,參考清單永遠生不出來
  • venue缺了,書目與參考清單就少一塊
  • 它們從哪來由擷取階段寫進 inbox 暫存,再由閱讀階段帶到卡上
  • 為什麼要盯暫存檔在卡片產出後會被刪掉,那是這三欄唯一的備份,刪掉就永久遺失
章節
03

安裝:兩種環境,同一套工作流

Claude Code 版與 Codex 版都走一遍。驗證層與卡片格式完全相同,差別只在怎麼裝、怎麼叫。

03 安裝

動手之前,先決定你要裝哪一版

Claude 版 paperbrain 1.2.0

  • 執行者是 Claude Code
  • skills 裝到 ~/.claude/skills/
  • 用中文觸發詞叫它,例如「餵腦」
  • 安裝靠 cp -r,沒有任何保護
  • 附完整教學手冊 v2.1

Codex 版 paperbrain-codex 1.2.0-codex.2

  • 執行者是能存取本機檔案與終端機的 Codex
  • skills 預設裝到 ~/.agents/skills/
  • $ 前綴叫它,例如 $paperbrain
  • 安裝靠 install-codex.mjs,會預檢衝突
  • 附 Codex 專用手冊 v2.4

兩版的 src/ 驗證層與 vault 初始化腳本逐檔相同,研究卡 schema、引用驗證與人工複核規則也沒有變。選哪一版,只取決於你平常用哪個 AI 編碼環境。

03 安裝

動手之前,先確認四件事

  • Node.js 20 以上終端機打 node --version。PaperBrain 零依賴,但需要 Node 跑驗證程式
  • 一個能跑指令的 AIClaude Code,或是能存取本機檔案與執行終端機指令的 Codex。七份 skill 是寫給 AI 看的規範,沒有執行者就跑不起來
  • 一個放筆記的資料夾有沒有 Obsidian 都可以,等一下第 04 段說明差別
  • 一篇你真的想讀的論文不要用範例論文練習,用真的,效果差很多
03 安裝

你手上那兩個壓縮檔是什麼

  • paperbrain-v1.2.0.zipClaude 版。解開後頂層是 paperbrain/,共 52 個檔案。內含七支 skill、14 支驗證器、15 支測試,以及 docs/manual/ 的完整教學手冊 v2.1
  • paperbrain-for-codex-
    v1.2.0_v2.zip
    Codex 版。解開後頂層是 paperbrain-codex/。多了 install-codex.mjs 安裝器、每支 skill 的 agents/openai.yaml,以及 Codex 專用手冊 v2.4。原版手冊移到 docs/legacy/
  • 共同的部分src/ 底下 14 支驗證器與 bin/paperbrain-init.mjs 兩版逐檔相同。六階段出貨狀態表一致,功能沒有落差
  • 授權兩版皆 Apache License 2.0。選配的 PyMuPDF 是 AGPL-3.0,屬使用者自行安裝的外部工具,不隨本專案散布
03 安裝|Claude 版

Claude 版:安裝就三個動作

1工具鏈落腳把解壓出來的資料夾搬到長期位置,例如 ~/Tools/paperbrain。絕對不要留在下載或桌面。
2建立你的 vault跑 paperbrain-init.mjs,帶上 --root、--mode、--language 三個參數。--root 一定要寫。
3安裝 skills把七個 skill 資料夾複製到 ~/.claude/skills/,然後重開一次 Claude Code 讓它重新載入。

--mode 可選 obsidian(用 wikilink 與圖譜)或 plain(純資料夾,靠 _index.md 導覽)。--language 接受任何 BCP-47 代碼,zh-TW 與 en 是一級支援。

03 安裝|Claude 版

Claude 版:三個動作的實際指令

bash
# 1. 放到長期位置(示範用 ~/Tools/paperbrain,你可以換)
mkdir -p ~/Tools && mv ./paperbrain ~/Tools/paperbrain

# 2. 建立 vault。--root 一定要寫,省略的話會建在當前目錄
node ~/Tools/paperbrain/bin/paperbrain-init.mjs \
  --root ~/PaperBrain \
  --mode obsidian \
  --language zh-TW

# 3. 安裝 skills,然後重開 Claude Code
cp -r ~/Tools/paperbrain/skills/* ~/.claude/skills/

init 是冪等的,重跑不會蓋掉你改過的設定。第三行之前先 ls 一眼 ~/.claude/skills/,因為 cp -r 不會問你就覆蓋同名資料夾。

03 安裝|Claude 版

最省事的裝法:讓 Claude Code 幫你裝

解壓縮之後,開 Claude Code,把 INSTALL.md 裡那段提示詞原封不動複製貼上。裡面已經寫好所有防呆條件,比你自己描述需求可靠。

提示詞裡的五個防呆條件

  • 工具鏈搬到長期位置,不得留在 Downloads 或桌面,搬好回報絕對路徑
  • node --version 不是 20 以上就停下來問,不要自己繼續
  • vault 不要建在既有 Obsidian 主庫裡面,要獨立一個資料夾
  • 複製 skills 前先檢查同名資料夾,有的話列出來問,不要直接覆蓋
  • 完成後列出 vault 結構與 paperbrain.config.md,讓你確認 toolchainRoot

為什麼這樣比較穩

  • --root 不可省略這件事寫在提示詞裡,AI 不會漏
  • 每一步做完回報結果,遇到不確定就停下來問你
  • 覆蓋既有 skill 這個最痛的坑,被寫成「先問過再動」
  • 裝完一樣要重開一次 Claude Code,這一步 AI 代勞不了
03 安裝|Codex 版

Codex 版:五個動作

1放好工具鏈把解壓縮的 paperbrain-codex 資料夾放到 ~/Tools/paperbrain-codex。已有同名資料夾請另選位置。
2確認 Node 版本node --version。低於 20 的話安裝程式會直接擋下來。
3安裝七個技能node bin/install-codex.mjs。預設寫入 ~/.agents/skills/,可用 --skills-dir 改成 ~/.codex/skills/。
4初始化獨立 vaultnode bin/paperbrain-init.mjs,--root 一樣必須明確傳入。
5在 Codex 開啟 vaultcd ~/PaperBrain 之後啟動 codex。技能沒出現就重新啟動一次。
03 安裝|Codex 版

Codex 版:實際指令與驗收

bash
# 手動安裝(macOS/Linux)
node --version
cd ~/Tools/paperbrain-codex
node bin/install-codex.mjs
node bin/paperbrain-init.mjs --root "$HOME/PaperBrain" --mode obsidian --language zh-TW

# 啟動與驗收
cd ~/PaperBrain && codex
# 在 Codex 裡:
/skills
$paperbrain-health 檢查目前的論文庫

不使用 Obsidian 時改用 --mode plain。Windows 可用 Node.js 執行相同的兩個腳本,改用實際的絕對路徑(文件未給 Windows 的實際指令字串)。新庫應回報沒有研究卡,那是正確結果。

03 安裝|Codex 版

install-codex.mjs 幫你擋掉三件事

這是 Codex 版相對 Claude 版最實際的升級:把三個人為疏失做成安裝程式的硬性檢查。

🚦

Node 版本不足

主版號小於 20 直接退出,訊息是「Expected: Node.js >= 20; actual: ⋯」,不會裝到一半才爆。

🛡️

同名技能衝突

安裝前預檢七個目錄,任何一個撞名就印出衝突路徑並中止,不像 cp -r 會靜默覆蓋。

📍

裝到不確定的位置

預設寫入 ~/.agents/skills/,成功時印 Installed 7 skills into 加上目標路徑,你知道它裝到哪。

技能位置與呼叫方式依據 OpenAI 官方 Codex skills 說明,套件內註明查核日期為 2026-09-11。同一份技能只安裝在一處,不要兩個目錄各放一份。

03 安裝

兩版差異,一張表看完

項目Claude 版Codex 版
套件與版號paperbrain 1.2.0paperbrain-codex 1.2.0-codex.2
建議工具鏈位置~/Tools/paperbrain~/Tools/paperbrain-codex
裝 skills 的方式cp -r skills/* ~/.claude/skills/node bin/install-codex.mjs
skills 目的地~/.claude/skills/預設 ~/.agents/skills/,可改 ~/.codex/skills/
同名衝突保護無,要自己先 ls 一眼預檢七個目錄,有衝突就中止
Node 版本檢查靠人工 node --version安裝程式自動擋
技能呼叫中文觸發詞,如「檢查我的論文腦」$ 前綴,如 $paperbrain-health
列出已裝技能文件未說明/skills
驗證層 src/14 支檔案兩版逐檔完全相同,功能零落差
03 安裝

七個入口,兩種叫法

記住第一個就夠。其餘六個是你想單獨跑某一段時才用。

用途Claude 版說法Codex 版指令
一條龍餵腦 <PDF 或網址>$paperbrain
只收進來擷取這篇$paperbrain-capture
做成研究卡讀這篇$paperbrain-read
連進概念網路連結這張卡$paperbrain-link
只用自己的卡回答問我的論文:⋯⋯$paperbrain-ask
跨論文綜整綜整這個主題:⋯⋯$paperbrain-synthesis
定期體檢檢查我的論文腦$paperbrain-health
03 安裝
📌

最大的雷:工具鏈搬家,驗證層就默默失效

skills 被複製出去之後就跟工具鏈分家了,它們靠設定檔裡的 toolchainRoot 才找得回驗證程式。搬了工具鏈,卡片照樣產出,但沒人檢查了。

註:修法是打開 paperbrain.config.md 手動更新 toolchainRoot 那一行。重跑 init 不會覆寫這個設定,別指望它。

03 安裝

五個新手常踩的坑

  • 工具鏈留在下載資料夾遲早被你自己清掉,設定檔的絕對路徑跟著失效
  • init 忘了帶 --root預設值是當前目錄,會把整套骨架建在工具鏈裡面。那些空資料夾直接刪掉即可
  • vault 建在 Obsidian 主庫裡面不會壞,但全文轉檔會洗掉你原有的搜尋結果。建議獨立一個
  • 複製 skills 蓋掉同名資料夾Claude 版的 cp -r 不會問你。裝之前先 ls 一眼 ~/.claude/skills/。Codex 版的安裝器會幫你擋
  • 裝完沒重開skill 不會被載入,會誤以為安裝失敗。Claude Code 與 Codex 都要重開一次
03 安裝

安裝驗收:三個都過才算裝完

Claude 版

  • 工具鏈在固定位置:ls 一下 src/validate-card.mjs 在不在
  • 設定檔指得到工具鏈:打開 paperbrain.config.md 看 toolchainRoot 那一行
  • skills 載入了:說一句「檢查我的論文腦」,看到健檢報告就代表活了
  • 報告說 0 張卡 0 個概念,那是正確結果不是錯誤

Codex 版

  • 安裝器有印出目的地:Installed 7 skills into ⋯
  • 技能列得出來:在 Codex 裡打 /skills
  • 健檢跑得動:$paperbrain-health 檢查目前的論文庫
  • 新庫應回報沒有研究卡,那也是正確結果

兩版都可以再加一道開發者級驗證:在工具鏈目錄跑 npm test。init 應建出 paperbrain.config.md、_schema.md,以及 00_Inbox、10_Sources、20_Cards、30_Concepts、40_Synthesis 五個資料夾。

03 安裝

出貨文件目前還有這些落差

照著裝會遇到,先講清楚比事後解釋好。

  • Claude 版沒有 CHANGELOG「1.2.0 相對前版新增什麼」文件未說明。只有 Codex 版有逐條變更紀錄
  • skills 目錄不存在時cp -r 到一個還不存在的 ~/.claude/skills/ 會怎樣,文件未說明。從沒裝過 skill 的人建議先 mkdir -p
  • 路徑大小寫前後不一INSTALL 與 README 寫 ~/Tools/paperbrain,user-guide 寫 ~/tools/paperbrain。macOS 不分大小寫不會炸,但抄講義會前後不一
  • README 有失效連結兩版 README 都連到不存在的 docs/superpowers/plans/
  • Codex 版自承驗證不完整CHANGELOG 原文:未在全新 Codex 對話中執行完整 PDF 產卡流程。它驗過的是自動測試、隔離安裝與衝突保護、ZIP 完整性
  • 掃描版 PDF 沒有 OCRCodex 版 INSTALL 有講「本套件不附 OCR」,Claude 版的文件沒提到
章節
04

在 Obsidian 搭建 vault

六個設定改對,日後少掉一半的維護成本。

04 Obsidian
🧭

Obsidian 補的是導覽,不是儲存

你的資料本來就是純 markdown,用任何編輯器都打得開。Obsidian 加的是四件事:可以點的雙向連結、反向連結面板、看得見形狀的 graph,以及一個好用的全域搜尋。

所以它是建議搭配,不是必要條件。本段最後會講不用它怎麼辦。

04 Obsidian

兩種佈局,先選一個再動手

獨立 vault(第一次用建議這個)

  • PaperBrain 自己一個 vault
  • 搜尋乾淨,graph 只有論文網路
  • 設定只影響 PaperBrain,風險低
  • 適合以研究為主的使用情境

放進既有主庫當子資料夾

  • 研究卡可以連到你自己的想法筆記
  • 同一張 graph,跨領域的關聯看得見
  • 記得把 10_Sources 設為排除的檔案
  • 適合已有成熟 Obsidian 工作流的人
04 Obsidian

把資料夾開成 vault

1先 init,再開 Obsidian順序反過來不會壞,但你會多一個對齊路徑的步驟。
2選 Open folder as vault在 Obsidian 的 vault 選擇畫面,指到你剛剛 init 出來的資料夾。
3讓它建 .obsidian 目錄那是 Obsidian 自己的設定,與 PaperBrain 無關,不要刪。
4照下兩頁把六個設定改好這一步不做,日後最容易出現連結對不上與卡片被外掛改壞。
04 Obsidian

必改的六個設定(上)

  • 新連結格式:最短路徑設成絕對路徑的話,Obsidian 插入的連結會多出資料夾前綴,跟卡片裡的寫法不一致
  • 保持使用 Wikilink關掉之後會改用另一種連結語法,跟卡片既有的寫法混在一起就亂了
  • 自動更新內部連結可以開,但要知道它的邊界:改檔名時 frontmatter 的 citekey 不會跟著改
  • 鐵則:不要手動改卡片檔名檔名就是 citekey,那是這張卡的身分證。兩邊一分家就會回報命名不一致
04 Obsidian

必改的六個設定(下)

  • 新筆記的預設位置指到 vault 根目錄或你的草稿夾,不要指到 20_Cards。隨手建的筆記落進去會被當成壞掉的卡
  • 附件的預設位置預設是「與目前檔案相同的資料夾」,代表你讀卡片時貼一張圖,圖就掉進 20_Cards
  • 排除的檔案:加入 10_Sources讓全文轉檔在搜尋結果降權,也不出現在 graph。子資料夾佈局的人這條是必做
  • 別動 _schema.md那是隨產品出貨的格式合約,隨時可以查「這個欄位到底該填什麼」
04 Obsidian

外掛:直接開,與要先排除卡片資料夾

直接開,只讀不寫

  • 反向連結:看哪些卡引用這個概念
  • 大綱:八個段落一眼跳轉
  • 局部圖表:看單張卡的鄰居
  • Dataview(選用):待複核清單一頁看完

要用的話,先排除卡片與來源資料夾

  • 自動格式化類:會重排 frontmatter 與錨點
  • 自動套模板類:會亂加或蓋掉必填欄位
  • 改顯示標題類:讓檔名與 citekey 分家
  • 判準:任何會自動改寫檔案的外掛
04 Obsidian

搜尋術:在 Obsidian 裡查你的第二大腦

obsidian search
path:20_Cards "〔inf〕"
    → 這個 vault 裡所有 AI 推論條目,定期掃一次

path:20_Cards "sourceStatus: partial"
    → 出處鏈有缺口的卡,引用前要特別小心

path:20_Cards "reviewed: false"
    → 還沒經你複核的卡,理想狀態是永遠回傳空的

path:30_Concepts
    → 所有概念,用來抓語意重複但字面不同的那幾個

graph 調兩個地方就好看:依資料夾分組上色(卡片一色、概念一色),並在篩選器關掉附件。日常研究看局部圖表比全域 graph 好用。

04 Obsidian

Obsidian 使用守則五條

  • 不要手動改卡片檔名檔名就是 citekey
  • 不要裝會自動改寫 markdown 的外掛至少要排除卡片與來源資料夾
  • 不要編輯 10_Sources 的全文檔那是查證的依據,改了就不再是原始證據
  • 不要改 _schema.md那是隨產品出貨的格式合約
  • 可以放心改的只有三處卡片的評註段落、概念定義、綜整草稿
04 Obsidian

不用 Obsidian 也完全可行

obsidian 模式

  • 雙向連結可以點
  • graph 與反向連結面板
  • 全域搜尋介面友善
  • 卡片格式:一模一樣

plain 模式

  • 連結是純文字,看得懂但不能點
  • 導覽靠 _index.md,連結階段會持續更新它
  • 用 grep 查詢,一行搞定
  • 驗證層與機械保證:完全不打折
章節
05

實戰:怎麼用

從一篇 PDF 到一份綜整,中間有一道你不能跳過的閘。

05 實戰

實戰:從一篇 PDF 到一份綜整

1餵進去一句「餵腦 ~/Downloads/某篇論文.pdf」,會依序跑擷取、閱讀、連結。Codex 版是 $paperbrain 加上路徑。
2在確認閘認真看重點看三處:事實區的出處標記、有沒有你不同意的詮釋、評註欄留給你自己。
3讓它長出連結第五張卡開始,它會把你三個月前讀的那篇跟今天這篇連起來。
4問你自己的卡只用你 vault 裡的卡片回答,不用模型記憶補完。
5綜合整理一個主題指令說「綜整這個主題:⋯⋯」,產出文獻矩陣、缺口與矛盾三份東西。
05 實戰

人工確認閘:這不是雜訊,這是重點

產出草稿卡之後一定會停下來,把整張卡攤給你看,等你回應才寫檔。AI 不准自己跳過這一關,也不准把「你還沒回應」當成動筆的理由。

理解發生在你確認的那一刻。

05 實戰

確認閘那三分鐘該看什麼

  • 看事實區的出處標記關鍵結論如果標的是 inf,那是 AI 推論不是論文說的,要回原文確認
  • 看有沒有你不同意的詮釋AI 讀出來的「結果」有時會過度簡化。你比它懂你的領域
  • 看評註欄是不是空的那一欄留給你,是整張卡唯一真正屬於你的東西
  • 抽驗兩條頁碼翻開原始 PDF 對兩句。驗證程式驗得了格式,驗不了頁碼真偽
  • 三種回應確認、要它修正,或明講「先存草稿不用複核」
05 實戰

擷取實務:PDF 還是 HTML,會影響出處精度

PDF(要精確引用時優先)

  • 有頁碼,出處標到 p.12
  • 可以直接翻頁查證,精度高
  • 雙欄排版轉檔時局部順序可能亂
  • 緩解方式:保留原始檔,並在來源檔誠實記載

HTML 或網頁版

  • 通常沒有頁碼,出處標到章節
  • 要靠章節找,精度中等
  • 版面單純,不會有雙欄錯亂的問題
  • 系統不會因為沒頁碼就編一個假的

掃描版 PDF 可能需要另外 OCR,本套件不附 OCR。轉檔引擎三級擇一:PyMuPDF 系列、pdftotext、markitdown。要包進對外販售的產品請避開 AGPL 的 PyMuPDF。

05 實戰

綜合整理到底產出什麼

  • 文獻矩陣每一列是一張卡,每一欄是一個面向:研究問題、方法、結果、限制。一眼看出這批論文在同一個問題上各自說了什麼
  • 缺口矩陣上的空格就是缺口:哪些面向大家都沒做,那可能就是你的題目
  • 矛盾哪兩篇的結果互相打架,會被標出來,而不是被平均掉
  • 關鍵設計矩陣由程式直接讀卡片產生,模型不經手,所以每一格都真的來自某張卡
  • 指令怎麼下說「綜整這個主題:大型語言模型的幻覺量測」,產出會寫進 40_Synthesis/
章節
06

健檢與長期維護

一百張卡你還記得哪裡有問題,五百張不會。

06 健檢
🩺

第二大腦會隨規模長大而腐化

卡片改名、概念重複、擷取了沒讀完、來源缺了原始檔。一百張卡的時候你還記得哪裡有問題,五百張的時候不會。

說一句「檢查我的論文腦」,程式會決定性地掃一遍,AI 不得改寫報告。

06 健檢

三個嚴重度怎麼看

error立刻修

卡片驗不過、死連結、來源檔不見了、卡片壞到讀不進來被跳過。這些讓可回查直接破功。

warn這週處理

孤兒卡、孤兒概念、暫存滯留超過七天、未複核的卡、重複概念候選。

info知道就好

來源只擷取到部分。不是錯,但引用時要提醒自己出處鏈有缺口。

06 健檢

最常見的五個健檢代碼

  • CARD_NO_SOURCE卡片找不到對應的來源檔。補跑擷取,或確認來源是不是被搬走了
  • DEAD_LINK連結指向不存在的卡片或概念。修正連結,或補建那張卡
  • CITEKEY_FILENAME_MISMATCH檔名與 citekey 不一致。多半是有人在 Obsidian 裡改了檔名
  • STALE_INBOX暫存滯留超過七天。讀掉它,或承認不會讀然後刪掉
  • UNREVIEWED_CARD卡片還沒經你複核。打開逐條看過,這正是它存在的意義
06 健檢
🔁

建議的節奏:每二十張卡,或每個月

兩者以先到者為準。另外有兩個時機一定要跑:手動改過卡片檔名之後,以及從別的裝置同步 vault 回來之後。這兩件事最容易產生死連結與衝突副本。

註:零 issue 不等於卡片正確。它只代表可回查的骨架沒斷。

章節
07

誠信邊界

把話講在前面:哪些是程式擋得住的,哪些只能靠你。

07 誠信邊界

哪些是機械保證,哪些不是

程式機械強制(會擋)

  • 每一行事實主張都帶出處標記
  • 引用指向的卡片與概念真的存在
  • 出現的 DOI 真的來自某張卡的書目
  • 文獻矩陣與卡片內容一致
  • 全文來源記錄了身世

程式驗不到,這幾件只能靠你

  • 驗不了頁碼真偽:它不知道第 12 頁有沒有那句話
  • 驗不出詮釋對不對
  • 驗不出那張卡是否真的支持那句話
  • 驗不出回答有沒有偷用模型的背景知識
  • 驗不出你有沒有真的讀
07 誠信邊界
⚠️

它能保證的是可回查,不是正確

可回查是正確的前提,但不等於正確。每一條你打算寫進論文的引用,回原文確認一次,不管卡片標得多漂亮。

07 誠信邊界

授權,以及觀念從哪裡來

  • Apache License 2.0拿到的人可自由使用、修改與再散布,包含商業用途,保留授權與著作權聲明即可
  • 卡片與概念的組織方式取法 Zettelkasten(Niklas Luhmann):原子筆記加雙向連結
  • 「第二大腦」一詞沿用 Tiago Forte 在 Building a Second Brain 的說法
  • PaperBrain 自己的貢獻把學術誠信做成機械可驗證的一層
  • 一句話方法論可以借,可信度必須自己扛
07 誠信邊界

不確定的時候,翻哪一本手冊

  • Claude 版手冊 v2.1在 docs/manual/,含 PDF、Word 與 Markdown 三種格式
  • Codex 版手冊 v2.4在 docs/for-codex/manual/,重寫過安裝章與技能呼叫。這份是 Codex 版的編輯來源,legacy 目錄裡的原版只供歷史參考
  • 安裝逐步驟手冊第 4 章,含可直接貼給 AI 的安裝提示詞。精簡版看套件根目錄的 INSTALL.md
  • Obsidian 完整一章手冊第 5 章:佈局、六個必改設定、外掛、graph、搜尋、同步備份
  • 健檢代碼全表第 11 章與附錄 D:15 個健檢代碼各自怎麼修。附錄 E 是卡片、引用、來源、載入四組驗證碼的意思
  • 帶人一起跑附錄 G:九十分鐘工作坊帶跑路線,給講者與助教
延伸資源

想更進一步?

🎓

AI 學術研究與寫作

從文獻到投稿的完整工作流實戰課

solo.tw/courses/ai-academic-writing

🔬

研究者基地

AI 賦能學術研究

課程、資源與文章都在這裡。researcher.tw

📦

PaperBrain 工具包

Claude 版與 Codex 版

Apache 2.0 授權,附完整教學手冊,隨課程發給學員。

✉️

保持聯絡

歡迎邀課與合作

iamvista@gmail.com
LINE @iamvista

謝謝

Vista Cheng(鄭緯筌)

報名 AI 學術研究與寫作:https://www.solo.tw/courses/ai-academic-writing
關注學術研究基地:https://www.researcher.tw/

把讀過的論文,變成會累積的第二大腦