Hub 達人實戰

達人實戰 · 行銷與內容

學術研究達人:從文獻回顧到基因體分析,苦工先讓 AI 扛

從系統性文獻回顧到基因體資料分析,學術研究是 Claude Code 語料最豐富的非工程職業之一——不是因為魔法,是因為一群計量經濟學教授、質性研究者與生醫實驗室已經把機械式的苦工交給它,自己留住詮釋與判斷。這章帶你看他們具體怎麼做,也老實告訴你 Codex CLI 現在跟不跟得上。

這行的痛點

學術研究的苦工有一個共同特徵:規則清楚、重複性高,但錯一步代價很大。文獻回顧要篩幾百篇摘要、抽結構化資料;質性訪談要逐字稿跑主題編碼;統計建模要盯遺漏值有沒有被悄悄丟掉;投影片與論文格式要維持期刊等級的一致性。這些工作不是「不能自動化」,而是過去沒有一個工具同時懂研究邏輯、又跑得動本機工具鏈(LaTeX、R、Python、git)。

Claude Code 補上的正是這一塊:它不是網頁版聊天視窗,是能直接讀你的資料夾、編譯你的 .tex、跑你的 R 腳本、把重複流程存成可重複使用的 skill 的命令列工具。Anthropic 甚至為此開了一條完整產品線——2025 年 10 月上線的 Claude for Life Sciences、2026 年 7 月進 beta 的 Claude Science 多代理科研工作台,接超過 60 個科學資料庫。

這不是廠商自吹自擂。The Republic of Science 的 Charles Yang 拿 ORCID 檔案交叉比對 GitHub commit 紀錄,從近 1,600 萬筆學者檔案中篩出 331 位有公開紀錄在用 Claude Code 的科學家,採用率約 2.1%,且經濟學與社會科學領域的採用率(1.4%–3.4%)高於電腦科學本身。換句話說,這不是工程師在自嗨,是研究者真的把它當研究工具用。

動手前的準備

  • 先看 Claude Code 教學第 2 章「安裝 Claude Code」——本章所有場景都假設你已經能在終端機打開 claude
  • 先看 Claude Code 教學第 5 章「CLAUDE.md 與工作記憶」——本章幾乎每個場景都靠 CLAUDE.md 當「研究日誌」記錄研究問題、codebook、誠信規則,這是最高槓桿的一步。
  • 若要接 Zotero、PubMed 等文獻資料庫,先看 Claude Code 教學第 9 章「連接工具 MCP」。
  • 場景一的多代理覆核生產線會用到 subagent 概念,先看 Claude Code 教學第 10 章「多代理自動化」會比較好上手。
  • 若研究涉及訪談逐字稿或敏感資料,動手前先確認研究倫理委員會(IRB)規範與受訪者同意書是否涵蓋「AI 輔助分析」——這不是 CLI 技巧,是每個場景都要先過的關卡。

場景一:多代理生產線做課程投影片

Emory University 計量經濟學教授 Pedro Sant'Anna 要為研究所課程「Econ 730: Causal Panel Data」產出上百張 Beamer 投影片、可互動的 Quarto 簡報,還要維持論文級的排版與內容品質——一個人手工做格式校對會吃掉所有研究時間。他把整套流程開源成 claude-code-my-workflow(GitHub 約 1.4k stars、2.7k forks,MIT 授權;作者自陳有 15+ 研究組跨經濟、能源、政治學、工程領域採用)。

Claude Code 怎麼做

  1. 環境需求:Git、Python 3.9+、Claude Code、XeLaTeX、Quarto、R、pdf2svg、gh CLI。
  2. 設定 14–18 個「窄職能」reviewer subagent,不是一個萬用 agent:proofreader(文法錯字一致性)、slide-auditor(版面間距)、pedagogy-reviewer(依 13 種教學法框架審查)、r-reviewer(程式碼品質與可重現性)、tikz-reviewer(圖形批評)、quarto 的 critic/fixer 對抗式配對,以及模擬完整同儕審查的 domain-reviewer / methods-referee / editor。
  3. 核心 slash 指令包含 /create-lecture/review-paper --peer <期刊>(模擬 editor 加 2 位「刻意不同立場」referee,把問題分成 FATAL/ADDRESSABLE/TASTE 三級,對 AER、QJE、JPE、Econometrica、ReStud 五本期刊校準)、/qa-quarto/compile-latex/audit-reproducibility
  4. 品質閘門機械化:每個產物打 0–100 分,/commit 擋 80 分以下(要覆寫必須明講理由)、PR 要 90 分、卓越等級要 95 分;對抗式 critic-fixer 迴圈跑到「連續 2 輪乾淨」或封頂 5 輪才停。
  5. 搭配 hooks 自動化:壓縮 context 前先快照、git 護欄擋 reset --hardclean -fpush --force、腳本改動時自動核對先前的宣稱是否仍成立。
$ git clone https://github.com/pedrohcgs/claude-code-my-workflow my-course
$ cd my-course && ./scripts/validate-setup.sh
$ claude
> /create-lecture "Econ 730 Week 6: Difference-in-Differences with Staggered Adoption"
> /review-paper --peer AER

成效:累計產出 800+ 張 PhD 課程投影片、互動 Quarto 簡報與 R 複製包;使用者回報把研究助理的時間從「排格式」轉到「高價值的智識工作」。

換成 Codex CLI

同一套 academic-research-skills 有 Codex 原生移植版本(academic-research-skills-codex),指令與流程對齊,可在 Codex CLI 執行,Codex 側同樣用 AGENTS.md 承載規範。但要老實講:Sant'Anna 本人這套範本吃的是 Claude Code 專屬的 subagent 與 hooks 機制,Codex 要複刻同等的「多代理覆核 + 機械化品質閘門」,得自己用 codex exec 手動串接,不是開箱即用。

場景二:訪談逐字稿主題編碼與引用查證

質性研究者手上一堆訪談逐字稿,要做主題編碼(thematic coding)、跨稿找矛盾、產證據表——手工用 Ctrl+F 對照要花好幾天。ccforeveryone 針對研究者寫的指南示範了一套不用寫程式的 Claude Code CLI 工作流。

Claude Code 怎麼做

  1. 整理素材:一份訪談一個 markdown 檔,命名一致(如 p01-maria.md)。
  2. 把 CLAUDE.md 當「研究日誌」(約 200 行):寫清楚專案描述、研究問題、codebook(編碼簿)、決策日誌、誠信規則。
  3. 分批編碼:一次處理 5–8 份逐字稿,要求輸出「主題 + 逐字引句 + 檔名 + 位置」。
  4. 找矛盾:問「受訪者在哪裡意見分歧」,再把發現對照研究假設。
  5. 查證(最關鍵的一步):把每一句被引用的字串回頭在原始檔案裡搜一次,標出「找不到」的引句——防捏造、也防被「潤飾得更通順」。
  6. 綜合:把各批摘要併成 themes.md(可回溯引用的主題)與證據表 evidence-table.csv
  7. 想加速可平行處理:一次開 5 個 subagent,各處理 2 份逐字稿;但開跑前 codebook 一定要先釘死在 CLAUDE.md,否則五個 agent 會各自對同一個抱怨取五個不同名字,產出互不相容的主題清單(codebook drift)。
> 讀 interviews/p01-maria.md 到 p08-*.md 這 8 份逐字稿。
> 依照 CLAUDE.md 裡的 codebook 做主題編碼,每個主題附:逐字引句、檔名、行號位置。
> 編完後,把每一句被引用的原文回頭在來源檔案裡搜一次,標出「搜不到」的引句。

成效:把「好幾天手工編碼」壓到「一個下午的覆核」,產物包含 themes.mdevidence-table.csv(審計級:引句對來源)與一份「所有引句都逐字存在於來源」的查證報告。

換成 Codex CLI

Codex CLI 目前找不到質性研究訪談編碼的第一手案例,但用它的通用能力應該也能做到類似效果:Codex 一樣能批次讀多個 markdown 檔,依你在 AGENTS.md 定義的 codebook 規則整理輸出。只是這個場景沒有具名研究者實測過,引用查證這一步(把每句引文回搜原始檔)需要你自己在 prompt 裡明講,不能假設它會主動做。

場景三:研究資料 EDA 與統計建模的防呆紀律

社會科學/行為科學研究者要跑探索性分析、統計建模、產圖表、稽核既有分析腳本——最怕 AI 悄悄丟掉遺漏值那一列或把它補成 0 卻不講一聲。Thomas Manandhar-Richardson("Richie",PhD,Bryant Research 研究總監、氣候 NGO Greener By Default 首席資料顧問)寫了一篇「同時用 Claude Code 與 Codex CLI 做社會科學研究」的第一手學習筆記。

Claude Code 怎麼做

  1. CLAUDE.md 是最高槓桿的一件事:寫清楚專案目的與交付物、人類可讀的資料夾命名(別用 tmp 這種)、永不刪檔(要清就移到 project-trashcan/)、raw_data/ 原始資料保護、別用電腦科學家的語言溝通。
  2. 檔案結構固定分工:raw_data/(防覆寫)、analysis_code/outputs/graphs/outputs/tables/(markdown 摘要表)、write-up/
  3. 靠視覺化驗證而非讀程式碼:刻意「比平常多產很多圖與表」,用輸出檢查抓錯。
  4. 定期稽核:叫 agent「看這份 R/Python 腳本,有沒有哪裡怪怪的」。
  5. 不用 Jupyter notebook(對 Claude 來說像一份超長的 JSON),改用 hydrogen notation(# %% cell 標記的純 Python 腳本),VS Code 可互動執行、AI 又讀得懂;每張圖獨立一個檔,方便快速迭代不用重讀整份長腳本。
  6. 委派重要任務前先問 agent:「你知道你在幹嘛、為什麼這樣做嗎?」確認它真的懂概念再放行。
CLAUDE.md 摘錄:

- raw_data/ 底下的檔案永遠不可覆寫或刪除,要清就移到 project-trashcan/
- 遇到遺漏值:明講怎麼處理(刪列/補值/保留 NA),不可以靜默丟棄或補 0
- 每個統計方法選擇前,先檢查常態分布假設是否成立
- 別用電腦科學家的語言跟我溝通,用社會科學研究者聽得懂的說法
> 看 analysis_code/model_v3.py,有沒有哪裡怪怪的?特別檢查遺漏值是怎麼處理的。

成效:作者稱「從沒這麼有生產力過」,並預測「最終所有科學家都會把這類工具當研究主力」。

換成 Codex CLI

這是少數有第一手直接對照的場景——Richie 在同一篇筆記裡明講:Claude Code 贏在問題解決與推理、對研究任務的脈絡理解、過程溝通清楚,更適合以研究者為中心的工作流,但有用量限制Codex CLI(走 ChatGPT Plus)贏在複雜軟體工程問題,但這類問題在社會科學研究「相當罕見」,對典型社科任務反而較不順手。

場景四:生醫與基因體研究——官方點名的實驗室案例

計算生物與濕實驗研究者要跨 PubMed、10x Genomics、BioRender、單細胞 QC 等各自孤立的工具做完整流程;或要對 CRISPR 敲除實驗的基因分群做生物學詮釋。這是 Anthropic 官方部落格點名具名實驗室的成效案例。

Claude Code 怎麼做

  1. Stanford 的 Biomni 平台把過去要寫客製 pipeline 的分析,改成用自然語言對一個「總協調 agent」下指令,由它規劃並串接上百個工具與資料庫執行:GWAS 分析從「數月」壓到「20 分鐘」;30 人穿戴裝置的 450+ 檔資料,從估計「3 週」做到「35 分鐘」;分析 33.6 萬個單細胞的基因活性,確認已知關係並找出新的轉錄因子。
  2. MIT Whitehead(Cheeseman Lab)的 PhD 生 Matteo Di Bernardo 建了 MozzareLLM,自動詮釋 CRISPR 實驗的基因分群、找共同生物過程、並替每個判讀標信心等級。Cheeseman 本人的評語是 Claude「一直抓到我漏看的東西……每次都是我們能理解也能驗證的發現」,判讀水準比對到有 5 年以上經驗的博後。
  3. Stanford Lundberg Lab 用分子關係圖(蛋白交互、結構相似)讓 Claude 導航,依分子性質而非既有文獻生成假設,正用來驗證初級纖毛(primary cilia,這是研究不足的結構)。
  4. Claude Code 的生命科學 plugin marketplace 把 PubMed 自動搜文、10x Genomics Cloud 的 single-cell RNA-seq 分析與 QC、BioRender 產可發表科學圖整進同一個環境,不用在多個平台間切換帳號貼資料。
> 幫我分析這批 CRISPR 敲除實驗的單細胞分群結果,找出每群共同的生物過程,
> 並標出你對每個判讀的信心等級(高/中/低),信心中等以下的標出需要人工複核的理由。

換成 Codex CLI

Codex CLI 目前找不到生醫/基因體研究的第一手案例,但用它的通用能力應該也能做到類似效果:OpenAI 官方案例裡,NVIDIA 研究員用 Codex 做的正是同一類事——發想研究方向、撰寫機器學習基礎設施腳本。搬到生醫情境,理論上可以用來寫資料清理或 pipeline 串接腳本,但目前沒有具名生醫實驗室公開示範過,沒有真實數字可以佐證。

常踩的坑

  • 引用捏造率跨研究從 7.7% 到 95% 都有(達人實測,ccforeveryone):每個文獻宣稱都要綁檔案位置或原始資料庫做端到端查證,不能只看它排版漂亮的總結就交差了事。達人個人
  • 遺漏值可能被悄悄丟棄或補 0 卻不告訴你(Richie 第一手達人實測):統計建模前務必在 CLAUDE.md 明講處理規則,並定期抽查程式碼,這是不分工具的 LLM 通病。達人個人
  • 平行處理多份逐字稿或多篇文獻時,若沒把 codebook 或分類規則先釘死在 CLAUDE.md,幾個 subagent 會各自產出互不相容的結果(ccforeveryone 達人實測,codebook drift)。達人個人
  • 隱私與研究倫理:逐字稿、病歷等敏感資料傳到雲端伺服器分析前要先去識別化,並確認 IRB 與受訪者同意書是否涵蓋「AI 輔助分析」——Michigan、Northeastern、Pitt 等校已於 2025–2026 加了 AI 揭露要求(達人實測 + 校方政策)達人個人;社群端(Hacker News 討論串)也提醒「學術 skill 是 cite injection 的攻擊向量」,值得留意。社群

延伸資源