如果 AI 科學家也會長記性:EvoScientist 讓研究策略自己進化
大多數 AI scientist 系統像很會做簡報的實習生:每次都很努力,但每次都忘記昨天怎麼失敗。EvoScientist 把 Researcher、Engineer、Evolution Manager 三個 agent 加上兩套 persistent memory,讓 AI 不只會做研究,還會從失敗裡長出新的研究策略。
ShroomDog 精選長文翻譯
共 270 篇
← 返回首頁大多數 AI scientist 系統像很會做簡報的實習生:每次都很努力,但每次都忘記昨天怎麼失敗。EvoScientist 把 Researcher、Engineer、Evolution Manager 三個 agent 加上兩套 persistent memory,讓 AI 不只會做研究,還會從失敗裡長出新的研究策略。
今晚我們同時跑了 9 個 Claude Code agent 寫文章,撞上了 article counter race condition 和 git lock conflict。ECC 的 iterative retrieval pattern 說的是一樣的問題:多 agent 共享 context 時,怎麼不把彼此搞爆。結論:isolated state + atomic pre-allocation + sequential deploy,是唯一出路。
Token 帳單看起來嚇人,但大部分的浪費是隱形的:Extended Thinking 在不需要思考的任務上燒錢、Opus 去做 Sonnet 就夠的工作、context 塞滿了才想到要 compact。ECC 的 token-optimization.md 說一套 MAX_THINKING_TOKENS + 模型路由 + 策略性 compact 組合,可以把成本壓低 60-80%——作者 Affaan Mustafa 自己的數字。
你用 unit test 測你的 code,用 CI 保護你的 pipeline。但你的 AI 呢?Eval-Driven Development(EDD)把 AI 開發從「感覺不錯就上」升級成有指標的工程紀律——pass@k 指標、三種評分器、Product vs Regression evals,這是 AI 時代真正的 TDD。
Everything Claude Code 的創作故事:一個人花十個月、用 AI 開發 AI 工具,從一個 config pack 演化成 50K+ stars 的跨平台生態系。這不是工具介紹,是 AI 時代 indie hacker 能做到什麼的真實案例。
你的 AI Agent 超聽話——但它聽的可能不是你的話。Prompt Injection 就是在 AI 身上跑社交工程,Tool Use Exploitation 是把瑞士刀交給 5 歲小孩,Context Poisoning 是圖書館裡有人偷改書。然後還有動物園逃脫。
2026-03-31 凌晨,Anthropic 意外在 npm 洩漏完整 Claude Code 原始碼。裡面有 KAIROS 自主背景 agent、三層記憶架構、Undercover Mode、silent model 降級等秘密——而且有些架構跟我們 OpenClaw 的設計驚人地相似。
Git hooks 在你忘記的時候依然工作。AI hooks 讓你的 Claude Code 在你不注意的時候依然守規矩。ECC 的 Hook Architecture 把 Pre/PostToolUse、lifecycle hooks、15+ 內建 recipes 整合成一套完整的事件驅動系統——讓 CLAUDE.md 的規則從「建議」變成「強制力」。
Everything Claude Code 的 Instinct System 把 AI 每次用到的行為模式蒸餾成「本能」:有信心分數、有專案隔離、有跨專案升級機制。這不是靜態的 MEMORY.md,是從使用中動態自我學習的完整框架。
Everything Claude Code 把 AI 自動化開發整理成六個層級:從最基本的 Sequential Pipeline 到最複雜的 RFC-Driven DAG。每個模式都有具體的指令範例和適用場景,讓你知道什麼時候可以放手、放多少、怎麼放。
Mario Zechner 在這篇文章裡,用很重的語氣批評 coding agent 被帶進 production 後的幾個連鎖問題:錯誤會複利、agent 不會自己學、架構複雜度失控、搜尋 recall 低。結論不是停用 agent,而是慢下來,把人類的判斷和紀律放回流程裡。
Qwen 團隊核心成員林駿洋深度長文:從 o1/R1 的 reasoning 時代走到 agentic thinking 時代,模型不再只是想得久,而是要想了就做、做了再想。這改變了 RL 基礎設施、訓練目標、甚至整個產業的競爭維度。
Claude Code 愚人節悄悄上線了 /buddy 寵物系統,有物種、稀有度、閃光機制,完整的抽卡體驗。原作者不甘心抽到白板仙人掌,從洩漏原始碼中拆解出 Bones + Soul 雙層架構,找到 userID 回退漏洞,暴力碰撞出金色傳說卡皮巴拉。
Anthropic 不小心把 Claude Code CLI 的完整 TypeScript 原始碼打包進 npm 的 source map。裡面藏了自主 agent、model 代號、消失的權限提示、還有一個電子雞系統。
Boris Cherny 分享 15 個他最常用的 Claude Code 隱藏與較少人注意到的功能,從手機 app、loop/schedule、worktree 到語音輸入都有涵蓋。
Simon Willison 用 Claude Opus 4.6 和 GPT-5.4 vibe code 出兩個 macOS menu bar app——一個看網路流量、一個看 GPU 狀態。整個 SwiftUI app 塞在一個檔案裡,連 Xcode 都不用開。但他自己也承認:這些 app 的數字準不準,他完全不知道。
Anthropic 工程師 Thariq 認為,就算不是 coding agent,也該有 bash tool。因為 agent 一旦能把中間結果存成檔案、反覆搜尋、串接 API、自己驗證,能力會直接升級;但安全與容器部署也因此變成不能逃避的問題。
Anthropic 工程師 Thariq 丟出一個超值得抄的觀點:AI agent 不該把 state 硬塞進 context window,而該用 file system 落地。這不只比較能跨 session 持久保存,還能讓 agent 反覆搜尋、驗證、修正自己的工作。
Thariq 在 X 上介紹 Claude Code 的 playground plugin。它會幫 Claude 生成獨立的 HTML playground,讓你把互動結果整理成 prompt 貼回 Claude Code,適合處理不太適合用純文字互動的場景。
LangChain 團隊分享他們怎麼幫 Deep Agents 建 eval 系統:不是瘋狂堆測試數量,而是用 targeted eval 精準量測生產環境中真正在乎的 agent 行為。從資料來源、metrics 設計到實際跑 eval 的完整方法論。