mogu-picks
93 篇文章
DeepSeek-R1 的腦內小劇場——單一模型自己長出多重人格辯論
DeepSeek-R1 透過純 RL 訓練,自發發展出腦內多角色辯論機制。Google 研究稱之為「思想社會」——AI 的突破不是單一天才,而是一群吵架的內在角色。這對 agent 工程意味著什麼?
在 CLAUDE.md 裡加一段話,讓 AI 幫你記住每一個技術決策——再也不用花 30 分鐘重新辯論
Paweł Huryn 分享了一個簡單但威力驚人的做法:在 CLAUDE.md 裡加一段指令,讓 Claude 自動記錄每一個架構決策。從此不再花 30 分鐘重新辯論「為什麼選 Postgres 不選 DynamoDB」,因為推理過程都白紙黑字寫在 /decisions/ 資料夾裡了。
Anthropic 開了一個科學 Blog — 當 AI 變成研究生,誰來當指導教授?
Anthropic 推出 Anthropic Science 科學 blog,記錄 AI 如何協助真實科學研究。物理學家把 Claude 當研究生用、Trillion Gene Atlas 要蒐集一億物種基因、三大 AI 巨頭的科學研究路線之爭 — 這篇帶大家看完整張地圖。
Claude Code 用量爆炸:Anthropic 官方承認 rate limit 被打太快了
Anthropic Claude Code 團隊的 Lydia Hallie 公開承認,使用者撞到 usage limit 的速度遠超預期。團隊正在調查中,後續會更新。
Simon Willison 的 AI 現況報告 — 拐點已過、暗黑工廠要來了、中年工程師最慘
Django 共同創作者 Simon Willison 上 Lenny's Podcast 做了一場 AI 現況總盤點:2025 年 11 月是真正的拐點、coding agent 讓他 11 點就燒乾、Dark Factory 時代即將到來、中年工程師是最慘的那群人 — 還有一個他稱為「致命三連」的安全隱患。
17,871 個 Thinking Block 追出 Claude Code 「變懶」真相
一個 power user 分析了 6,852 個 Claude Code session、17,871 個 thinking block,用數據證明 CC 確實「變懶」了 — Read:Edit ratio 從 6.6 跌到 2.0。然後 Anthropic 工程師 Boris Cherny 出來解釋了真正的原因,以及怎麼修。
Super IC 時代 — 一個人 + AI 大軍,幹掉整個部門
AI 時代最值錢的人不是某個領域的頂尖專家,而是能指揮一支 AI agent 大軍、一個人走完整條產品線的 Super IC。從 IC 到 Generalist Orchestrator 的轉型正在發生。
Karpathy 的痛點不是寫 code — 是部署那堆鬼東西
Karpathy 發現 vibe coding 寫 code 超爽,但部署才是地獄。他和 Stripe CEO Patrick Collison 的對話揭示了下一個戰場:整個 DevOps 生命週期都必須變成 code,AI agent 才能真正接管。
在兒童遊樂場指揮 AI 大軍 — Paweł Huryn 的 48 小時 Claude Dispatch 實驗
Product Manager Paweł Huryn 在兒童遊樂場用手機指揮 Claude Dispatch 跑了 48 小時實驗,25 分鐘的指令時間換來超過 3 小時的平行 AI 產出。當 PM 從「自己做」變成「指揮 agent 做」,所有零碎的等待時間都變成了生產力。
Karpathy 的 Idea File 宣言 — 在 LLM Agent 時代,分享點子比分享程式碼更有用
Karpathy 把爆紅推文升級成 GitHub Gist「idea file」— 一份結構化的 LLM Wiki 設計藍圖。更大的 meta-point:在 LLM agent 時代,分享純文字的點子比分享完成品程式碼更有價值,因為對方的 agent 會自己客製化實作。
LiteLLM 連環攻擊全鏈解析 — 從 Trivy 到 PyPI,一場教科書級 AI 供應鏈核爆
威脅組織 TeamPCP 透過入侵 Aqua Security 的 Trivy CI/CD,在 LiteLLM 1.82.7–1.82.8 植入三階段惡意 payload,影響 36% 雲端環境與 Mercor AI 等數千組織,造成 TB 級 API 金鑰與雲端憑證外洩。這不是攻擊 AI 模型本身,而是攻擊連接模型與應用的工具層。
Anthropic 花 4 億美金買 9 個人 — 你的 AI 產品是護城河還是 API wrapper?
Anthropic 用 4 億美元收購 9 人生技 AI 團隊,揭示 model provider 吞噬垂直新創的模式。Huryn 提出三道護城河:獨家數據、通路、信任。
29,000 個收藏背後:Paweł Huryn 談會自己長大的知識系統
Karpathy 分享用 LLM 建 personal knowledge base 的心得,被收藏 29,000 次。Huryn 認為真正的殺手功能不是讀,是寫回去 — 當 LLM 能自動更新知識庫,個人 wiki 就變成了個人研究團隊。
一個人 + 四個 AI Agent = 一夜完成 41 個任務:Agent 團隊分工實戰報告
Alexey Grigorev 不再讓一個 AI agent 包辦所有事,而是拆出 PM、SWE、QA、On-Call 四個角色組成 agent 團隊。他在五個真實專案上測試了這套架構,其中一個專案一個晚上自動完成了 46 個任務中的 41 個。
Anthropic 經濟指數報告:越用越會用,AI 的學習曲線效應正在拉開差距
Anthropic 第三份經濟指數報告分析 2026 年 2 月的 Claude 使用數據:用途正在分散化、低薪任務占比上升、老用戶成功率比新用戶高 4 個百分點。越早開始用 AI 的人越會用,這個 learning curve 效應可能正在加深勞動市場的不平等。
Karpathy:寫 Code 是最簡單的部分,組裝 IKEA 傢俱才是地獄
Karpathy 分享他 vibe coding MenuGen 的完整經歷:從 localhost 到部署上線,最痛苦的不是寫程式,而是組裝 Vercel、Clerk、Stripe、OpenAI 等一堆服務的 IKEA 地獄。他認為未來 AI agent 要真正有用,整個 DevOps 生命週期都得變成 code。
Gemma 4 登場:Google 說它用了和 Gemini 3 同樣的突破性技術
Google 發表 Gemma 4 開源模型家族,包含 31B Dense、26B MoE 和 E2B/E4B 邊緣模型,採 Apache 2.0 授權,支援 256K context、function calling、多模態,號稱在 Arena 上打贏 20 倍大的模型。
Karpathy 的 LLM 知識庫工作流 — 讓 AI 幫你蓋維基百科
Andrej Karpathy 分享他最近大量使用 LLM 建構個人知識庫的工作流:把原始資料丟進去,讓 LLM 自動編譯成 Markdown wiki,再用各種 CLI 工具做 Q&A、lint、視覺化。他認為這裡有一個全新產品的空間。
Paweł Huryn 稱:3B active parameters 的 Holo3 在 computer use 上贏過 GPT-5.4 和 Opus 4.6
Paweł Huryn 在 X 上稱,H Company 的 Holo3 在 computer use 任務上勝過 GPT-5.4 與 Opus 4.6,且僅有 3B active parameters。推文還稱它採 sparse MoE,並理論上可在單張 GPU 本地運行。
Ollama 改用 MLX,主打 Apple Silicon 上更快的本地推論
Ollama 表示現在在 Apple Silicon 上改由 MLX 驅動,主打更快的 macOS 高負載推論,並點名 personal assistants 與 coding agents 這兩類場景。