Qwen 3.8 27B 很優秀,但預設會瘋狂想太多
Qwen 3.8 27B 是可在筆電上跑的 27B 開源視覺模型,基準看起來很強,但預設推理深度太高,會為簡單題目想太久。關掉或調低推理後仍然好用,視覺框選與寫程式 Agent 都有表現,瓶頸是速度。
ShroomDog 精選長文翻譯
共 270 篇
← 返回首頁Qwen 3.8 27B 是可在筆電上跑的 27B 開源視覺模型,基準看起來很強,但預設推理深度太高,會為簡單題目想太久。關掉或調低推理後仍然好用,視覺框選與寫程式 Agent 都有表現,瓶頸是速度。
更好的決策不是來自更多資訊,而是來自更好的思考方式。這篇文章用第一性原理、機會成本、二階思考、複利、誘因、機率思考與逆向思考,說明日常選擇如何長期改變人生軌跡。
度假幾週沒用 AI 回來後,作者看清自己把 Agent 當拐杖與逃避壓力的緩衝,計畫往後刻意決定何時用、何時不用,讓人當主迴圈、偶爾才把 Agent 叫進來。
「軟體從來不是最難的部分」已經變成 AI 時代的口頭禪。但如果寫 code 真的那麼簡單,軟體為什麼還是一堆 bug、工程師為什麼過勞成災?Senko Rašić 反擊:兩邊都重要,自我安慰解決不了問題——而且絕對不要把理解力、判斷力和品味外包給 AI。
把 OpenAI 的 GPT‑Live 即時語音,從「會講話的聊天框」改造成可卡詞、可重講、可反覆刷情境的英語口說陪練。含新手鎖定指令、五個出國情境、雅思口說刷題與五分鐘回顧,並同時交代免費與付費方案可用的能力。
Matt Pocock 在 aihero.dev/skills 公開一套給真正工程師用的小型可組合 agent skills:18 個工程類、7 個生產力類,涵蓋對齊、規格、拆票、實作、回饋與維護。兩種安裝路線、由人或模型啟動的分層,以及為什麼它不做成吞掉控制權的大流程。
Databricks 用自家數百萬行程式碼庫的日常任務測試 coding agent:同一模型、同一推理強度,只換 harness,部分案例的單題成本相差超過兩倍,品質維持不變;Pi 每輪送出的 context 約為比較對象的三分之一。模型與 harness 必須一起納入整體工程成本。
卡茲克開源 human-writing 1.1:去 AI 味不該停在禁句表。材料不足就研究、追問或縮短;每段真的推進;意思到了就停。修辭動作比字面黑名單更重要。
Greg Isenberg 一口氣丟出 26 個 AI 時代的創業方向。從 agent 需要刷卡、到 AI 產出太多反而需要判斷層、到所有人都累壞了的倦怠經濟——每一條都指向一個正在裂開的市場縫隙。
MCP 2026-07-28 規格書正式發布,核心變革是從有狀態雙向協定轉為無狀態請求/回應架構。同時帶來 MRTR、HTTP header 路由、可快取列表、授權強化,以及正式的擴充框架與十二個月棄用政策。
Adam Hunt 從看多翻看空:最近幾代模型看起來只有程式和數學那根刺在長,語言和邏輯停滯、有時還退步。他只給自己四成信心,希望未來一兩年被證明是錯的。
Kun Chen 花了大約兩週,刻意把模型大小與推理強度的每種組合反覆用過,用出一組直覺:模型大小給的是「智慧」(見識、直覺、跨域連結),推理強度給的是「勤奮」(徹底評估、邊界案例),兩者不能互換。他認為 Benchmark 的一維分數就是大家搞混的原因。
華府傳出考慮禁止美國公司使用中國 open weights 模型,科技業連署支持 open weights,也有人指控 Anthropic 想禁它來保護生意。Dario Amodei 出面否認,並列出他真正支持的三件事:管晶片、擋工業規模的蒸餾、強制測試所有夠強的模型。最深的一段藏在註腳裡——讓人類到今天還沒出事的,可能不是防守方。
網路上有數百支「如何記住讀過的每一件事」的影片,加起來數百萬次觀看。Dan Koe 的說法是整件事的方向就錯了:記憶不是輸入問題,是回饋系統問題。這篇談舵手式學習的四個零件、為什麼第二大腦會變成想法的墳墓,以及一套真的撈得出東西的筆記與寫作流程。
Letta 開源 trajectory,把 Claude Code、Codex、OpenClaw 等 harness 留下的工作紀錄,正規化成同一種寫給 agent 讀的格式;在抽樣到的紀錄上,token 數壓到原生的五分之一左右。跨 harness 學習的前提,是先替每個 harness 產出的經驗訂一種標準格式。
Ghostty 創作者 Mitchell Hashimoto 分享一個反直覺觀察:他的終端機 app 花 18 個月累積到每天百萬次更新檢查,但底層函式庫 libghostty 只花 2 個月每日用戶就突破數百萬。軟體世界的權力中心正在從「做出最好的產品」轉移到「提供最好的積木」。
Agent 評估不能只看回覆,還要檢查任務結束後的世界是否真的改對。Anthropic 整理評分器組合、非確定性指標、環境隔離與長期維護的方法;不用等幾百題,先把 20–50 個真實失敗變成測試。
安全研究者示範一種隱密資料外洩手法:把超連結做成鍵盤,讓 Claude 一個字元一個字元地「打字」洩漏使用者的姓名、公司、家鄉——而使用者只看到咖啡店菜單。
同樣的參數量,模型矩陣的長寬與層數會決定 GPU 是全速計算,還是忙著搬資料、浪費邊角磁磚。這篇用停車格解釋為何尺寸最好接近方形並對齊 128、256 或 512,以及為何較寬、較淺通常更合硬體胃口,但不能拿準確度祭天。
Demis Hassabis 認為 AGI 可能只差數年,現在仍有機會替最危險的模型建立共同門檻。規則太緊,可能只剩安全但無用的模型;太鬆,又可能讓守規矩的人眼看別人部署真正危險的能力。