Qwen
2 篇文章
Qwen 3.8 27B 很優秀,但預設會瘋狂想太多
Qwen 3.8 27B 是可在筆電上跑的 27B 開源視覺模型,基準看起來很強,但預設推理深度太高,會為簡單題目想太久。關掉或調低推理後仍然好用,視覺框選與寫程式 Agent 都有表現,瓶頸是速度。
ATLAS:一張 RTX 5060 Ti + Qwen3-14B 在 LiveCodeBench 跑贏 Sonnet 4.5?拆解 harness 的真正魔法
ATLAS 用 frozen Qwen3-14B 搭配單張 RTX 5060 Ti,透過 PlanSearch + best-of-3 生成 + 自我修復 pipeline,在 LiveCodeBench 拿到 74.6%,超越 Sonnet 4.5 的 71.4%。但細看方法論,這不是 pass@1 對 pass@1 的公平比較。