騰訊自建的 Agent 基準 WorkBuddy Bench 測試了自家 CodeBuddy Code 和 Claude Code 的表現。260 道真實工作題分為代碼、Web、辦公、安全四類,7 個模型在兩套 Harness 下進行測試。結果顯示,Claude Code 在 28 組同模型對比中贏得了 17 組,CodeBuddy 僅贏得 11 組。特別是在代碼類題目中,Claude Code 以 7:0 完勝,所有 7 個模型在更換為 Claude Code 後均有得分提升。雖然 CodeBuddy 在 Web 和辦公類題目中以 4:3 小勝,但在安全類題目中則被 Claude Code 以 4:3 拿下。測試結果表明,僅更換 Harness 就能導致成績差異十幾分,因此評估 Agent 的強弱不能僅依賴底層模型。然而,騰訊的榜單也存在不足之處,每類題目僅有 50 到 80 道,社區質疑增加難題是否會改變排名,且測試僅使用了兩套 Harness,未包含 Codex。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

















