25款模型集体輸給人類:AI仍看不懂很多生活常識
2026-10-08 19:33:43
幣界網消息,OneMillion.AI報導,scale ai 旗下的研究機構 scale labs 聯合 elorian 公布的新評測顯示,25款多模態模型在測試中集體輸給人類,無法理解許多生活常識。研究涵蓋522道開放題,涉及288張圖片和234段視頻,人類受試者的準確率達到93.1%。排名第一的 gpt-6 astra 僅獲得53.6%的準確率,而 gpt-6.1 SOL 和 claude opus 分別為46.6%和44.6%。研究發現,94%的模型失敗與漏看關鍵線索、認錯對象或無法推斷隱含關係有關。社交理解方面,21款模型表現最差,視頻題普遍比圖片題更難。儘管增加推理量,模型表現仍未能趕上人類。
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。
關注WalletJYS官方帳號,及時關注最新動態









