摘要
獨立評測項目 Assistant Benchmark 開始用真實任務橫評個人 AI 助手,Muse 在已完成的 7 個評分維度中平均 9.1 分暫列第一,領先 Instinct 和 Grok Bot。
內容總結
- 該評測讓 Agent 執行訂酒店、選餐廳、買東西、回郵件、連接第三方服務等真實任務,按實際完成情況打分,每個評分維度有公開的固定任務,並要求有真實運行記錄才給分。
- 目前 Muse 在已完成的 7 個評分維度中平均 9.1 分暫列第一;Instinct 測完 11 個維度平均 8.4 分;Grok Bot 測完 7 個維度平均 7.3 分;Muse 在購物、郵件和第三方應用連接上均拿到 10 分。
- 該榜被描述為持續更新的真實體驗榜,Muse 的 9.1 分僅為已測 7 個維度的平均分,並非完整成績;每個維度目前只用一個固定任務測試,後續補測後分數和排名都可能變化。
📊 標的:xAI
來源:X 動態監測 · 09-15 12:14(北京時間)