摘要
arXiv 論文提出 APEX-Voice 基準,用 120 個交互式專業工作流測試五款實時語音智能體,結果顯示無一在 Pass@1 上超過 25%。
內容總結
- 論文稱,APEX-Voice 覆蓋表單填寫、企業談判、協調、諮詢、面試等十類工作原型,共 120 個交互式專業工作流。
- 每個工作流在有狀態的 Voice Workbench 環境中執行,包含任務專屬知識、類型化工具、人工標註的最終工作產物、授權約束,以及基於預編譯語音實現的用户模擬策略。
- 評測同時考察產物字段準確率和端到端工作流成功率,後者要求正確的終止狀態、有效流程、已完成動作和有效的最終產物。
- 對 GPT-Live-1、Gemini-3.8-Live、Grok-Voice-Think-2.0、Step-Audio3 和 GPT-realtime-2.1 五款前沿實時語音智能體的測試中,無一在 Pass@1 上超過 25%,最佳 Reliable@3 僅為 10.8%。
- 論文稱,有狀態協調是所有系統的主要失敗點,需要更多知識檢索和語音中途糾正的工作流成功率進一步下降。
來源:arXiv · 09-28 19:53(北京時間)