摘要

文章梳理了一個可審計長期記憶系統在 LongMemEval-S 基準上的評估數據,其確定性檢索鏈使用混合候選檢索、交叉編碼器重排、覆蓋優先的數據包編譯與確定性推理支架,最終由 LLM 充當可替換的末端閲讀器。

內容總結

  • 該檢索鏈在 470 道可答題中將全部金標會話納入候選池的比例為 468/470,生成金標完整數據包的比例為 462/470。
  • 使用通過未鎖定 CLI 別名調用的 Claude Opus 閲讀器進行兩次 500 題測試,得分分別為 479/500 和 475/500(GPT-4o 評判)。
  • 72 道可答知識更新題使用了實質性修改過的評分提示詞,該提示詞在官方文本下的效果尚未被測量;該組成績與 Chronos High 已公佈的 478/500 分處於交叉狀態,差異來源包括閲讀器代次、評分提示詞、可能的數據版本以及系統內方差,文章表示這些差異既不能確立優越性也不能確立等價性。
  • 同一批數據包上 grok-4.6-high 閲讀器得分為 476/474,而最大推理努力度的智能體變體退化至 461/465;兩次頭條測試在八行判定翻轉上存在差異。
  • 第二評判者在每輪測試中與頭條評判者在 493/500 行上一致(98.6%),且對兩輪均給出 472/500 分;官方評判者在重新評分字節相同的首輪答案時也翻轉了三個判定。
  • 所有組件均在同一組 500 道題上開發,沒有留出評估集或獨立人工裁定;檢索與支架方法來源及轉錄衍生審計被保留;頭條閲讀器獲得了額外的操作者上下文,其完整請求未被保留,MCP 工具可用性尚未解決。文章發佈了物化數據包、支架、閲讀器輸出、評判者判定和控制項以供檢查和重新評分。

來源:arXiv · 09-30 01:04(北京時間)