• 轉發 @不是鄭小康: 最近看了大量 X 和 YouTube 上的 FSD v12,主要是 Whole Mars Catalog、Edge Case 和 AI DRIVER 這三位。一句話總結,FSD v12 相比 v11 在一些基礎體驗上出現了難以理解的倒退,但依然是當之無愧的城市輔助駕駛領域的 ChatGPT 時刻。

以下是具體分析。

  • 對於即將達到導航目的地這個場景,FSD v12 第一個行為是學會了靠邊貼近路沿停車,而不是 v11 那樣停在路中間請求接管。後面 FSD 衍生出 3 種隨機的行為:

1. FSD v12 會在抵達目的地前 50 - 100 米看到車位直接拐進去,然後駐車。

2. FSD v12 抵達了目的地但視野範圍內沒有停車位,系統會繼續往前開,連續 4 個右轉兜回來,在抵達目的地前找到一個車位停進去,然後駐車。

3. FSD v12 會在抵達目的地前 50 - 100 米,看到別的小巷子,提前拐進去——注意,這個時候 FSD 走的路線和導航是不一致的,導航就會繼續不斷更新路徑規劃——但 FSD 壓根不按導航開,FSD 會繞着目的地周圍轉,直到找到車位停進去,然後駐車。

這三種行為,唯一的共性就是「人也是這麼開的」。這種能力究竟是如何訓練出來的,真的給系統看足夠多「人類開車即將抵達目的地」的視頻,模型就能抽象出這些邏輯嗎?

  • 當前的 FSD v12 的系統後台跑着兩套網絡。有足夠的證據表明,儀表上的可視化信息和高速上運行的 FSD,肯定不是 v12 驅動的,只有城市道路是 v12 驅動。

這一點非常奇特,因為我們看 22 年的特斯拉 AI Day,其實 HW 3.0 的算力已經用得很滿了。

如果我們看儀表上的可視化信息,會發現 FSD 的感知性能其實出現了嚴重的倒退,各種檢測、跳變都不符合 FSD v11 應該有的表現,更不可能是 v12,否則規控不會那麼行雲流水,説明感知的置信度是非常高的。

高速場景從表現看,應該就是 v11,Teslascope 説確實是 v11,特斯拉仍在對高速場景的 v12 進行測試,但未獲官方證實。

即使不談高速,在城市裏特斯拉是如何實現 v12 和另一個僅用於可視化的 BEV 模型同時運行的?

  • 對於人類駕駛員肉眼不太好分辨的老舊減速帶、爛路上看不太清的小凸起和一灘水漬,FSD v11 都當做不存在,FSD v12 的處理和人是一致的——尤其是水漬,人選擇降低車速或打方向繞一下水漬,是因為不想把車搞髒,FSD v12 顯然理解不到這一層,但也會這樣做,Ta 只是學會了人的駕駛方式。
  • 相比 v11,FSD v12 的近身博弈能力取得了巨大的改進,美國也還是有那種沒有交規、人車混行的場景,比如 Csatco 的停車場,FSD v12 需要大量通過和其他交通參與物的意圖交互來進行路徑規劃,其實就是輔助駕駛最終極的場景,這一點上 v12 取得的進步是巨大的。

一個典型的場景是窄路錯車,不侷限於停車場,中國的國道省道縣道鄉道有大量雙向共享,可臨時借道的道路,如果恰好還有臨停車,就非常依賴本車和其他車駕駛員的意圖的交互。

A:你先走?
B:還是你先走。
A:好,那我先走。

這樣的信息交互是僅通過觀察車輛的啓停來實現的,FSD v12 實現了,至少在 AI DRIVER 的測試中實現了一次。

此外,這類場景裏的路口處,有時候對向駕駛員是不打燈的,人類駕駛員很多時候是根據對向車輛的車身姿態——甚至是前輪的轉向角來意會對方接下來的駕駛軌跡的。FSD v12 也可以。

一句話,對於弱甚至是無交規、交通燈光信號的駕駛場景,FSD v12 的表現取得了巨大的進步。

還有類似和對向車輛共享的潮汐變道之類的,語義信息更豐富的交通場景,FSD v12 是 OK 的。

最重要的是,正如特斯拉規控負責人 Paril Jain 説的,特斯拉沒有專門投入資源挨個解決這些場景,許多能力是 FSD v12 看了大量的視頻無師自通的。

當然了,這也使得我們 3 個月前製作的 FSD v11 體驗視頻完全失去了意義。

  • 最意外的 bug:當你開在路上,整條路就你一輛車的時候,FSD v12 的速度設置就會崩潰,會時而加速,時而減速,難以總結其調整邏輯——我有一個猜測:人開車確實不會完全固定一個速度,除非開了定速巡航,難道這也是跟人學的?

沒錯,各種艱難複雜無法編程的場景,看起來 FSD v12 都學會了,但最簡單的 0 障礙物的大直路,FSD v12 表現還不如 Autopilot。

  • AI DRIVER 做了一個實驗,把車帶到一個新的沒繪製任何車道車位信息的小停車場,打開 FSD v12,然後——v12 會不斷錯過唯一的出口,不斷轉圈,你可以腦補一下,類似一個拉磨的驢。

當然,這可能難以稱為一個 bug,只能説至少目前 FSD v12 並未真正獲得一個人類和外界交互的能力。

  • 結論其實非常清晰,正如 ChatGPT 有幻覺、會胡言亂語、沒有完全和人類對齊,但依然掩蓋不了其展現出來的巨大潛力。FSD v12 太正義了,必須要 all in 端到端。

via 小特叔叔的微博