首先看 GPT-4o,這是 OpenAI 最新的旗艦模型。
- 最重要的 feature 是多模態感知,包含了文字、視覺感知以及聲音,目標就是讓 GPT 變得好用。
- 此前語音版 GPT 其實分成了語音轉文字、GPT 生成、文字轉聲音幾個步驟。但是在 GPT-4o 當中,聲音、文字、圖像的推理都是原生融合的。
- 免費版用户可用,付費版用户有更大的容量。
- 如今,已經有超過 1 億用户在使用 ChatGPT。GPT-4o支持 50 種語言,語言種類覆蓋 97% 互聯網用户。
- GPT-4o API 也有提升,2 倍速度提升,降價 50%。
接下來是演示環節,總結看大概這樣幾個能力:
- 實時語音對話有很大的升級,不需要等待模型反應完成,想説隨時説,可以隨時打斷。(圖二)
- 實時語音是有語氣和音色的。現場主持人讓 GPT 講一個睡前故事,語音可以講得 drama 一些,也可以學習機器人發音,還能邊唱邊講故事。(圖三)
- 攝像頭視覺感知。現場演示了聊天的同時調用手機攝像頭,解一道方程題。甚至增加難度,不讓 GPT 直接告訴你答案,讓它一步一步教你如何計算。(圖四)在紙上寫 I ❤️ ChatGPT,也能識別,GPT 會跟你説句感謝。(圖五)如果調用前置攝像頭,GPT 還會感知你的表情,從而判斷你的心情。
- 語音對話實時翻譯,只需要跟手機説,現在你聽到英文,就幫我翻譯成意大利文,聽到意大利文,就幫我翻譯成英文。這樣兩個不通語言的人就能直接對話。
今天現場還發布了 ChatGPT 桌面端 app。桌面 app 同樣是支持實時聊天,GPT 可以閲讀屏幕,利用 GPT-4o 的能力現場解決編程問題。
如果共享一個折線圖,GPT 也會告訴你折線圖上可以得出的關鍵結論。(圖六)
發佈會最後,OpenAI 感謝老黃和英偉達造出很強的 GPU,才能實現這些功能😂
另外,整個發佈會用 iPhone 和 MacBook Pro 演示,已經開始期待下個月的 WWDC了🧐
#42how##chatgpt##openai發佈gpt4o#
via 42號車庫的微博
Invalid media: video