OpenAI 在美國時間 9 月 3 日發表了 GPT-6 Astra,換算成台灣時間已經是 4 日。Astra 的上一代 GPT-5.6 Sol,對手那邊則有 Anthropic 的 Fable 5.1。最近模型更新速度很快,所以新模型一出來,大家想知道的通常就是兩件事:比上一代進步多少,跟對手比起來又有甚麼差別。

OpenAI 在提供的對照表中,把 Astra 和 Sol、Fable 5.1 等幾個現在排名較高的模型排在一起比較。可以看到跟 Sol 比的部分沒有懸念,領先的都是 Astra。像是 Terminal-Bench 4.0 這一項(在終端機裡把交代的任務做完),Sol 完成不到四成,Astra 接近六成,這個差距是可見的(但聽說有些 AI 會偷看,因此參考就好)。

不過同一列換成 Fable 5.1,差距就縮到兩個百分點左右。整體看下來,Astra 贏 Fable 5.1 的項目比較多,但也有反過來的時候,像是 Humanity’s Last Exam 這份收集各領域難題的考卷,而在可以用工具的版本裡,Fable 5.1 反而高了將近八個百分點。

所以光看 OpenAI 的表,Astra 對 Sol 是全面領先,跟 Fable 5.1 的差距則小得多。而獨立評測機構 Artificial Analysis 把多項測驗合起來,算成單一的綜合指數,目前的版本裡,兩邊都開到最高設定(max)時,Astra 和 Fable 5.1 都是 53 分。這種綜合指數看不出贏的項目跟輸的項目是哪些,只有總分,所以如果想知道哪個會比較適用,還是要看做的是哪一類工作。

那既然能力差不多,價錢就成了比較實際的問題。目前 Astra 每個 token 的價錢是 GPT-5.6 Sol 促銷價的 2.5 倍,跟 Fable 5.1 的輸入、輸出單價則是一樣的(快取讀取反而是 Fable 5.1 比較便宜),所以只看單價,從 Sol 換過來是變貴,從 Fable 5.1 換過來也沒有比較便宜。不過 Artificial Analysis 在剛剛提到的評測裡,也算了每個任務平均要花多少錢,Astra 是 3.26 美元,Fable 5.1 是 7.63 美元,Astra 大約只要四成。但是價錢這部分就只能期待各個公司的持續軍備了。

單價差不多,總花費卻差了許多,我們可以看得出來是完成任務到底要花多少 token。有點像搭計程車,每個 token 的價錢是跳表的費率,費率差不多的兩台車,跑的路長短不同,有些會走高速公路,有些繞小路,有時候又會遇到塞車,付的錢也就不同。

最後說明這篇是照 OpenAI 的公告與 API 文件、Anthropic 的 Fable 5.1 公告,以及 Artificial Analysis 目前公布的數字寫成的,讓大家參考,以後新模型可能也會有新價錢或新算法。