
OpenAI之GPT-5.6 Sol超越Anthropic的Claude Opus 5於ARC-AGI-3基準
近期,人工智慧領域的兩大巨頭OpenAI和Anthropic之間的競爭再度引起關注。OpenAI宣佈其最新模型GPT-5.6 Sol在ARC-AGI-3基準测试中取得了38.3%的成績,超越了Anthropic的Claude Opus 5的30.2%。這一成績不僅表明OpenAI在人工智慧技術上的進步,也引發了對基準测试的設置和公平性的討論。
基準测试的設置和爭議
ARC-AGI-3基準测试是一個設計用於評估人工智慧模型的邏輯推理能力的基準。然而,OpenAI並不是使用官方的測試環境,而是通過其自己的Responses API以"保留推理"和"壓縮"的方式運行GPT-5.6 Sol。這種方式使得模型可以保留其推理過程中的鏈式思維,並對舊有上下文進行壓縮,而不是簡單地截斷。這一做法引發了爭議,因為官方的測試環境並不允許使用這種方式。
ARC Prize的共同創始人François Chollet對此做出了回應,他指出基準测试的設置應該區分為兩種:一種是為了解決基準测试或包含基準格式知識的自定義設置,另一種是為所有API用戶提供的一般用途API設置。Chollet認為,後者是合理的,只要設置和成本明確報告即可。這一觀點基本上是承認,ARC Prize自己的GPT-5.6 Sol評分對OpenAI不公平。
對未來的影響和展望
這一事件不僅反映了OpenAI和Anthropic之間的競爭,也引發了對基準测试設置和公平性的思考。隨著人工智慧技術的不斷進步,如何設計和設置基準测试以公平地評估不同模型的能力將成為一個重要的課題。未來,人工智慧領域的競爭將不僅僅是模型能力的競爭,也是基準测试設置和評估方法的競爭。
對於用戶和開發者而言,了解基準测试的設置和評估方法至關重要。只有透過明確和公平的基準测试,才能真正評估出不同模型的優缺點和實際能力。因此,未來的基準测试應該更加注重公平性和透明度,讓用戶和開發者能夠更好地理解和評估人工智慧模型的能力。同時,基準测试的設置也應該不斷更新和完善,以適應人工智慧技術的快速進步。