A GPT-6 Astra vezeti az ErdősBench rangsorát, miközben az OpenAI nem a matematikára optimalizált

Hírek2026.09.11.19 megtekintés

Röviden:

  • A GPT-6 Astra az első helyet szerezte meg az ErdősBench matematikai teszten: 226 nyitott probléma közül 106-hoz adott megoldást vagy ellenpéldát.[^1]
  • A modell 3,23 pontos eredményt ért el, 43 feladatot teljesen megoldott, további 27 állítást pedig megcáfolt.[^1]
  • OpenAI szerint az Astra matematikai teljesítménye nem célzott, maximális matematikai optimalizálás eredménye, mert a vállalat az önfejlesztésre és az MI-rendszerek biztonságára helyezi a hangsúlyt.[^2]
  • A fejlemény újra felveti, hogyan tudják a matematikusok ellenőrizni és értékelni a gépi rendszerek által egyre nagyobb számban előállított bizonyításokat.[^4]

A GPT-6 Astra az ErdősBench eredményei alapján jelenleg a tesztelt MI-modellek élén áll a nyitott matematikai problémák kezelésében. Az eredmény különösen azért figyelemre méltó, mert az OpenAI vezető kutatója szerint a vállalat nem kifejezetten a matematikai kutatási képességek maximalizálását tekintette elsődleges fejlesztési célnak.[^1][^2]

GPT-6 Astra: első hely az ErdősBench matematikai teszten

Az ulam.ai által publikált ErdősBench 226, az Erdős-problémák által inspirált nyitott matematikai feladatot tartalmaz. A GPT-6 Astra 3,23 pontos értékelést kapott: 106 problémánál ért el eredményt, ezek közül 43-at teljes egészében megoldott, 27 esetben pedig ellenpéldával cáfolta meg az eredeti állítást.[^1][^3]

A rangsorban a GPT-5.6 Sol 3,12 ponttal a második helyen szerepel. A forrás szerint a Sol maximális következtetési beállítás mellett 78 problémát oldott meg, míg az Astra erősebb tudományos fogalmazást mutatott, és ritkábban tett túlzó állításokat a saját eredményeiről.[^1]

A javulás jelentős, de nem korlátlan

Przemek Chojecki, a benchmark fejlesztője a különbséget a matematikai kutatási képességekben elért, hozzávetőleg 5–10 százalékos előrelépésként jellemezte. Értékelése szerint a teszt még messze van attól, hogy a modellek teljesítménye telítődjön rajta.[^1]

„Úgy véljük, hogy a modelleket a matematikai kutatásra fordított további figyelemmel jobbá tehetnénk, de ezt az irányt nem helyezzük előtérbe az önfejlesztés és az automatizált igazodáskutatás sürgőssége miatt.” – Jakub Pachocki, az OpenAI vezető kutatója.[^2]

Az OpenAI az önfejlesztést és az MI-biztonságot helyezi előtérbe

Jakub Pachocki esszéje alapján az Astra eredménye nem azt jelenti, hogy az OpenAI minden rendelkezésre álló fejlesztési erőforrását a matematikára fordította. A vállalat inkább a rekurzív önfejlesztésre, valamint a jövőbeli MI-rendszerek ellenőrzését és biztonságos működését célzó kutatásra összpontosít.[^2]

Ez a döntés azt is jelzi, hogy a fejlett modellek képességei nem feltétlenül fejlődnek azonos ütemben minden területen. Egy rendszer kiemelkedhet a programozásban vagy a matematikában, miközben a nyelvi minőség, a hétköznapi következtetés vagy a társas helyzetek értelmezése kisebb mértékben javulhat.[^1]

Széles körű fejlődés vagy erős specializáció

Adam Hunt, a Cambridge-i Egyetem kutatója két lehetséges fejlődési pályát állított szembe: az egyik szerint az MI-modellek fokozatosan, sokféle feladatban válnak jobbá; a másik szerint egyes szakterületeken rendkívüli képességek alakulnak ki, miközben az alapvető készségek fejlődése lelassulhat. Az Astra matematikai eredménye és az OpenAI prioritási döntése az utóbbi értelmezést is alátámaszthatja.[^1]

A matematikai bizonyítások ellenőrzése válhat a fő kérdéssé

Terence Tao matematikus az 2026-os Nemzetközi Matematikai Kongresszus kapcsán arra hívta fel a figyelmet, hogy a gépi rendszerek egyre több bizonyítást állíthatnak elő annál, mint amennyit emberek rövid idő alatt ellenőrizni tudnak. Ebben a helyzetben a szűk keresztmetszet nem pusztán a problémamegoldás, hanem annak eldöntése lehet, hogy mely eredmények fontosak, megbízhatóak és további vizsgálatra érdemesek.[^4]

Az ErdősBench eredményei ezért nem jelentik azt, hogy az MI már önállóan megoldotta a matematika legnehezebb, régóta nyitott kérdéseit. Inkább azt mutatják, hogy a modellek egyre hatékonyabb eszközökké válhatnak a sejtések vizsgálatában, az ellenpéldák keresésében és a formális érvelések előkészítésében.[^1][^4]

Összefoglaló

A GPT-6 Astra ErdősBench-elsősége fontos mérföldkő a matematikai feladatokra alkalmazott MI-modellek versenyében. Ugyanakkor az OpenAI nyilatkozata arra utal, hogy a modell teljesítménye stratégiai kompromisszumok mellett született: a vállalat a matematikai optimalizálás helyett jelenleg az önfejlesztési és biztonsági kutatást részesíti előnyben. A következő időszak egyik kulcskérdése az lehet, hogy a matematikai közösség milyen módszerekkel ellenőrzi, válogatja és építi be a növekvő mennyiségű gépi eredményt.[^2][^4]

Forrás:

[^1]: The Decoder (2026. szeptember 10.). „GPT-6 Astra lässt Mathematiker durchpusten, weil OpenAI es so will”. The Decoder. Közzétéve [2026. 09. 10. 13:22:32 +0000].

[^2]: Jakub Pachocki. „An Alien Mind”. OpenAI. Közzétéve [2026. 09. 10.].

[^3]: ulam.ai. „ErdosBench”. ulam.ai. Közzétéve [2026. 09. 10.].

[^4]: The Decoder. „Wie einst nach Gödel: Terence Tao sieht die Mathematik vor einer neuen Grundlagenkrise”. The Decoder. Közzétéve [2026. 09. 10.].

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...