A GPT-6 Astra az ErdősBench eredményei alapján jelenleg a tesztelt MI-modellek élén áll a nyitott matematikai problémák kezelésében. Az eredmény különösen azért figyelemre méltó, mert az OpenAI vezető kutatója szerint a vállalat nem kifejezetten a matematikai kutatási képességek maximalizálását tekintette elsődleges fejlesztési célnak.[^1][^2]
Az ulam.ai által publikált ErdősBench 226, az Erdős-problémák által inspirált nyitott matematikai feladatot tartalmaz. A GPT-6 Astra 3,23 pontos értékelést kapott: 106 problémánál ért el eredményt, ezek közül 43-at teljes egészében megoldott, 27 esetben pedig ellenpéldával cáfolta meg az eredeti állítást.[^1][^3]
A rangsorban a GPT-5.6 Sol 3,12 ponttal a második helyen szerepel. A forrás szerint a Sol maximális következtetési beállítás mellett 78 problémát oldott meg, míg az Astra erősebb tudományos fogalmazást mutatott, és ritkábban tett túlzó állításokat a saját eredményeiről.[^1]
Przemek Chojecki, a benchmark fejlesztője a különbséget a matematikai kutatási képességekben elért, hozzávetőleg 5–10 százalékos előrelépésként jellemezte. Értékelése szerint a teszt még messze van attól, hogy a modellek teljesítménye telítődjön rajta.[^1]
„Úgy véljük, hogy a modelleket a matematikai kutatásra fordított további figyelemmel jobbá tehetnénk, de ezt az irányt nem helyezzük előtérbe az önfejlesztés és az automatizált igazodáskutatás sürgőssége miatt.” – Jakub Pachocki, az OpenAI vezető kutatója.[^2]
Jakub Pachocki esszéje alapján az Astra eredménye nem azt jelenti, hogy az OpenAI minden rendelkezésre álló fejlesztési erőforrását a matematikára fordította. A vállalat inkább a rekurzív önfejlesztésre, valamint a jövőbeli MI-rendszerek ellenőrzését és biztonságos működését célzó kutatásra összpontosít.[^2]
Ez a döntés azt is jelzi, hogy a fejlett modellek képességei nem feltétlenül fejlődnek azonos ütemben minden területen. Egy rendszer kiemelkedhet a programozásban vagy a matematikában, miközben a nyelvi minőség, a hétköznapi következtetés vagy a társas helyzetek értelmezése kisebb mértékben javulhat.[^1]
Adam Hunt, a Cambridge-i Egyetem kutatója két lehetséges fejlődési pályát állított szembe: az egyik szerint az MI-modellek fokozatosan, sokféle feladatban válnak jobbá; a másik szerint egyes szakterületeken rendkívüli képességek alakulnak ki, miközben az alapvető készségek fejlődése lelassulhat. Az Astra matematikai eredménye és az OpenAI prioritási döntése az utóbbi értelmezést is alátámaszthatja.[^1]
Terence Tao matematikus az 2026-os Nemzetközi Matematikai Kongresszus kapcsán arra hívta fel a figyelmet, hogy a gépi rendszerek egyre több bizonyítást állíthatnak elő annál, mint amennyit emberek rövid idő alatt ellenőrizni tudnak. Ebben a helyzetben a szűk keresztmetszet nem pusztán a problémamegoldás, hanem annak eldöntése lehet, hogy mely eredmények fontosak, megbízhatóak és további vizsgálatra érdemesek.[^4]
Az ErdősBench eredményei ezért nem jelentik azt, hogy az MI már önállóan megoldotta a matematika legnehezebb, régóta nyitott kérdéseit. Inkább azt mutatják, hogy a modellek egyre hatékonyabb eszközökké válhatnak a sejtések vizsgálatában, az ellenpéldák keresésében és a formális érvelések előkészítésében.[^1][^4]
A GPT-6 Astra ErdősBench-elsősége fontos mérföldkő a matematikai feladatokra alkalmazott MI-modellek versenyében. Ugyanakkor az OpenAI nyilatkozata arra utal, hogy a modell teljesítménye stratégiai kompromisszumok mellett született: a vállalat a matematikai optimalizálás helyett jelenleg az önfejlesztési és biztonsági kutatást részesíti előnyben. A következő időszak egyik kulcskérdése az lehet, hogy a matematikai közösség milyen módszerekkel ellenőrzi, válogatja és építi be a növekvő mennyiségű gépi eredményt.[^2][^4]
[^1]: The Decoder (2026. szeptember 10.). „GPT-6 Astra lässt Mathematiker durchpusten, weil OpenAI es so will”. The Decoder. Közzétéve [2026. 09. 10. 13:22:32 +0000].
[^2]: Jakub Pachocki. „An Alien Mind”. OpenAI. Közzétéve [2026. 09. 10.].
[^3]: ulam.ai. „ErdosBench”. ulam.ai. Közzétéve [2026. 09. 10.].
[^4]: The Decoder. „Wie einst nach Gödel: Terence Tao sieht die Mathematik vor einer neuen Grundlagenkrise”. The Decoder. Közzétéve [2026. 09. 10.].