OpenAI-felmérés: az MI-ügynökök átírják a kutatószoftvereket, de a kutatóknak alaposan kell ellenőrizniük

Hírek2026.08.02.19 megtekintés

  • Az OpenAI új jelentése bemutatja, hogyan írják át mesterséges intelligencia-ügynökök a kutatószoftvereket, ám az ellenőrzés továbbra is emberi szakértelmet igényel.
  • Az MI-alapú fejlesztések jelentős sebesség- és hatékonyságnövekedést hoztak, de gyakran előfordulnak rejtett hibák.
  • A szoftverek hosszú távú karbantartása, validálása és a felelősség kérdése továbbra is megoldatlan.

Az OpenAI új jelentése nyolc különböző esettanulmányon keresztül mutatja be, hogyan segítik az MI-ügynökök – mint például Codex és Claude Code – a kutatószoftverek modernizálását, ám a tudományos helyesség és hosszú távú fenntarthatóság biztosítása továbbra is jelentős emberi munkát igényel.[^1]

Az MI-ügynökök szerepe a kutatószoftverek fejlesztésében

Modernizáció, átirat és teljesítménynövekedés

A jelentés nyolc, főként biológiai témájú projektet elemzett, ahol MI-ügynökök vettek részt különböző fejlesztési feladatokban: a karbantartástól kezdve az optimalizáción át a teljes újraimplementációig.[^1] Ezek között szerepel a cyvcf2 Python-könyvtár modernizálása, ahol a GPT-5.5 egy elavult build-folyamatot cserélt le, illetve a MHCflurry nevű immunológiai modell átvitele TensorFlow-ról PyTorch-ra, amit két MI-ügynök végzett mintegy 10 000 kódsor átdolgozásával.

A rustar-aligner projektben az MI-ügynökök egy teljesen új, Rust-alapú eszközt hoztak létre a sejtadatok elemzésére, amely a tesztek során 99,8%-os egyezőséget mutatott az eredeti szoftverrel. A RustQC esetében a futási idő több mint 60-szorosára csökkent, míg a HelixForge nevű eszköz GPU-n futó új verziója közel 60-szor gyorsabb lett, mint a korábbi megoldás.[^1]

Gyors, de nem mindig megbízható

Bár az MI-ügynökök képesek gyorsan és hatékonyan dolgozni, gyakran fordulnak elő tudományosan hibás vagy rejtett problémák. A Rust-ban újraírt bayesm statisztikai csomag például többször gyorsabb lett, de két speciális módszerben súlyos hibákat tartalmazott, amelyek csak összetett, mesterséges adatokkal végzett teszteléssel derültek ki.[^1]

„A kódoló ügynökökkel könnyű gyorsnak lenni. A tudományban azonban továbbra is szakmai ítélőképesség és alaposság szükséges” – írja Brent Pedersen, a cyvcf2 fejlesztője.

Philip Ewels, a RustQC vezetője szerint az ügynökök „szókimondóak, meggyőzőek és magabiztosan tévednek”. Ezért sosem bízta rájuk a végső döntést, hanem független tesztrendszert alkalmazott.

Az ember és az MI-ügynökök új munkamegosztása

Az esettanulmányok alapján egyre inkább az emberi kutatók határozzák meg a célokat és a siker kritériumait, míg az MI-ügynökök végzik a kódolási feladatokat. A legautonómabb példa a HI.SIM könyvtár, ahol a GPT-5.2 és újabb modellek több fejlesztési kört önállóan hajtottak végre, a futási időt 31%-kal csökkentve.[^1]

Kihívások: validáció, karbantartás és felelősség

Bár az MI-ügynökök jelentős idő- és költségmegtakarítást eredményezhetnek – például a NumPy könyvtár esetében évi 650 órányi karbantartást spórolhatnak meg –, a validáció, a tudományos helyesség és a hosszú távú szoftverkarbantartás továbbra is jelentős kihívás.[^1]

Az új szoftverek karbantartása és közösségi elfogadása nem minden esetben zökkenőmentes: egyes projektek, mint a rustar-aligner, új gondozóhoz kerültek, míg másoknál (például FastQC) a javítások végül visszakerültek az eredeti szoftverbe.

Az OpenAI jelentése hangsúlyozza: a fő szűk keresztmetszet már nem a kódolás, hanem a validáció és a hosszú távú fenntartás, ami az egész szoftveriparra igaz.[^1]

Összefoglaló

Az MI-ügynökök forradalmasíthatják a tudományos szoftverfejlesztést, jelentősen növelve a sebességet és a hatékonyságot. Ugyanakkor a tudományos helyesség, a validáció, a karbantartás és a felelősség kérdései továbbra is kiemelt emberi beavatkozást és szakértelmet követelnek.[^1]

Forrás:

[^1]: Redaktion The Decoder (2026-08-01). “OpenAI-Feldbericht: KI-Agenten schreiben marode Forschungssoftware neu, doch Forscher müssen aufwendig prüfen”. The Decoder. Közzétéve [2026. 08. 01.].

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...