Az OpenAI új jelentése nyolc különböző esettanulmányon keresztül mutatja be, hogyan segítik az MI-ügynökök – mint például Codex és Claude Code – a kutatószoftverek modernizálását, ám a tudományos helyesség és hosszú távú fenntarthatóság biztosítása továbbra is jelentős emberi munkát igényel.[^1]
A jelentés nyolc, főként biológiai témájú projektet elemzett, ahol MI-ügynökök vettek részt különböző fejlesztési feladatokban: a karbantartástól kezdve az optimalizáción át a teljes újraimplementációig.[^1] Ezek között szerepel a cyvcf2 Python-könyvtár modernizálása, ahol a GPT-5.5 egy elavult build-folyamatot cserélt le, illetve a MHCflurry nevű immunológiai modell átvitele TensorFlow-ról PyTorch-ra, amit két MI-ügynök végzett mintegy 10 000 kódsor átdolgozásával.
A rustar-aligner projektben az MI-ügynökök egy teljesen új, Rust-alapú eszközt hoztak létre a sejtadatok elemzésére, amely a tesztek során 99,8%-os egyezőséget mutatott az eredeti szoftverrel. A RustQC esetében a futási idő több mint 60-szorosára csökkent, míg a HelixForge nevű eszköz GPU-n futó új verziója közel 60-szor gyorsabb lett, mint a korábbi megoldás.[^1]
Bár az MI-ügynökök képesek gyorsan és hatékonyan dolgozni, gyakran fordulnak elő tudományosan hibás vagy rejtett problémák. A Rust-ban újraírt bayesm statisztikai csomag például többször gyorsabb lett, de két speciális módszerben súlyos hibákat tartalmazott, amelyek csak összetett, mesterséges adatokkal végzett teszteléssel derültek ki.[^1]
„A kódoló ügynökökkel könnyű gyorsnak lenni. A tudományban azonban továbbra is szakmai ítélőképesség és alaposság szükséges” – írja Brent Pedersen, a cyvcf2 fejlesztője.
Philip Ewels, a RustQC vezetője szerint az ügynökök „szókimondóak, meggyőzőek és magabiztosan tévednek”. Ezért sosem bízta rájuk a végső döntést, hanem független tesztrendszert alkalmazott.
Az esettanulmányok alapján egyre inkább az emberi kutatók határozzák meg a célokat és a siker kritériumait, míg az MI-ügynökök végzik a kódolási feladatokat. A legautonómabb példa a HI.SIM könyvtár, ahol a GPT-5.2 és újabb modellek több fejlesztési kört önállóan hajtottak végre, a futási időt 31%-kal csökkentve.[^1]
Bár az MI-ügynökök jelentős idő- és költségmegtakarítást eredményezhetnek – például a NumPy könyvtár esetében évi 650 órányi karbantartást spórolhatnak meg –, a validáció, a tudományos helyesség és a hosszú távú szoftverkarbantartás továbbra is jelentős kihívás.[^1]
Az új szoftverek karbantartása és közösségi elfogadása nem minden esetben zökkenőmentes: egyes projektek, mint a rustar-aligner, új gondozóhoz kerültek, míg másoknál (például FastQC) a javítások végül visszakerültek az eredeti szoftverbe.
Az OpenAI jelentése hangsúlyozza: a fő szűk keresztmetszet már nem a kódolás, hanem a validáció és a hosszú távú fenntartás, ami az egész szoftveriparra igaz.[^1]
Az MI-ügynökök forradalmasíthatják a tudományos szoftverfejlesztést, jelentősen növelve a sebességet és a hatékonyságot. Ugyanakkor a tudományos helyesség, a validáció, a karbantartás és a felelősség kérdései továbbra is kiemelt emberi beavatkozást és szakértelmet követelnek.[^1]
[^1]: Redaktion The Decoder (2026-08-01). “OpenAI-Feldbericht: KI-Agenten schreiben marode Forschungssoftware neu, doch Forscher müssen aufwendig prüfen”. The Decoder. Közzétéve [2026. 08. 01.].