Az MI-ügynökök nem érzékelik az időt, és ezt nem is tudják

Hírek2026.08.30.14 megtekintés

Röviden:

  • Két független kutató szerint az elterjedt programozási MI-ügynökök nehezen becsülik meg, mennyi időre van szükségük egy feladat elvégzéséhez.[^1]
  • Az Anthropic Claude Code és az OpenAI Codex rendszere rendszeresen túlbecsülte a feladatok várható időigényét.[^1]
  • Az azonos nyelvi modell futási idejét és munkalépéseinek számát jelentősen befolyásolhatja az alkalmazási környezet, az úgynevezett harness.[^1]
  • A vizsgálatban egy külső időmérő eszköz hozzáférése nagyrészt javította az ügynökök utólagos időbecslését.[^1]

Bevezető: Az önállóbb feladatvégzésre tervezett MI-ügynökök egyik kevésbé látványos, de gyakorlati szempontból lényeges korlátja lehet az időérzékelés hiánya. Egy, a MATS kutatási program keretében készült vizsgálat azt találta, hogy a Claude Code és a Codex nem tudja megbízhatóan előre jelezni egy programozási feladat időigényét, illetve utólag sem méri fel pontosan, mennyi idő telt el a munka során.[^1]

Az MI-ügynökök időbecslése jelentősen pontatlan

A kutatók 200, a ProgramBench feladatgyűjteményből származó programozási feladatot, valamint egy saját, 18 benchmarkból álló tesztsort használtak.[^1] A vizsgálati elrendezésben az ügynököknek először meg kellett becsülniük a szükséges időt, ezt követően meg kellett oldaniuk a feladatot, végül pedig utólag meg kellett mondaniuk, mennyi idő telt el.[^2]

A modellek a beszámoló szerint következetesen túlbecsülték a várható futásidőt. A ProgramBench feladatainál mindkét rendszer gyakran körülbelül másfél órás időigényt jelzett, a nehézségtől nagyrészt függetlenül.[^1] A második tesztsorban a Claude Code átlagosan háromszoros, a Codex pedig hatszoros-tízszeres eltérést mutatott a tényleges futásidőhöz képest.[^1]

„Egy ügynöknek, amely hosszú, többórás feladatokon akar megbízhatóan dolgozni, képesnek kell lennie követni az olyan utasításokat, mint hogy két órán át iteráljon egy feladaton.”[^2]

A rövid feladatoknál volt a legnagyobb az eltérés, míg egyes többórás munkáknál az előrejelzések közelebb kerültek a valósághoz.[^1] Ez azért lehet fontos korlát, mert a hosszabb automatizált munkafolyamatoknál az időkeret, az erőforrás-felhasználás és az emberi felügyelet tervezése is pontosabb becsléseket igényel.

A szoftverkörnyezet is alakítja az MI-ügynökök működését

A kutatás szerint nem kizárólag maga a nyelvi modell határozza meg a viselkedést. Az alkalmazási környezet, vagyis a harness is erősen befolyásolhatja azt, hogy az ügynök meddig dolgozik és hány lépést hajt végre.[^1]

Claude Code és Codex: eltérő leállási minták

A Claude Code a vizsgálatban jellemzően addig folytatta a munkát, amíg megoldottnak nem tekintette a feladatot; ennek medián időtartama nagyjából másfél óra volt.[^1] Ezzel szemben a Codex sok feladat esetében mintegy fél óra után befejezte a futást.[^1] Ugyanaz a nyelvi modell a Claude Code környezetében átlagosan 2,5-szer több munkalépést végzett, mint a Codexben.[^1]

Az eredmény arra utal, hogy egy MI-ügynök teljesítményének értékelésekor nem elegendő csak a mögöttes modellt vizsgálni. A rendelkezésére álló eszközök, a leállítási szabályok és a végrehajtási környezet egyaránt módosíthatja a tényleges működést.[^1]

Az önértékelés is túl optimista lehet

A szerzők az ügynökök saját munkájukról alkotott értékelését is tesztelték. A régebbi Opus 4.8 és GPT-5.5 modellek átlagosan 20 százalékponttal magasabbra értékelték teljesítményüket, mint amit a tényleges teszteredmények indokoltak.[^1]

Egy példában mindkét rendszer hozzávetőleg 70 százalékos sikerességet jelzett, miközben a tényleges eredmény 7, illetve 14,5 százalék volt.[^1] A túlzott önbizalom különösen problémás lehet olyan folyamatokban, ahol az ügynök saját maga dönt arról, hogy egy feladat elkészült-e, vagy szükség van-e további ellenőrzésre.

Az időmérő eszköz javíthatja a pontosságot

A kutatók szerint a probléma részben kezelhető lehet külső eszközhasználattal. Amikor az ügynökök hozzáférést kaptak egy olyan eszközhöz, amely megmutatta az eltelt időt, szinte mindig helyesen adták meg azt.[^1] A következő vizsgálati lépés annak feltárása lehet, hogy az MI-ügynökök egy előre meghatározott munkaidőt képesek-e ténylegesen betartani.[^1]

Összefoglaló

A teszteredmények alapján az MI-ügynökök időbecslése és önértékelése még nem elég megbízható ahhoz, hogy felügyelet nélkül, hosszú és időérzékeny feladatokat végezzenek. A külső időmérési eszközök, a megfelelő végrehajtási környezet és az eredmények független ellenőrzése ezért fontos szerepet kaphat az ilyen rendszerek üzemi alkalmazásában.[^1]

Forrás:

[^1]: Maximilian Schreiner (2026. augusztus 30.). „KI-Agenten haben kein Zeitgefühl und wissen es nicht”. THE DECODER. Közzétéve [2026. 08. 30. 10:38:01 +0000].

[^2]: Ofengenden és Andriushchenko. „Your agents are not time-aware”. LessWrong. Hozzáférés [2026. 08. 30.].

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...