Az Artificial Analysis bemutatta az Optima nevű platformját, amely lehetővé teszi, hogy a felhasználók saját benchmarkokat hozzanak létre mesterséges intelligencia (MI) modellekhez. A cél az, hogy ne csak a modellek teljesítményét, hanem a költséget és a sebességet is figyelembe lehessen venni az adott alkalmazási terület szempontjából, ezzel segítve a pontosabb és gazdaságosabb döntéshozatalt.[^1]
Az Optima fő innovációja, hogy lehetőséget ad arra, hogy a felhasználók saját adataik, munkafolyamataik vagy konkrét eseteik alapján hozzanak létre benchmarkokat. Ezzel szemben az eddigi nyilvános benchmarkok gyakran nem tükrözik pontosan az adott alkalmazási terület igényeit.[^1]
A platform többféle kiindulási adatforrást fogad el, például saját fájlokat, a Hugging Face-ről származó értékelési adatkészleteket, vagy MI-ügynökök naplóit olyan rendszerekből, mint az Arize, Braintrust vagy Langfuse. Fejlesztők akár egy Skill telepítésével a programozási környezetből is összegyűjthetik a szükséges információkat.[^1]
Akik nem rendelkeznek kész adatkészlettel, egyszerű leírással és példabe- és kimenetekkel is elindíthatják a benchmarkfolyamatot. Az Optima automatikusan tesztinputokat, értékelési kritériumokat és példafeladatokat javasol, amelyeket a felhasználók visszajelzéseikkel tovább finomíthatnak.[^1]
Az Optima két fő értékelési módszert kínál:
A platform egyik újdonsága, hogy nemcsak a teljesítményt, hanem a költséget és a feladatonkénti feldolgozási időt is összehasonlítja. Ez különösen fontos, mert egy olcsóbb modell összességében drágább lehet, ha több futtatást vagy utómunkát igényel.[^1]
„Az Optima lehetővé teszi, hogy a felhasználók ne csak a minőséget, hanem a költségeket és a sebességet is figyelembe vegyék, amikor MI-modelleket választanak konkrét üzleti alkalmazásokhoz.”
Az Optima csak a felhasznált modellek tényleges tokenköltségeit számolja fel, további díj nélkül. A rubrikás értékelés 0,125 dollárba, a páros összehasonlítás 0,375 dollárba kerül összehasonlításonként.[^1]
Számos tanulmány mutatott rá, hogy a nyilvános MI-benchmarkok sokszor nem tükrözik a valós alkalmazási igényeket, illetve gyakran metodológiai hiányosságokkal küzdenek. Az Optima ezt a problémát úgy kezeli, hogy testreszabható, valós feladatokra szabott értékelést tesz lehetővé. Ugyanakkor továbbra is fontos, hogy a benchmark pontosan, reprezentatívan és transzparensen készüljön.[^1][^2][^3]
Az Optima új lehetőségeket nyit az MI-modellek összehasonlításában, mivel a felhasználók számára releváns szempontokat – teljesítményt, költséget, sebességet – egyaránt figyelembe veszi. Ez különösen hasznos lehet azoknak a szervezeteknek, amelyek konkrét üzleti vagy technológiai igényekhez keresnek legjobb MI-megoldásokat.
[^1]: THE DECODER (2026-08-16). “Artificial Analysis stellt Optima vor: Maßgeschneiderte KI-Benchmarks für eigene Anwendungsfälle”. Közzétéve [2026. 08. 16.].
[^2]: THE DECODER. “KI-Radar 3: Wie der Token zur betriebswirtschaftlichen Größe wird”. Közzétéve [2026. 08. 16.].
[^3]: THE DECODER. “Studie deckt massive Schwächen in KI-Benchmarks auf”. Közzétéve [2026. 08. 16.].