A World Labs az Atlas nevű rendszerrel olyan világmodellt mutatott be, amelynek célja a háromdimenziós környezetek következetesebb megértése és előállítása. A vállalat szerint az úgynevezett omni-modell egyetlen rendszerben dolgozza fel a szöveges, képi, videós és 3D-s bemeneteket, amelyeket konkrét térbeli pozíciókhoz köt.[^1]
A megközelítés központi eleme a vállalat által „spatial contextnak”, vagyis térbeli kontextusnak nevezett közös reprezentáció. Ennek alapján az Atlas az addig látott környezethez illeszkedő új nézeteket, képkivágásokat és kameranézőpontokat hozhat létre.[^1]
Az Atlas egy vagy több bemeneti képből képes új látványt generálni szabadon megadott kamerapozícióból és nézőpontból. A kameramozgást nem csupán szöveges utasításként, hanem geometriai adatként is megkaphatja, ezért a World Labs szerint pontosabban szabályozható a kamera útvonala.[^1]
„A felhasználó minden beállítást maga határozhat meg, ahelyett hogy egy nyerőgép karját húzná meg.” – a World Labs összehasonlítása a vezérelt és a véletlenszerűbb generálás közötti különbségről.[^1]
A vállalat közlése szerint a modell legfeljebb egyperces, 1440 pixeles felbontású videót is előállíthat. Az ilyen vezérlés filmes jelenetek megtervezésénél, virtuális tartalomkészítésnél és szimulációknál lehet fontos, ahol a nézőpontnak követnie kell egy előre meghatározott pályát.[^1]
Az Atlas valós jeleneteket is rekonstruálhat néhány, illetve akár több tucat bemeneti fénykép alapján, különleges felvételi eszközök nélkül. A World Labs szerint több kép használata csökkenti a modell által kikövetkeztetendő, hiányzó részletek számát, így pontosabb háromdimenziós rekonstrukció készülhet.[^1]
A bemutatott példákban a rendszer két–három képből is létrehozott térbeli jelenetet, nagyobb képsorozatból pedig olyan nézőpontokat is generált, amelyek az eredeti felvételeken nem szerepeltek. Egy demonstrációban a Stanford Main Quad környezetét földközeli képekből állította össze, majd magasabb, légi nézeteket készített róla.[^1]
Az Atlas nem kizárólag képet vagy videót adhat ki: a vállalat szerint explicit 3D-adatokat is előállít, például pontfelhőt vagy 3D-Gaussian-splat formátumot. Ezek a reprezentációk lehetővé teszik, hogy a rekonstruált jelenet több nézőpontból, folyamatosan bejárható legyen.[^1]
Ez a képesség kapcsolódik a World Labs korábbi Marble termékéhez is, amely szintén térben bejárható digitális környezetek létrehozására szolgál.[^1]
A modell egyik lehetséges felhasználási területe a robotika. Az Atlas egy helyiség felvételeiből a szimulált robot számára szükséges kép- és mélységi adatokat is létrehozhatja, például azt, amit a robot érzékelői egy kijelölt útvonalon látnának.[^1]
A World Labs szerint az úgynevezett real-to-sim munkafolyamatban kevés valós felvételből sokféle szimulált helyzet állítható elő. A tárgyak, a pozíciók, a világítás és a háttér módosításával változatos robotikai gyakorlóadatok készülhetnek anélkül, hogy minden egyes helyzetet a fizikai világban kellene rögzíteni.[^1]
A vállalat 2026 augusztusában már bemutatta Real-to-Sim-to-Real rendszerét. Közlése szerint ez egyetlen valós feladatból több ezer variációt hozhat létre, és a vezérlőmodelleket teljesen virtuális környezetben taníthatja.[^1]
A World Labs leírása alapján az Atlas a nagy nyelvi modellek és a videógeneráló modellek egyes módszereit ötvözi. Egyrészt lépésről lépésre építi fel a kimenetet, másrészt diffúziós eljárással, zajból fokozatosan előállítva generál képi tartalmat.[^1]
A vállalat saját tesztjeiben emberi értékelők a kameravezérelt generálási páros összevetések 75 százalékában választották az Atlast a MiniMax H3 helyett, a Gemini Omni Flash ellenében pedig 81 százalékban. A Happy Horse 1.1, a FLUX 3 és a Seedance 2.5 elleni arány rendre 86, 93 és 94 százalék volt.[^1]
A 3D-rekonstrukciós összehasonlításban az Atlas átlagos hibája 25,3 volt, míg a vállalat által felsorolt Pi3X modellé 28,7, a VGGT-Ω 1B rendszeré pedig 36,4. Ezek vállalati közlésen alapuló eredmények, ezért a független értékelések továbbra is fontosak lehetnek a teljesítmény megítélésében.[^1]
A World Labs 2024-ben alakult, alapítója Fei-Fei Li, aki az ImageNet projekt egyik meghatározó alakja volt, és korábban a Google Cloud mesterségesintelligencia-részlegét vezette. A vállalat induláskor 230 millió dollár befektetést szerzett, 2026 februárjában pedig egymilliárd dolláros finanszírozási kört jelentett be.[^1]
Az Atlas jelenleg kiválasztott partnerek számára, korai hozzáférési programban érhető el. A World Labs tervei szerint a modell a Marble jövőbeli változatait és további termékeket is működtet majd.[^1]
Az Atlas a World Labs elképzelése szerint nem egyetlen feladatra készített rendszer, hanem olyan térbeli alapmodell, amely a kameravezérlést, a 3D-rekonstrukciót és a szimulációt közös keretben kezeli. Ha a vállalat által közölt eredmények független mérésekben is igazolódnak, a rendszer a tartalomgyártásban, a digitális ikrek fejlesztésében és a robotikai tanításban is csökkentheti a különálló, specializált 3D-modellek iránti igényt.[^1]
[^1]: The Decoder (2026. 09. 02.). „World Labs will mit Weltmodell Atlas spezialisierte 3D-Modelle überflüssig machen”. The Decoder. Közzétéve [2026. 09. 02. 10:55:36 +0000].