A World Labs Atlas világmodellje kiválthatja a specializált 3D-modelleket

Hírek2026.09.02.8 megtekintés

Röviden:

  • A World Labs bemutatta az Atlas nevű világmodellt, amely szöveget, képet, videót és 3D-adatokat kezel közös térbeli környezetben.[^1]
  • A modell kameravezérelt képgenerálásra, valós jelenetek 3D-rekonstrukciójára, valamint robotikai szimulációk létrehozására is használható.[^1]
  • A vállalat saját összehasonlításai szerint az Atlas a vizsgált kameravezérlési és 3D-rekonstrukciós feladatokban több specializált modellt is megelőzött.[^1]

Bevezető: térbeli kontextusra épül az Atlas

A World Labs az Atlas nevű rendszerrel olyan világmodellt mutatott be, amelynek célja a háromdimenziós környezetek következetesebb megértése és előállítása. A vállalat szerint az úgynevezett omni-modell egyetlen rendszerben dolgozza fel a szöveges, képi, videós és 3D-s bemeneteket, amelyeket konkrét térbeli pozíciókhoz köt.[^1]

A megközelítés központi eleme a vállalat által „spatial contextnak”, vagyis térbeli kontextusnak nevezett közös reprezentáció. Ennek alapján az Atlas az addig látott környezethez illeszkedő új nézeteket, képkivágásokat és kameranézőpontokat hozhat létre.[^1]

Az Atlas kameravezérléssel készít új nézeteket

Geometriai utasítások a szöveges leírások helyett

Az Atlas egy vagy több bemeneti képből képes új látványt generálni szabadon megadott kamerapozícióból és nézőpontból. A kameramozgást nem csupán szöveges utasításként, hanem geometriai adatként is megkaphatja, ezért a World Labs szerint pontosabban szabályozható a kamera útvonala.[^1]

„A felhasználó minden beállítást maga határozhat meg, ahelyett hogy egy nyerőgép karját húzná meg.” – a World Labs összehasonlítása a vezérelt és a véletlenszerűbb generálás közötti különbségről.[^1]

A vállalat közlése szerint a modell legfeljebb egyperces, 1440 pixeles felbontású videót is előállíthat. Az ilyen vezérlés filmes jelenetek megtervezésénél, virtuális tartalomkészítésnél és szimulációknál lehet fontos, ahol a nézőpontnak követnie kell egy előre meghatározott pályát.[^1]

3D-rekonstrukció kevés fényképből

Az Atlas valós jeleneteket is rekonstruálhat néhány, illetve akár több tucat bemeneti fénykép alapján, különleges felvételi eszközök nélkül. A World Labs szerint több kép használata csökkenti a modell által kikövetkeztetendő, hiányzó részletek számát, így pontosabb háromdimenziós rekonstrukció készülhet.[^1]

A bemutatott példákban a rendszer két–három képből is létrehozott térbeli jelenetet, nagyobb képsorozatból pedig olyan nézőpontokat is generált, amelyek az eredeti felvételeken nem szerepeltek. Egy demonstrációban a Stanford Main Quad környezetét földközeli képekből állította össze, majd magasabb, légi nézeteket készített róla.[^1]

Pontfelhők és Gaussian splatok

Az Atlas nem kizárólag képet vagy videót adhat ki: a vállalat szerint explicit 3D-adatokat is előállít, például pontfelhőt vagy 3D-Gaussian-splat formátumot. Ezek a reprezentációk lehetővé teszik, hogy a rekonstruált jelenet több nézőpontból, folyamatosan bejárható legyen.[^1]

Ez a képesség kapcsolódik a World Labs korábbi Marble termékéhez is, amely szintén térben bejárható digitális környezetek létrehozására szolgál.[^1]

Robotikai szimulációk valós felvételekből

A modell egyik lehetséges felhasználási területe a robotika. Az Atlas egy helyiség felvételeiből a szimulált robot számára szükséges kép- és mélységi adatokat is létrehozhatja, például azt, amit a robot érzékelői egy kijelölt útvonalon látnának.[^1]

A World Labs szerint az úgynevezett real-to-sim munkafolyamatban kevés valós felvételből sokféle szimulált helyzet állítható elő. A tárgyak, a pozíciók, a világítás és a háttér módosításával változatos robotikai gyakorlóadatok készülhetnek anélkül, hogy minden egyes helyzetet a fizikai világban kellene rögzíteni.[^1]

A vállalat 2026 augusztusában már bemutatta Real-to-Sim-to-Real rendszerét. Közlése szerint ez egyetlen valós feladatból több ezer variációt hozhat létre, és a vezérlőmodelleket teljesen virtuális környezetben taníthatja.[^1]

Az Atlas architektúrája és a vállalati mérések

A World Labs leírása alapján az Atlas a nagy nyelvi modellek és a videógeneráló modellek egyes módszereit ötvözi. Egyrészt lépésről lépésre építi fel a kimenetet, másrészt diffúziós eljárással, zajból fokozatosan előállítva generál képi tartalmat.[^1]

A vállalat saját tesztjeiben emberi értékelők a kameravezérelt generálási páros összevetések 75 százalékában választották az Atlast a MiniMax H3 helyett, a Gemini Omni Flash ellenében pedig 81 százalékban. A Happy Horse 1.1, a FLUX 3 és a Seedance 2.5 elleni arány rendre 86, 93 és 94 százalék volt.[^1]

A 3D-rekonstrukciós összehasonlításban az Atlas átlagos hibája 25,3 volt, míg a vállalat által felsorolt Pi3X modellé 28,7, a VGGT-Ω 1B rendszeré pedig 36,4. Ezek vállalati közlésen alapuló eredmények, ezért a független értékelések továbbra is fontosak lehetnek a teljesítmény megítélésében.[^1]

Fei-Fei Li vállalata a térbeli intelligenciára épít

A World Labs 2024-ben alakult, alapítója Fei-Fei Li, aki az ImageNet projekt egyik meghatározó alakja volt, és korábban a Google Cloud mesterségesintelligencia-részlegét vezette. A vállalat induláskor 230 millió dollár befektetést szerzett, 2026 februárjában pedig egymilliárd dolláros finanszírozási kört jelentett be.[^1]

Az Atlas jelenleg kiválasztott partnerek számára, korai hozzáférési programban érhető el. A World Labs tervei szerint a modell a Marble jövőbeli változatait és további termékeket is működtet majd.[^1]

Összefoglaló: a specializált 3D-eszközök alternatívája lehet

Az Atlas a World Labs elképzelése szerint nem egyetlen feladatra készített rendszer, hanem olyan térbeli alapmodell, amely a kameravezérlést, a 3D-rekonstrukciót és a szimulációt közös keretben kezeli. Ha a vállalat által közölt eredmények független mérésekben is igazolódnak, a rendszer a tartalomgyártásban, a digitális ikrek fejlesztésében és a robotikai tanításban is csökkentheti a különálló, specializált 3D-modellek iránti igényt.[^1]

Forrás:

[^1]: The Decoder (2026. 09. 02.). „World Labs will mit Weltmodell Atlas spezialisierte 3D-Modelle überflüssig machen”. The Decoder. Közzétéve [2026. 09. 02. 10:55:36 +0000].

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...