A Thomson Reuters jelentős beruházással fejlesztett ki egy saját mesterséges intelligencia nyelvi modellt, hogy a jogi és üzleti szektorban még pontosabb és hatékonyabb szolgáltatásokat nyújtson ügyfeleinek. A modell sikerének kulcsa az exkluzív adatok és a vállalati tudás kombinációja.
A Thomson Reuters két éven keresztül, több mint 40 millió dolláros beruházással fejlesztette ki első saját mesterséges intelligencia nyelvi modelljét, amely az Alibaba által nyílt forráskódúvá tett Qwen modellre épül. A “Thomson” nevű modell fejlesztése során a vállalat főként saját, évtizedek alatt felhalmozott jogi adatbázisait (pl. Westlaw, Practical Law, Checkpoint és Reuters) használta fel, valamint több száz fachexpert munkájára is támaszkodott[^1].
Az alapot az Alibaba Qwen3.5-397B modellje adta, amelyet a Thomson Reuters az Imperial College London közreműködésével először biztonságra, etikai megfelelőségre és politikai semlegességre hangolt, ezt a változatot “Snowdon” néven emlegetik. Ezt követően a modell további előképzést kapott a vállalat saját tartalmain, majd szakterületi szakértők bevonásával, valamint a cég saját eszközein végzett megerősítéses tanulással fejlesztették tovább. Érdekesség, hogy eddig csak a rendelkezésre álló adatok kevesebb mint 10 százalékát használták fel a képzéshez[^1].
A vállalat szerint a “Thomson” modell a világ legjobbjai között van, de a belső és külső tesztek árnyaltabb képet mutatnak. Például a Stanford LegalBench mérésén a modell (0,823) a Gemini 3.1 Pro és a GPT-5.5 mögött, míg a Harvey Legal Agent Benchmarkon az Opus 4.8 mögött végzett. A legjobb eredményeket az Instruction Following és a PrBench Legal teszteken érte el. Kiemelendő, hogy a modell előnyei főként akkor mutatkoznak meg, ha hozzáfér a cég saját, zárt adatbázisaihoz. Webalapú adatforrás esetén a pontossága elmarad az aktuális GPT-modelltől[^1].
“A modell előnye abból ered, hogy saját eszközökön, saját adatokkal lett tanítva, amelyhez külső szereplők nem férhetnek hozzá.” – Andrew Bean, értékelési vezető
A Thomson Reuters szerint három fő érv szól a teljesen saját modell fejlesztése mellett:
Ez a modell csak ott működik igazán jól, ahol egy vállalat exkluzív adatokkal, széleskörű szakértői bázissal és mérhető munkafolyamatokkal rendelkezik. Más cégeknek, amelyek nem rendelkeznek ilyen infrastruktúrával, a saját modell főként többletköltségeket jelenthet[^1].
Az első gyakorlati alkalmazás a CoCounsel Legal Tabular Analysis funkciója lesz, ahol a modell nagy mennyiségű dokumentum automatikus elemzését végzi. Egy kisebb változatát nyílt forráskódú, nem kereskedelmi licenc alatt teszik elérhetővé a Hugging Face-en, hamarosan technikai beszámoló és fejlesztői portál is követi. Ügyféladatokat a modell nem használ fel a további tréning során. Már zajlanak az első tárgyalások ügyvédi irodákkal közvetlen licencelési lehetőségekről[^1].
A Thomson Reuters példája rávilágít, hogy a nagyvállalati szektorban a saját mesterséges intelligencia modellek fejlesztése nemcsak a teljesítmény, hanem a stratégiai függetlenség és a tudásfelhalmozás szempontjából is kulcsfontosságú lehet. A vállalatok számára, amelyek megfelelő adatmennyiséggel és szakértői bázissal rendelkeznek, a saját MI-modell jelentős versenyelőnyt biztosíthat a piacon.
[^1]: THE DECODER szerkesztősége (2026-08-24). “Warum Thomson Reuters 40 Millionen Dollar in ein eigenes Sprachmodell investiert”. The Decoder. Közzétéve [2026. 08. 24.].