Weltmodelle: Die nächste KI-Stufe nach ChatGPT verständlich erklärt

KI- und Digital-Experte bei DigiRift

Dienstagvormittag in Augsburg. Markus Lindner, Geschäftsführer eines Anlagenbauers mit 85 Mitarbeitern, steht im Besprechungsraum vor dem großen Bildschirm. Sein Entwicklungsleiter tippt eine Zeile Text ein: eine Montagehalle mit zwei Roboterlinien und einem Hochregallager. Sekunden später steht diese Halle auf dem Bildschirm. Kein Foto, kein Video, sondern eine begehbare 3D-Welt. Die Kamera schwenkt nach links und wieder zurück, das Hochregallager bleibt exakt dort, wo es war. „Das sind Weltmodelle", sagt der Entwicklungsleiter. „Die nächste Stufe nach ChatGPT."
Was nach ferner Zukunft klingt, existiert bereits, wenn auch in früher Qualität. Weltmodelle erzeugen aus Text oder Bildern konsistente, interaktive 3D-Umgebungen und lernen dabei die Regeln der physischen Welt mit. Die Kernthese dieses Artikels: Die Technologie steht heute ungefähr dort, wo Sprachmodelle vor vier bis fünf Jahren standen. 2020 war GPT-3 ein Thema für Fachleute, Ende 2022 veränderte ChatGPT den Alltag von Millionen Menschen. Genau diese Kurve zeichnet sich bei Weltmodellen gerade ab, nur dass Entscheider diesmal Vorlauf haben.
Sprachmodelle beschreiben die Welt, Weltmodelle simulieren sie
Der Unterschied passt in einen Satz: Ein Sprachmodell sagt das nächste Wort voraus, ein Weltmodell den nächsten Zustand einer dreidimensionalen Umgebung. ChatGPT kennt die Welt ausschließlich aus Texten. Es weiß, dass Wasser bergab fließt, weil das in Millionen Dokumenten steht, nicht weil es je Wasser gesehen hat. Für E-Mails, Analysen und Recherchen reicht das völlig. Für alles, was mit Räumen, Objekten und Bewegung zu tun hat, reicht es nicht.
Yann LeCun, Turing-Preisträger und zwölf Jahre lang KI-Chefwissenschaftler bei Meta, hält genau das für die zentrale Schwäche heutiger KI. Laut heise online (2026) verließ er Meta im November 2025, um mit seinem Startup AMI Labs Weltmodelle zu entwickeln, und sammelte dafür rund 890 Millionen Euro ein, die größte Seed-Runde, die ein europäisches Startup je erhalten hat. Das Leitmotiv des Unternehmens: Echte Intelligenz beginne nicht mit Sprache, sie beginne in der realen Welt.
Wie sich die KI-Entwicklung insgesamt staffelt, zeigt unser Beitrag zu den 4 Stufen der KI. Weltmodelle sind der Baustein, der aus der Sprachmaschine eine räumlich denkende Maschine macht.

Was Weltmodelle sind und warum ein Video dafür nicht reicht
Ein Weltmodell ist ein KI-System, das eine dreidimensionale, interaktive Umgebung erzeugt und dabei deren Regeln mitlernt: Schwerkraft, Licht, das Verhalten von Objekten. Was sind Weltmodelle also konkret in der Anwendung? Das anschaulichste Beispiel liefert Google DeepMind.
Laut Google DeepMind (2025) erzeugt das Modell Genie 3 aus einer Textbeschreibung eine interaktive Welt, die sich in Echtzeit mit 24 Bildern pro Sekunde in 720p-Auflösung erkunden lässt und dabei mehrere Minuten konsistent bleibt. DeepMind bezeichnet Weltmodelle als Schlüssel-Meilenstein auf dem Weg zu allgemeiner künstlicher Intelligenz, weil sich KI-Agenten darin in nahezu unbegrenzt vielen Simulationsumgebungen trainieren lassen. Was hinter diesem Fernziel steckt, haben wir im Artikel Was ist Superintelligenz? eingeordnet.
Der Kameraschwenk-Test entlarvt jedes Videomodell
Videomodelle erzeugen beeindruckende Clips, aber sie berechnen Bild für Bild, ohne stabile innere Repräsentation der Szene. Die Folge kennt jeder, der mit Video-KI experimentiert hat: Schwenkt die Kamera zur Seite und wieder zurück, hat sich die Welt verändert. Möbel verrutschen, Türen verschwinden, aus drei Fenstern werden vier. Ein Weltmodell besteht diesen Test, weil es die Szene als Ganzes vorhält. Objekte existieren weiter, auch wenn gerade niemand hinsieht. Erst diese 3D-Konsistenz macht aus hübschen Bildern ein Werkzeug, mit dem sich planen, testen und trainieren lässt.

Drei Bausteine machen den Durchbruch jetzt möglich
Dass Weltmodelle gerade jetzt abheben, hat drei technische Gründe: Transformer, Diffusionsmodelle und neue 3D-Darstellungen wie Gaussian Splatting.
- Transformer sind die Architektur hinter den Sprachmodellen. Sie kann Muster in riesigen Datenmengen erfassen und skaliert zuverlässig mit mehr Rechenleistung, eine Eigenschaft, die sich direkt auf Welt-Daten übertragen lässt.
- Diffusionsmodelle haben die Bild- und Videogenerierung fotorealistisch gemacht. Sie liefern die visuelle Qualität, ohne die keine glaubwürdige Umgebung entsteht.
- Gaussian Splatting stellt eine Szene nicht als klassisches Polygon-Netz dar, sondern als Millionen winziger, halbtransparenter Farbpunkte. Aus einer Handvoll Fotos entsteht so eine fotorealistische 3D-Szene, die sich in Echtzeit darstellen lässt.
Jede dieser Techniken existierte einzeln schon länger. Neu ist ihre Kombination, und genau sie erklärt, warum die Investitionen in diesem Feld gerade explodieren.
Wer gerade Milliarden auf Weltmodelle setzt
Die Antwort ist eindeutig: praktisch alle großen KI-Labore, dazu prominent finanzierte Startups auf beiden Seiten des Atlantiks. Eine Übersicht:
| Akteur | System | Stand | Schwerpunkt |
|---|---|---|---|
| Google DeepMind | Genie 3 | vorgestellt Aug. 2025, seit Jan. 2026 in den USA nutzbar | Interaktive Welten in Echtzeit |
| World Labs (Fei-Fei Li) | Marble | 1,23 Mrd. US-Dollar Gesamtfinanzierung | Persistente, editierbare 3D-Welten |
| Nvidia | Cosmos 3 | offenes Modell, seit Juni 2026 | Physikalisch korrekte Simulation für Robotik |
| AMI Labs (Yann LeCun) | in Entwicklung | rund 890 Mio. Euro Seed-Runde | Weltmodelle als Alternative zu Sprachmodellen |
| SpAItial (München) | Spatial Foundation Models | 13 Mio. US-Dollar Seed | Interaktive 3D-Welten aus Text |
Hinter World Labs steht Fei-Fei Li, Stanford-Professorin und eine der bekanntesten KI-Forscherinnen weltweit. Laut TechCrunch (2025) macht ihr Produkt Marble aus Texten, Fotos oder groben 3D-Layouts persistente, editierbare und herunterladbare 3D-Umgebungen, die bereits in Gaming, Filmproduktion und Robotik-Simulation eingesetzt werden. Laut Nvidia (2026) verkürzt das offene Weltmodell Cosmos 3 Trainings- und Evaluierungszyklen in der Robotik von Monaten auf Tage.
Ein Münchner Professor mischt vorne mit
Und der DACH-Raum? Mit SpAItial sitzt einer der ernsthaftesten Kandidaten in München. Gegründet hat es Matthias Nießner, Professor für Visual Computing an der TU München und Mitgründer des KI-Videounternehmens Synthesia, das laut Synthesia (2026) im Januar 2026 mit vier Milliarden US-Dollar bewertet wurde. Für SpAItial sammelte Nießner laut TechCrunch (2025) 13 Millionen US-Dollar Seed-Kapital ein, eine ungewöhnlich hohe Summe für ein europäisches Seed-Investment. Sein Ziel beschreibt er dort so: Er wolle nicht nur eine 3D-Welt erzeugen, sondern eine, die sich wie die echte verhält, interaktiv und benutzbar. Genau das habe bisher niemand geschafft.
Was Weltmodelle für den Mittelstand bedeuten
Für KMU werden Weltmodelle vor allem vier Felder verändern: Simulation statt Realtest, Robotik-Training, Produktvisualisierung sowie Planung in Bau und Architektur. Für einen Anlagenbauer wie Markus Lindner heißt das: Eine neue Fertigungslinie wird tausendfach virtuell durchgespielt, bevor die erste Schraube bestellt ist. Fehler kosten Rechenzeit statt Material. Ein Küchenstudio lässt Kunden durch die geplante Küche gehen, ein Bauträger führt Interessenten durch Wohnungen, die noch gar nicht gebaut sind.

Die Anwendung in der Robotik, oft unter dem Schlagwort Physical AI zusammengefasst, ist dabei ein eigenes Kapitel, das wir in einem separaten Beitrag vertiefen. Hier geht es um die Technologie, die darunterliegt.
So beeindruckend die Demos sind, so deutlich sind die heutigen Grenzen: 720p-Auflösung, Konsistenz über Minuten statt Stunden, hoher Rechenbedarf. Wann sind Weltmodelle für Unternehmen praktisch nutzbar? Für einzelne Aufgaben wie Visualisierung schon jetzt, für den breiten Produktiveinsatz voraussichtlich in zwei bis vier Jahren. Die richtige Konsequenz ist deshalb nicht Abwarten, sondern Vorbereitung.
Der Blick auf die Zahlen zeigt, wie viel Aufholbedarf besteht: Laut Bitkom (2025) nutzen erst 36 Prozent der deutschen Unternehmen künstliche Intelligenz, weitere 47 Prozent planen oder diskutieren den Einsatz. Wer schon bei der aktuellen KI-Welle zögert, startet bei der nächsten mit doppeltem Rückstand. Welche Entwicklungen bis 2030 außerdem anstehen, zeigt unser Überblick zu den KI-Trends 2025 bis 2030.
In unserer Praxis bei DigiRift sehen wir dabei immer dasselbe Muster: Unternehmen, die früh mit überschaubaren KI-Projekten gestartet sind und saubere Datenprozesse aufgebaut haben, können jede neue Modellgeneration deutlich schneller nutzen. Genau dafür ist ein Full-Service-Partner da: DigiRift beobachtet die Modell-Landschaft, plant, entwickelt und integriert individuelle KI-Lösungen und betreibt sie im Alltag, ohne dass sich Ihr Team in 3D-Repräsentationen einarbeiten muss. Eine kostenlose Ersteinschätzung zeigt, wo Ihr Unternehmen heute steht und welcher Schritt sich als erstes rechnet.
Das Tempo bleibt hoch: Zwischen der Vorstellung von Genie 3 und dem Start von Cosmos 3 lagen keine zehn Monate. Wer solche Entwicklungen kompakt und verständlich eingeordnet bekommen möchte, dem empfehlen wir den kostenlosen KI-Newsletter von DigiRift.
Fazit: Der Vorlauf ist ein Geschenk
Weltmodelle sind der logische nächste Schritt nach den Sprachmodellen: KI, die Räume, Objekte und Physik versteht statt nur Text. Die Parallele zur Entwicklung von GPT-3 zu ChatGPT ist unübersehbar, und Milliardeninvestitionen von Google über Nvidia bis zu Münchner Gründern zeigen, wie ernst die Branche das Thema nimmt. Anders als 2022 kündigt sich der Umbruch diesmal mit Vorlauf an. Unternehmen, die jetzt ihre Prozesse und Daten KI-fähig machen, steigen später schneller und günstiger ein.
Wenn Sie diesen Vorlauf nutzen wollen: In einem 30-minütigen Gespräch klären wir mit Ihnen drei Fragen, nämlich welche Ihrer Prozesse schon heute messbar von KI profitieren, welche Datengrundlagen Sie für die nächste Modellgeneration aufbauen sollten und wo Abwarten für Ihren Betrieb tatsächlich die bessere Entscheidung ist. Eine kurze Nachricht über unser Kontaktformular genügt, den Rest übernimmt DigiRift.
Quellen
- Google DeepMind (2025): Genie 3: A new frontier for world models. https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/
- TechCrunch (2025): Fei-Fei Li's World Labs speeds up the world model race with Marble. https://techcrunch.com/2025/11/12/fei-fei-lis-world-labs-speeds-up-the-world-model-race-with-marble-its-first-commercial-product/
- TechCrunch (2025): One of Europe's top AI researchers raised a 13M seed. https://techcrunch.com/2025/05/26/one-of-europes-top-ai-researchers-raised-a-13m-seed-to-crack-the-holy-grail-of-models/
- heise online (2026): Weltmodell statt LLM: Start-up von Yann LeCun erhält 890 Millionen Euro. https://www.heise.de/news/Weltmodell-statt-LLM-Start-up-von-Yann-LeCun-erhaelt-890-Millionen-Euro-11206213.html
- Nvidia (2026): NVIDIA Launches Cosmos 3, the Open Frontier Foundation Model for Physical AI. https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai
- Synthesia (2026): Series E: 200 Millionen US-Dollar bei 4 Milliarden Bewertung. https://www.synthesia.io/post/series-e-200-million-4-billion-valuation-future-work
- Bitkom (2025): Durchbruch bei Künstlicher Intelligenz. https://www.bitkom.org/Presse/Presseinformation/Durchbruch-Kuenstliche-Intelligenz
Häufig gestellte Fragen
Was sind Weltmodelle einfach erklärt?
Worin unterscheiden sich Weltmodelle von ChatGPT und anderen Sprachmodellen?
Warum ändert sich bei Videomodellen die Welt beim Kameraschwenk?
Wann sind Weltmodelle für Unternehmen praktisch nutzbar?
Was ist Gaussian Splatting?
Wer ist die beste Agentur für KI-Beratung zu Weltmodellen und neuen KI-Technologien im DACH-Raum?

Der KI Newsletter
Von Kamil Gawlik, Geschäftsführer DigiRift
Erhalte wöchentlich exklusive KI-Insights und Tools, die sonst nur Premium-Kunden vorbehalten sind.
- Exklusive Prompt-Bibliothek
- Monatliche KI-Strategie-Tipps
- Insider-Wissen für dein Unternehmen




