Cortex 2.0: Planen vor dem Handeln
Blog|

Cortex 2.0: Planen vor dem Handeln

S
Sereact10 Min. Lesedauer
Cortex 2.0: Planning Before Acting

Cortex 2.0

Cortex 2.0 auf einen Blick

  • Vorausschau. Cortex 2.0 erweitert Manipulation um Planung: Das System sagt künftige Ergebnisse voraus, bevor es sich auf die beste Option festlegt und sie in Bewegung umsetzt.
  • Weniger teure Fehler. Diese Zukünfte werden nach Fortschritt, Stabilität und Effizienz bewertet, sodass der Roboter schlechte Zweige vermeidet, bevor daraus Wiederholungsversuche oder Korrekturen werden.
  • Video-first World Modeling. Das World Model lernt prädiktive Dynamik im visuellen Latent Space, während die Aktionserzeugung im Execution Stack verbleibt.

Einleitung

Cortex 2.0 erweitert unsere ursprüngliche Cortex-Architektur um ein World Model im Lernkreislauf. Das World Model ersetzt die bestehende VLA nicht, sondern ergänzt sie und ermöglicht das Abwägen und Bewerten künftiger Ergebnisse.

Robotische Manipulation in realen industriellen Umgebungen bringt eigene Herausforderungen mit sich: Aktionen sind irreversibel, Fehler sind teuer, und die Folgen von Entscheidungen zeigen sich oft erst über lange Horizonte. Aktuelle Vision–Language–Action-Modelle (VLA) haben zwar beeindruckende Generalisierung und Flexibilität gezeigt, bleiben aber im Kern reaktive Systeme, optimiert darauf, die nächste Aktion zur aktuellen Beobachtung auszuwählen.

Bei komplexen Aufgaben wie der Retourenbearbeitung trifft der Roboter häufig auf unordentliche Behälter, unbekannte Objektlagen und Long-Horizon-Fehlermodi wie allmähliches Verrutschen, Verklemmen oder Kollisionen, die erst nach mehreren Schritten sichtbar werden. Cortex 2.0 begegnet dem mit dem Wechsel von Try-and-See-Steuerung zu Plan-and-Try. Ausgehend vom aktuellen Zustand erzeugt es eine variable Menge von kk möglichen Zukunftstrajektorien im visuellen Latent Space und bewertet jede Kandidatin nach erwartetem Erfolg und Effizienz. Die Bewertung wird als Advantage-Signal weitergereicht, das die Aktionserzeugung lenkt und die Policy zu Bewegungen mit hochwertigeren vorhergesagten Ergebnissen verschiebt.

Wir trainieren unser World Model im visuellen Raum, weil die Daten günstig und weit reichlicher vorhanden sind: unbegrenzt Video im Internet – und im Feld liefern Kameras einen kostenlosen Multiplikator: Ein Roboter erzeugt einen Aktionsstrom, aber 10 Kameras können rund 10× mehr Beobachtungssignal für das Training von World Models liefern.

Das hilft dem World Model, die zugrunde liegende Semantik der physischen Welt zu lernen: Gelenkbefehle sind Zahlen mit schwacher semantischer Struktur und starker Embodiment-Abhängigkeit, während Pixel reichhaltige, übertragbare Regelmäßigkeiten über Objekte, Kontakt und Bewegung kodieren.

Von reaktiven Policies zu physikalischem Schlussfolgern

Cortex 1.0 basiert auf einem Mixture-of-Experts-VLA-Stack (MoE), der multimodale Wahrnehmung – RGB, Tiefe/3D-Geometrie, Propriozeption und Aufgabenkontext – in ein Steuersignal überführt. Eine VLM/MoE-Schicht erzeugt zunächst einen übergeordneten, aufgabenbedingten Entscheidungszustand (etwa Subgoal-Struktur und geerdete Constraints); die VLA kombiniert diesen Kontext dann mit der aktuellen Beobachtung und gibt Action Chunks aus, die in embodiment-spezifische Low-Level-Controller geleitet werden. Dieses Design generalisiert über Aufgaben und Roboter hinweg, bleibt aber im Kern reaktiv: Entscheidungen sind auf die nächste Aktion im aktuellen Zustand optimiert, ohne mögliche Zukünfte explizit zu bewerten.

Cortex 2.0 führt eine Trennung von Planung und Ausführung ein. Das World Model arbeitet im Latent Space, um künftige Beobachtungen zu planen: Aus dem aktuellen Zustand von Roboter und Umgebung rollt es kk mögliche künftige Umgebungszustände aus. Diese Kandidaten bewertet unser PRO-Modul, das jedem eine Punktzahl zuweist. Wir nutzen diese Punktzahl als Advantage-Indikator für die nachgelagerte Steuerung. Die VLA wird auf den bestbewerteten Rollout und dessen Advantage-Wert konditioniert. Das World Model liefert visuelle Vorausschau, PRO ein Advantage-Signal über die Zukunftskandidaten, und die VLA übersetzt diese Vorausschau in robuste Low-Level-Aktionen.

Architekturüberblick

Cortex 2.0 erweitert die ursprüngliche Ausführungsarchitektur unseres bisherigen Modells um ein ergänzendes Planungsmodul. Auf hoher Ebene wird die aktuelle Beobachtung in einen latenten Zustand ztz_t kodiert. Ein MoE-Reasoning-Modul erzeugt strukturierten Aufgabenkontext sts_t; unser World Model sagt anschließend künftige Beobachtungen voraus – geplante Rollouts über einen vordefinierten Horizont. Die Outcome Heads (PRO-Modul) bewerten diese geplanten Zukünfte und wählen den vielversprechendsten Kandidaten aus, der dann von der VLA umgesetzt und auf dem Roboter ausgeführt wird.

Ausgehend von der aktuellen Beobachtung oto_t – einschließlich visuellem Input, propriozeptivem Roboterzustand, taktilen Signalen und Aufgabenanweisung – kodieren wir diese zunächst in eine kompakte latente Repräsentation ztz_t.

Auf Basis von ztz_t erzeugt ein Mixture-of-Experts-Modul (MoE) einen strukturierten Reasoning-Zustand

st=fMoE(zt).s_t = f_{\text{MoE}}(z_t).

sts_t ist ein gelerntes, aufgabenbedingtes Embedding, das zwischen Wahrnehmung, Planung und Steuerung vermittelt.

Es kodiert eine Zerlegung der Aufgabe auf Subgoal-Ebene sowie Grounding-Variablen, die Sprache mit Szenenobjekten und Constraints (Objekte, räumliche Relationen, Kontakt-Priors) verknüpfen. Diese Repräsentation sts_t lenkt das World Model auf aufgabenrelevante Zukünfte und den Execution Stack darauf, die ausgewählte Zukunft als Aktion zu realisieren.

Konditioniert auf die aktuelle Beobachtung und die Ausgabe des VLM sagt unser World Model KK künftige Beobachtungs-Latents über einen Horizont HH voraus:

zt+1:t+H=fWM ⁣(zt,st)z_{t+1:t+H} = f_{\text{WM}}\!\left(z_t, s_t\right)

Indem es unterschiedliche Anfangsbedingungen aus dem Noise Prior zieht, erzeugt das Flow-Matching-World-Model mehrere mögliche Rollouts aus demselben Eingangszustand. Das erlaubt uns zudem, die Granularität der erzeugten Latents zu steuern – etwa die Anzahl der Denoising-Iterationen oder die Anzahl der Rollout-Kandidaten –, um Inferenzgeschwindigkeit gegen Planungsfähigkeit abzuwägen.

Planung nützt nur, wenn sie bewertbar ist. Cortex 1.6 führte den Process-Reward Operator (PRO) als dichtes Erfolgs-/Abbruchsignal über ausgeführte Trajektorien ein. Cortex 2.0 hebt diese Idee in die Planungsschleife: PRO-Heads bewerten geplante Rollouts, sodass das System stabile, zielgerichtete Zukünfte bevorzugen und risikoreiche vermeiden kann.

Für jeden Rollout-Kandidaten kk setzen wir unsere schlanken Prediction Heads (PRO) ein, die entscheidungsrelevante Größen schätzen, etwa:

  • vorhergesagter Fortschritt Δpk\Delta p_k,
  • vorhergesagtes Risiko ρk\rho_k,
  • Abbruchwahrscheinlichkeit dkd_k (ergebnisbewusst).

Wir aggregieren diese Vorhersagen zu einer einzigen Rollout-Bewertung

Sk=E ⁣[kΔpkλkρk+βkdk]S_k = \mathbb{E}\!\left[\sum_{k}\Delta p_k - \lambda \sum_{k}\rho_k + \beta \sum_{k} d_k\right]

und wählen den besten geplanten Rollout über

zktoken=argmaxk  Sk.z_k^{\text{token}} = \arg\max_{k}\;S_k.

Wir wandeln diese Bewertung SkS_k in einen Advantage-Indikator AkA_k um und übergeben ihn an unsere VLA.

Die VLA konditioniert auf den ausgewählten Rollout und dessen Advantage-Indikator und erzeugt daraus den ausführbaren Action Chunk, den die Low-Level-Steuerung benötigt.

ut=πexec(st,zt,zktoken,Ak).u_t = \pi_{\text{exec}}(s_t, z_t, z_k^{\text{token}}, A_k).

Dabei ist AkA_k der binarisierte Advantage, für den wir die Ausgabe des PRO-Moduls als Proxy verwenden, um die Aktion der VLA zu konditionieren. Im Training dient das Advantage-Signal dazu, die VLA zu konditionieren und der Policy beizubringen, hochwertigere vorhergesagte Ergebnisse mit den Aktionen zu verknüpfen, die sie realisieren. Zur Inferenzzeit wird dieses Signal fest auf ein günstiges Ergebnis gesetzt, sodass die VLA Aktionen erzeugt, die die bestbewertete vorhergesagte Zukunft aus dem aktuellen Zustand heraus am besten verwirklichen.

Ob Einarm-Pick-and-Place, Dual-Arm-Pick-and-Place, Handtuchfalten oder Retourenbearbeitung: Cortex 2.0 durchläuft stets dieselbe Schleife – kk visuell-latente Rollouts erzeugen, sie nach Stabilität/Risiko/Effizienz bewerten und sich nur auf die bestbewertete Trajektorie festlegen. Das durchbricht das verbreitete reaktive Muster, bei dem eine VLA nach einem Fehlgriff dieselbe Bewegung wiederholt – die Planung filtert schlechte Zukünfte zuerst heraus und führt dann den vielversprechendsten Zweig aus.

Weil Cortex 2.0 Pläne im visuellen Raum bewertet, generalisiert seine Planung über Aufgaben und Roboter-Embodiments hinweg. Pläne direkt im Aktionsraum zu lernen und zu übertragen, ist deutlich schwieriger, da Aktionsbefehle von der spezifischen Kinematik und den Controllern eines Roboters abhängen; dasselbe „gute“ Verhalten kann auf verschiedenen Robotern sehr unterschiedliche Gelenkbewegungen erfordern.

Erste Ergebnisse

Wir vergleichen Cortex mit modernsten quelloffenen visuomotorischen Policies auf einer bimanuellen Manipulationsplattform mit zwei UR5e-Armen. Drei Aufgaben mit steigender Komplexität prüfen die Leistung über unterschiedliche Manipulationsprimitive hinweg.

Planungsbudget

Ein zentraler Vorteil von Cortex 2.0 ist, dass wir den Planungsumfang pro Entscheidung über KK einstellen können – die Anzahl der imaginierten Zukunfts-Rollouts, die gezogen und bewertet werden, bevor sich das System auf eine Aktion festlegt.

Die Erfolgsquote (linke Achse) steigt mit wachsendem KK, während auch die Zeit pro Schritt (rechte Achse) zunimmt – das ist der zentrale Design-Trade-off in Cortex 2.0: mehr Vorausschau bringt bessere Entscheidungen, zu höheren Compute-/Latenzkosten. Für die folgenden Aufgabenevaluationen fixieren wir eine latenzarme Einstellung von K=2. Da die Planung im visuellen Latent Space läuft, können wir den Planungsaufwand über (i) KK und (ii) die Rollout-Qualität (etwa die Anzahl der Denoising-Schritte) anpassen und höhere Budgets für teure Fehlermodi (etwa Packen) sowie niedrigere Budgets wählen, wenn die Korrektur günstig ist (etwa Nachgreifen).

Schuhkarton (sequenzielle Long-Horizon-Aufgabe)

Cortex 2.0 erreicht die höchste Erfolgsquote und ist dabei deutlich schneller als die Baseline-Policies – und schließt Rollouts ohne menschliche Eingriffe ab. Die Baselines werden entweder durch wiederholte Versuche und späte Deadlocks langsamer oder schaffen die vollständige Sequenz nicht zuverlässig.

Benchmark-Ergebnisse: Schuhkarton – alle Metriken

Schrauben sortieren (Feinpräzision)

Cortex 2.0 erreicht bei kleinen, reflektierenden Schrauben eine nahezu perfekte Erfolgsquote pro Vorgang, mit der kürzesten durchschnittlichen Ausführungszeit und ohne menschliches Eingreifen. Die Baselines tun sich mit präzisen Griffen und dem Ablegen schwer, was zu Abstürzen, Fehlplatzierungen und wiederkehrenden Deadlocks führt, die ein Eingreifen erfordern.

Benchmark-Ergebnisse: Schrauben sortieren – alle Metriken

Artikel & Abfall sortieren (wiederholtes Pick-and-Place aus unordentlichen Behältern)

Cortex 2.0 erzielt die höchste Erfolgsquote pro Objekt bei zugleich bestem Durchsatz und schließt Rollouts durchgängig ohne menschliches Eingreifen ab. Die Baselines benötigen Eingriffe, um fertig zu werden, und werden häufig durch wiederholtes lokales Umplanen nach misslungenen Griffen langsamer; oft erreichen sie das Laufzeitlimit, ohne die Aufgabe vollständig abzuschließen.

Benchmark-Ergebnisse: Artikel und Abfall sortieren – alle Metriken

Wo wir heute stehen

Wir trainieren Cortex 2.0 derzeit auf einem wachsenden Volumen unserer realen Betriebsdaten. Der erste Fokus liegt darauf, die Planungsschleife auf einer engen Auswahl besonders wirkungsvoller Abläufe zu validieren, beginnend mit Aufgaben in der Retourenbearbeitung, wo Long-Horizon-Fehler häufig sind und bessere Vorausschau die Betriebskosten unmittelbar senkt. Während wir Anwendungsfälle und Aufgaben weiter ausbauen, sehen wir bereits jetzt die große Wirkung davon, mögliche künftige Ergebnisse in VLA-Policies einzubeziehen.

Auf dem Weg zu In-Context Learning

Die Policy videofähig zu machen und ein World Model gemeinsam mit der Policy zu trainieren, ist ein Schritt in Richtung In-Context Learning für die Robotik: Bekommt der Roboter eine Folge von Demonstrationen als Video, kann er genau diese Schritte ohne erneutes Training ausführen. Heutige LLMs zeigen In-Context-Learning-Fähigkeiten in vielen Anwendungen: Agenten lassen sich allein durch Sprache darauf konditionieren, bestimmte Aufgaben auszuführen. Wir arbeiten an vergleichbaren Fähigkeiten für Roboter, um Generalisierung für Physical AI zu erschließen.

Cortex 2.0 im Einsatz

Bei allen vier Aufgaben verfängt sich die Baseline-Policy häufig in einer Schleife: Sie greift einmal daneben, wiederholt dieselbe Bewegung und verstärkt den Fehler. Mit Cortex 2.0 bewertet der Roboter zunächst einige mögliche Ergebnisse und legt sich auf die Option fest, die stabil bleibt – so laufen dieselben Setups reibungslos durch, statt in Korrekturschleifen zu geraten.

Retourenbearbeitung bei Active Ants

Pakethandling

Artikelhandling & Versand

Unser World Model hilft, ein sicheres Öffnen des Kartons und eine sinnvolle Reihenfolge zu planen, um den Artikel effizient zu greifen und Verhaken oder Verdeckungen zu vermeiden. Es sagt außerdem voraus, welche Ablegetrajektorie im Behälter zum stabilsten Endzustand führt, und reduziert so Fehlplatzierungen und nachgelagerten Korrekturbedarf.

Kitting bei Deltilog

Artikelpicken

Kartonbefüllung (Dual-Arm)

Kartonbefüllung (Dual-Arm)

Beim Picken bedeutet ein Fehlgriff meist nur ein Nachgreifen – die Korrektur ist günstig. Beim Befüllen von Kartons summieren sich kleine Fehler: Ein leicht schiefes Anfahren kann Kollisionen mit den Kartonwänden oder anderen Artikeln auslösen, zu Verhaken führen oder Schäden verursachen, deren Behebung teuer ist. Deshalb investieren wir beim Packen mehr Planungsbudget (höheres k): Wir suchen nicht nur eine erfolgreiche Platzierung, sondern die sicherste. Outcome Heads nach PRO-Art bewerten das Risiko fortlaufend – sie bestrafen Zukünfte mit schnellem Kontakt, Kompression, Kantenstößen oder Oberflächenschaben, selbst wenn der Artikel am Ende im Karton landet.

Paketverschluss bei Arvato

Manueller Prozess

Automatisiert (Dual-Arm)

Unser World Model hilft, vorherzusagen, wie sich der Kartonzuschnitt und die Artikel während des Ablegens bewegen und setzen, sodass der Roboter eine Reihenfolge und Ausrichtung wählen kann, bei der alles flach liegt und das Paket verschlossen werden kann.

Retoureneinlagerung bei Radial

Manueller Prozess

Automatisiert (Dual-Arm)

Automatisiert (Dual-Arm)

Dieser Ablauf profitiert von Vorausschau, weil die Einlagerung eine eng getaktete Übergabe ist: Die Planung hilft, den Scan lesbar zu halten und zugleich Kollisionen zwischen den Armen sowie mit den Behälterkanten zu vermeiden. Sie bevorzugt zudem Platzierungen, die stabil zur Ruhe kommen (kein Verhaken, Zurückspringen oder erneutes Verdecken), und reduziert so nachgelagerte Wiederholungsversuche in der Hochdurchsatz-Sortierung.

Wir stellen auch ein! Wenn Sie Interesse haben, zu uns zu stoßen, melden Sie sich gern.

Forschende, die sich für unsere Arbeit, Kooperationen oder andere Anliegen interessieren, schreiben bitte an research@sereact.ai.

Ressourcen zum Artikel

Inhalte und Assets aus diesem Beitrag abrufen

Textinhalt

Kopieren Sie den vollständigen Artikeltext in die Zwischenablage, um ihn bequem zu lesen oder zu teilen.

Bildmaterial

Laden Sie alle in diesem Artikel verwendeten hochauflösenden Bilder als ZIP-Datei herunter.

Neueste Artikel