Cortex 1.6: Lernen aus dem Verlauf der Dinge
Blog|

Cortex 1.6: Lernen aus dem Verlauf der Dinge

S
Sereact12 Min. Lesedauer
Cortex 1.6: Learning From the Way Things Unfold

Dichtes Reward-Learning aus realen Roboter-Deployments

Einleitung

Stellen Sie sich einen Lagerroboter vor, der Tausende Artikel pro Stunde greift. Ein Griff, der langsam Vakuum verliert, Wiederholversuche auslöst und das Objekt schließlich fallen lässt, enthält ein reiches Lernsignal – doch die meisten Lernsysteme sehen davon nur ein einziges Bit: Fehlschlag.

In der physischen Manipulation sind Erfolg und Fehlschlag keine diskreten Ereignisse, sondern Prozesse mit innerer Struktur, die sich über Interaktionskräfte, Zeitvorgaben und Regelstabilität allmählich entfalten. Unsere industriellen Roboter-Deployments erzeugen kontinuierliche Ströme multimodaler Betriebsdaten, doch nahezu dieses gesamte Signal wird von Lernpipelines verworfen, die eine Ausführung auf ein einziges Endergebnis reduzieren. Diese Diskrepanz zwischen dem Reichtum realer Ausführung und der Spärlichkeit des Lern-Feedbacks ist ein zentraler Engpass für robotisches Lernen im Produktivbetrieb.

Cortex 1.6 führt den Process-Reward Operator (PRO) ein, ein gelerntes Reward Model, das dichte, kontinuierliche Lernsignale direkt aus dem realen Roboterbetrieb gewinnt. Statt sich auf handgebaute Rewards oder simulationsspezifische Metriken zu stützen, überführt PRO die im Betrieb beobachteten operativen Signale in einen einheitlichen Begriff von Fortschritt, Abschlusswahrscheinlichkeit und Risiko. Das ermöglicht Reinforcement Learning und Policy-Verbesserung, während die Roboter aktiv Kundennutzen liefern.

Reichhaltige Telemetrie unserer Industrieroboter zum Training von PRO (Gelenkpositionen, Kräfte/Taktilsensorik, SKU-Kennungen, WMS-Metadaten, Task-Prompts und Statusflags).

Motivation: Die Grenzen spärlicher Rewards in Physical AI

Vision-Language-Action-Modelle (VLA) haben durch groß angelegtes Pretraining und Supervised Fine-Tuning starke Leistungen in der robotischen Manipulation gezeigt. Ihr Lernen bleibt jedoch grundsätzlich durch spärliches, verzögertes Feedback begrenzt, das meist auf einen binären Begriff von Erfolg oder Misserfolg reduziert ist. In industriellen Deployments wird das Lernen weiterhin von Endergebnissen getrieben, obwohl die reichhaltigste Supervision während der Ausführung entsteht.

Dieses ergebniszentrierte Lernen macht es schwer zu erkennen, welche Teile einer Ausführung zum Erfolg oder Misserfolg beigetragen haben. In realen Robotersystemen treten Fehler selten schlagartig auf: instabile Griffe, grenzwertiger Unterdruck, wiederholte Versuche oder kleine Fehlausrichtungen, die erst später zu Abwürfen, Blockaden oder abgebrochenen Aufgaben führen. Klassische Formulierungen des Reinforcement Learning tun sich schwer, diese Struktur zu nutzen, da sie auf manuell entworfene Reward-Funktionen oder auf Endsignale angewiesen sind, die lange nach der eigentlichen Ursache eintreffen.

Cortex 1.5 hat gezeigt, dass sich Policies durch menschlich geführtes Policy-Patching effizient korrigieren lassen und so eine schnelle Erholung aus seltenen Fehlerzuständen möglich ist. Dieser Ansatz erfordert jedoch einen expliziten menschlichen Eingriff und lässt große Teile der Routineausführung – insbesondere fragiles, letztlich aber erfolgreiches Verhalten – für das Lernen ungenutzt.

Industrieroboter erzeugen bereits reichhaltige Telemetrie zu Kräften, Stabilität, Timing und Korrekturaktionen, doch spärliches, ergebnisbasiertes Lernen kann diese Informationen nicht nutzen. In der Folge können Algorithmen robuste nicht von fragilen Ausführungen unterscheiden, wenn beide mit demselben Endlabel enden – und der Großteil der Betriebsdaten bleibt von der Policy-Verbesserung abgekoppelt.

Die zentrale Hypothese hinter PRO lautet, dass sich diese Lücke schließen lässt, indem Rewards direkt aus der Ausführung gelernt werden. Indem PRO die Ausführungsqualität statt binärer Ergebnisse modelliert, liefert es dichtes Feedback im Einklang mit realen operativen Zielen – wie im Video gezeigt – und ermöglicht eine wirksamere Credit-Zuweisung bei robotischen Aufgaben mit langem Horizont.

Der Process-Reward Operator

PRO ist eine gelernte Funktion, die laufende Roboterausführung bewertet, indem sie Zwischenzustände des Roboters und kurze Ausführungsabschnitte auf drei Signale abbildet:

  1. Fortschritt – ob sich die Ausführung dem erfolgreichen Abschluss der Aufgabe nähert oder von ihm entfernt.
  2. Abschlusswahrscheinlichkeit – die Wahrscheinlichkeit, dass die aktuelle Trajektorie erfolgreich ist.
  3. Risiko – die Wahrscheinlichkeit von Instabilität oder Fehlschlag (z. B. Verrutschen, Abwürfe, Blockaden).

Wichtig ist: PRO ist im klassischen Sinne nicht aufgabenspezifisch. Es ist goal-conditioned und wird über Deployments, Objekttypen und Betriebskontexte hinweg trainiert, was Generalisierung über Aufgaben hinweg erlaubt und zugleich in der physischen Ausführung verankert bleibt.

Die PRO-Module erklärt

PRO arbeitet auf multimodalen Beobachtungen aus realer Ausführung. Zum Zeitpunkt tt besteht die Beobachtung aus:

ot={at,vt,rt,τt,g}o_t = \{ a_t, v_t, r_t, \tau_t, g \}

Sie erfassen komplementäre Aspekte des Roboterzustands:

  • ata_t – die ausgeführte Aktion. Sie erlaubt PRO, die Aktionsqualität zu bewerten, Fortschritt und Risiko aktionsbedingt zu modellieren und zu unterscheiden, ob Veränderungen im Ausführungszustand auf Regelentscheidungen oder auf Umgebungsdynamik zurückgehen.
  • vtv_t – visuelle Beobachtungen aus dem visuellen Encoder von Cortex.
  • rtr_t – Propriozeption des Roboters, einschließlich Gelenkzuständen, TCP-Pose und Status des Endeffektors.
  • τt\tau_toperative Kraft- und Interaktionstelemetrie, etwa Reserven im Vakuumdruck, Kraft-Momenten-Statistiken, Kontaktkräfte und Schlupfindikatoren, die physische Stabilität und Interaktionsqualität unmittelbar widerspiegeln.
  • gg – ein zielkonditionierender Prompt, dargestellt als Text-Embedding und optional um standort- oder deploymentspezifischen Kontext ergänzt.

Diese Eingaben liefern kontinuierliche Signale zur Ausführungsqualität und ermöglichen es PRO, über kurze Zeitfenster zu schlussfolgern und Trends wie sich verschlechternde Griffe oder wachsende Instabilität zu erkennen – Informationen, die Verfahren mit spärlichem Reward nicht zugänglich sind.

Jede Modalität wird über modalitätsspezifische Encoder in eine latente Repräsentation überführt. Ausgeführte Aktionen werden separat kodiert, sodass PRO Vorhersagen zu Fortschritt, Risiko und Terminierung explizit auf die angewandten Steuerbefehle konditionieren und aktionsbedingte Effekte von Umgebungsdynamik unterscheiden kann. Visuelle Beobachtungen werden über einen kleinen Adapter auf dem visuellen Encoder von Cortex projiziert. Roboterzustand und Telemetrie werden über ein leichtgewichtiges mehrschichtiges Perzeptron mit Normalisierungsschichten kodiert, um Stabilität über heterogene Signalskalen hinweg sicherzustellen. Ziel- und Standortkonditionierung nutzen den Sprach-Encoder von Cortex, um die semantische Ausrichtung zu wahren. Diese Encoder normalisieren heterogene Sensordatenströme in einen gemeinsamen Latent Space und bewahren dabei die modalitätsspezifische Struktur. Da PRO als Critic und nicht als Policy fungiert, ist die Encoder-Kapazität bewusst begrenzt, um die Generalisierung über Deployments hinweg zu verbessern.

Die kodierten Features werden über ein gemeinsames VLA-Backbone fusioniert, um eine einheitliche Repräsentation des aktuellen Ausführungszustands zu erzeugen. Visuelle, propriozeptive, telemetrische und Zielinformationen werden zu einem einzigen latenten Token verschmolzen, an das anschließend das Action-Embedding angehängt wird. So entsteht eine kompakte Zustandsrepräsentation, die sowohl die Umgebung als auch die jüngsten Regelentscheidungen des Roboters abbildet. Das resultierende fusionierte Token dient als Eingabe für das temporale Modell.

PRO bewertet die Ausführung über kurze Zeitfenster statt über einzelne Zeitschritte. Ein temporales Modell verarbeitet eine Folge jüngster Zustände zu einer temporalen latenten Repräsentation, die sowohl die aktuelle Situation als auch die jüngsten Trends erfasst. Das ist für reale Manipulation entscheidend, denn Fehler entstehen dort typischerweise allmählich statt schlagartig. Subtile Muster – etwa nachlassender Vakuumdruck, wachsender Posenfehler oder zunehmende Kontaktinstabilität – kündigen Probleme oft lange vor einem endgültigen Fehlschlag an. Für Einzelschritt-Bewerter sind diese Dynamiken unsichtbar, über die Zeit modelliert werden sie jedoch deutlich. Der resultierende temporale Latent sts_t dient als kompakte Zusammenfassung der Ausführungsqualität und bildet die Grundlage für die Vorhersagen von PRO zu Fortschritt, Abschlusswahrscheinlichkeit und Risiko.

Aus dem temporalen Latent sts_t erzeugt PRO drei komplementäre Ausgaben. Alle Heads teilen sich dasselbe temporale Backbone, werden aber mit unterschiedlichen Supervisionssignalen trainiert.

Fortschritt

Der Fortschritts-Head modelliert das Abschlusspotenzial – wie nah das System am erfolgreichen Abschluss der Aufgabe ist – und nicht einen momentanen Reward. Er sagt eine Value-Funktion über Ausführungszustände vorher, aus der dichte Fortschrittssignale abgeleitet werden.

Der Fortschritts-Head sagt einen Wert vorher

Vθ(st)=E[k=tTγktr^kst]V_\theta(s_t) = \mathbb{E}\left[\sum_{k=t}^{T} \gamma^{k-t} \hat{r}_k \mid s_t\right]

wobei r^k\hat{r}_k ein impliziter Reward ist, der aus Ausführungsergebnissen und Telemetrie abgeleitet wird (z. B. Erfolg, Wiederholversuche, Sicherheitsereignisse).

Der dichte Fortschritt ist als Wertänderung definiert: Δpt=Vθ(st+1)Vθ(st)\Delta p_t = V_\theta(s_{t+1}) - V_\theta(s_t). Positive Werte zeigen eine Bewegung hin zum erfolgreichen Abschluss an, negative Werte eine Verschlechterung.

Terminierung

Ein Terminierungs-Head sagt die Wahrscheinlichkeit vorher, dass die Episode zum Zeitschritt tt endet:

dt=Pθ(donet=1st)d_t = P_\theta(\text{done}_t = 1 \mid s_t)

und optional die bedingte Erfolgswahrscheinlichkeit bei Terminierung:

qt=Pθ(success=1donet=1,st)q_t = P_\theta(\text{success} = 1 \mid \text{done}_t = 1, s_t)

Risiko

Der Risiko-Head sagt die Wahrscheinlichkeit vorher, dass innerhalb eines festen Zukunftshorizonts Δ\Delta ein Fehler oder ein korrekturauslösendes Ereignis eintritt:

ρt=Pθ(failt:t+Δ=1st)\rho_t = P_\theta(\text{fail}_{t:t+\Delta} = 1 \mid s_t)

Im Mehrklassenfall gibt der Head eine kategoriale Verteilung über vordefinierte Fehlermodi aus.

Die Ausgaben von PRO werden von nachgelagerten Ausführungs- und Lernmechanismen genutzt, ohne die zugrunde liegende VLA-Policy zu verändern. Zur Inferenzzeit bewertet es Kandidatenaktionen, indem es deren erwarteten kumulierten Fortschritt und ihr Risiko schätzt:

E[R(a)]=E[Δpkλρk]\mathbb{E}[R(a)] = \mathbb{E}\left[\sum \Delta p_k - \lambda \sum \rho_k\right]

wobei λ\lambda die Risikosensitivität steuert. Terminierungswahrscheinlichkeiten dienen dazu, Wiederholversuche zu begrenzen und pathologische Ausführungsschleifen zu verhindern. Für das Lernen liefert PRO ein dichtes Reward-Signal, das aus realer Ausführung abgeleitet ist. Nach dem Training werden seine Ausgaben für Fortschritt Δpt\Delta p_t und Risiko ρt\rho_t als Reward-Signale für die Policy-Optimierung behandelt. Offline Reinforcement Learning nutzt diese Signale, um aus protokollierten Trajektorien zu lernen, während Online-Fine-Tuning die PRO-Ausgaben unter zusätzlichen Sicherheits- und Regressionsbedingungen verwendet, um konservative Updates im laufenden Betrieb sicherzustellen. Darüber hinaus liefert PRO eine einheitliche, interpretierbare Bewertungsmetrik über Standorte und Deployments hinweg und ermöglicht damit die systematische Analyse von Ausführungsqualität und Fehlermodi.

Integration mit Reinforcement Learning

PRO dient als gemeinsames Reward-Backbone für mehrere Lern- und Steuerungspfade:

  • Offline Reinforcement Learning, bei dem dichte Fortschrittssignale das Lernen aus protokollierten Trajektorien ermöglichen, die sonst nur spärliche Supervision liefern würden.
  • Online Reinforcement Learning, das kontinuierliche Policy-Verbesserung auf Basis von Echtzeit-Feedback ermöglicht, ohne auf das Ende der Aufgabe zu warten.
  • Aktionsauswahl zur Inferenzzeit, bei der Kandidatenaktionen oder Action Chunks nach erwartetem Fortschritt und Risiko gereiht werden.
  • Evaluation und Monitoring, mit einem einheitlichen, quantitativen Maß für die Ausführungsqualität über Standorte und Deployments hinweg.

Entscheidend ist: PRO ersetzt die zugrunde liegende VLA-Policy nicht. Es ergänzt sie, indem es ein physikalisch verankertes Lernsignal liefert, das reale operative Erfolgskriterien abbildet.

Lernen aus dem realen Betrieb

PRO wird ausschließlich mit Daten aus realen Deployments trainiert, ohne simulationsgenerierte Rewards oder synthetische Annotationen. Die Trainingssignale entstehen aus Vergleichen zwischen Trajektorien und im Produktivbetrieb beobachteten Ergebnissen:

  • Erfolgreiche gegenüber gescheiterten Ausführungen
  • Trajektorien mit wenigen gegenüber vielen Wiederholversuchen
  • Effiziente Ausführungen gegenüber solchen mit erhöhter Taktzeit
  • Stabile Griffe gegenüber solchen, die eine Korrektur erfordern

Aus diesen Vergleichen erwirbt PRO ein implizites Verständnis dafür, welche Zwischenzustände und Übergänge auf wünschenswerte Ergebnisse hindeuten. So kann es in jeder Phase der Ausführung dichte Reward-Signale vergeben, selbst wenn das Endergebnis noch aussteht.

Bezug zum Real-World Learning Loop

Der Real-World Learning Loop beruht auf der Idee, dass sich ausgerollte Roboter kontinuierlich verbessern sollten, während sie nützliche Arbeit leisten. PRO ermöglicht diesen Kreislauf, indem es dafür sorgt, dass jede Sekunde Betrieb Lernsignal beisteuert – nicht nur seltene Erfolge oder Fehlschläge. Mit wachsender Flottengröße profitiert PRO von einer größeren Vielfalt an Zuständen und Ausführungskontexten, was zu sich potenzierenden Verbesserungen bei Reward-Qualität und nachgelagerter Policy-Leistung führt.

Daraus entsteht ein positiver Rückkopplungskreis: Bessere Reward Models ermöglichen effizienteres Lernen, das die Ausführungsqualität verbessert, was wiederum sauberere und informativere Daten für das weitere Training erzeugt.

Ergebnisse

Wir evaluieren Cortex 1.6 auf Pick-and-place-, Schuhkarton-Öffnungs- und Retourenprozessen mit Daten, die ausschließlich aus Live-Deployments im Produktivbetrieb stammen. Alle Kennzahlen werden direkt aus der Betriebstelemetrie berechnet, ohne simulierte Umgebungen oder handgebaute Task-Rewards. Verglichen wird die Leistung mit (i) einer Baseline-VLA-Policy aus Imitationslernen, (ii) Cortex 1.5, das auf binäre Erfolgssignale und menschlich ausgelöstes Policy-Patching setzt, und (iii) Cortex 1.6, das aus dichten skalaren Rewards lernt, die aus der Ausführung gewonnen werden.

Aufgabenleistung und Effizienz

Über alle Aufgaben hinweg erreicht Cortex 1.6 höhere Erfolgsquoten als frühere Modelle. Die Baseline-VLA erzielt eine Erfolgsquote von rund 80–82 %. Cortex 1.5 steigert den Erfolg auf ~95 %, vor allem durch gelernte Korrekturstrategien nach Fehlschlägen. Cortex 1.6 verbessert den Erfolg weiter auf ~98 % und zeigt damit zuverlässigere Manipulation und weniger unkorrigierte Fehlermodi.

Dichte Rewards von PRO ermöglichen schnelleres Lernen. Die Zeit, die Policies zur Konvergenz auf der jeweiligen Aufgabe benötigen, beträgt:

Pick-and-place
Baseline-VLA24hCortex 1.515hCortex 1.69h
Schuhkarton öffnen
Baseline-VLA45hCortex 1.527hCortex 1.614h
Retourenbearbeitung
Baseline-VLA80hCortex 1.548hCortex 1.626h

Über alle Prozesse hinweg verkürzt Cortex 1.6 die Konvergenzzeit um rund 2× gegenüber Cortex 1.5 und um mehr als 3× gegenüber der Baseline.

Korrektur- und Wiederholverhalten

Die Verbesserungen beim Erfolg beruhen auf besserer Korrektur und frühzeitigem Eingreifen:

  • Der Korrekturerfolg nach einem ersten Fehlschlag steigt von ~45 % (Baseline) auf ~65 % (Cortex 1.5) und ~80 % (Cortex 1.6).
  • Die durchschnittlichen Wiederholversuche pro Episode sinken nach dem Training mit PRO über alle Aufgaben hinweg um 30–50 %.

Lerneffizienz

Abbildung 3 zeigt, dass PRO mit 4–5× weniger Korrekturepisoden eine vergleichbare oder bessere Leistung erreicht als ein vollständiges SFT-Retraining. Dichte Fortschritts- und Risikosignale von PRO erlauben es, Reinforcement-Learning-Updates auf besonders wirksame Ausführungsabschnitte zu konzentrieren statt auf ganze Trajektorien.

Im Vergleich zu Cortex 1.5, das für das Auslösen von Lernprozessen auf explizite menschliche Eingriffe angewiesen ist, verbessert sich Cortex 1.6 im laufenden Betrieb autonom weiter. Dichte Reward-Signale aus dem Routinebetrieb ermöglichen Lernen selbst aus erfolgreichen, aber fragilen Ausführungen, die sonst kein Feedback liefern würden.

Zusammenfassung

Insgesamt verbessert Cortex 1.6:

  • Erfolgsquote: +6–9 % gegenüber Cortex 1.5 und 15–25 % gegenüber der Baseline-VLA
  • Korrekturquote: ~1,7× gegenüber der Baseline
  • Trainingskonvergenzzeit: ~2× schneller als Cortex 1.5 und ~3× schneller als die Baseline-VLA

Diese Ergebnisse zeigen, dass das Lernen dichter Rewards direkt aus realen Ausführungen robustere, effizientere und besser skalierbare Verbesserungen ermöglicht als binäres Feedback oder punktuelle menschliche Eingriffe allein.

Diskussion

Der Process-Reward Operator verschiebt Reinforcement Learning in physischen Systemen von einem Problem des Reward Engineering zu einem des Reward Learning. Indem PRO Rewards in operativen Signalen statt in abstrakten Aufgabendefinitionen verankert, richtet es die Lernziele an realen industriellen Leistungskennzahlen wie Zuverlässigkeit, Effizienz und Robustheit aus.

Cortex 1.6 löst nicht alle Herausforderungen des robotischen Lernens, adressiert aber einen zentralen Engpass bei der Skalierung realen Reinforcement Learnings: das Fehlen dichten, belastbaren Feedbacks. Damit bildet es eine Grundlage, auf der sich fortgeschrittenere Lernmechanismen – etwa Planung auf Basis von World Models oder hierarchisches Policy-Lernen – aufbauen lassen.

Fazit

Cortex 1.6 führt den Process-Reward Operator als fundierten Ansatz für dichtes Reward-Learning in realen Robotersystemen ein. Indem PRO kontinuierliche Fortschritts- und Risikosignale aus Betriebsdaten gewinnt, ermöglicht es Reinforcement Learning, das skalierbar, deploymenttauglich und eng an die reale physische Leistung gekoppelt ist. Das ist ein Schritt hin zu Robotersystemen, die nicht nur in der Welt handeln, sondern sich systematisch durch sie verbessern.

Wir stellen außerdem ein! Wenn Sie Interesse daran haben, zu uns zu stoßen, melden Sie sich gern.

Forschende, die sich für unsere Arbeit, Kooperationen oder andere Anliegen interessieren, schreiben bitte an research@sereact.ai.

Ressourcen zum Artikel

Inhalte und Assets aus diesem Beitrag abrufen

Textinhalt

Kopieren Sie den vollständigen Artikeltext in die Zwischenablage, um ihn bequem zu lesen oder zu teilen.

Bildmaterial

Laden Sie alle in diesem Artikel verwendeten hochauflösenden Bilder als ZIP-Datei herunter.

Neueste Artikel