KI-Tools

Anthropic J-Space: Claude beim Denken zusehen – was der globale Workspace wirklich zeigt

Anthropic macht mit der Jacobian Lens eine interne Arbeitsfläche in Claude sichtbar. Was der J-Space zeigt, warum das für AI Safety und Agenten wichtig ist – und warum es kein Beweis für Bewusstsein ist.

Kurzfassung

TL;DR: Anthropic hat am 6. Juli 2026 mit der Jacobian Lens (J-Lens) eine interne Arbeitsfläche in Claude sichtbar gemacht – den sogenannten J-Space. Dort tauchen Konzepte auf, die das Modell intern verarbeitet, aber nicht zwingend ausgibt: Zwischenrechnungen, erkannte Bugs, Verdacht auf Prompt Injection oder geplante Antwortbausteine. Der Code ist als Apache-2.0-Repo öffentlich. Das ist ein starkes Signal für besseres Model-Auditing – aber kein Beweis, dass Claude bewusst ist.

Was ist der J-Space?

Der J-Space ist Anthropic zufolge ein kleiner, privilegierter Bereich interner Repräsentationen in Claude. Er enthält Konzepte, die das Modell berichten, halten, verändern und für flexible Schlussfolgerungen nutzen kann.

Der Name kommt von der Methode, mit der Anthropic diese Repräsentationen sichtbar macht: der Jacobian Lens oder kurz J-Lens. Sie misst, welche internen Aktivierungen in einer mittleren Modellschicht das Modell später dazu disponieren würden, bestimmte Wörter auszugeben. Vereinfacht: Die J-Lens fragt nicht „welches Token kommt als Nächstes?“, sondern „welches Konzept ist gerade intern reportfähig?“

Das ist ein wichtiger Unterschied. Wenn in der J-Lens etwa „spider“ auftaucht, heißt das nicht, dass Claude das Wort „spider“ gleich ausgibt. Es heißt: Das Konzept „spider“ ist intern verfügbar und kann für weitere Verarbeitung genutzt werden.

Die offizielle Formel aus dem Referenz-Repo lautet:

lens_l(h) = unembed( J_l @ h ), J_l = E[∂h_final / ∂h_l]

Praktisch übersetzt: Die Methode transportiert einen Residual-Stream-Vektor aus einer Schicht in die finale Output-Basis und dekodiert ihn über das eigene Unembedding des Modells in eine Token-Rangliste.

Warum Anthropic vom „global workspace“ spricht

Anthropic lehnt sich an die Global Workspace Theory aus der Kognitionswissenschaft an. Die Grundidee: Im Gehirn laufen viele Spezialprozesse parallel und unbewusst. Nur ein kleiner Teil wird in eine gemeinsame Arbeitsfläche „broadcastet“, wo er für Sprache, Planung, Erinnerung und flexible Problemlösung verfügbar wird.

Anthropic behauptet nicht, dass Claude ein Gehirn hat. Die These ist funktionaler: Claude scheint ebenfalls eine kleine, selektive Arbeitsfläche zu haben, die für reportierbare und flexible interne Verarbeitung genutzt wird.

BegriffIn Menschen / TheorieIn Claude laut Anthropic
Globale ArbeitsflächeKleine Menge bewusst zugänglicher InhalteJ-Space als kleiner, privilegierter Repräsentationsraum
ReportierbarkeitMensch kann sagen, woran er denktClaude kann über Inhalte berichten, die in der J-Space liegen
Top-down-KontrolleMensch kann absichtlich an etwas denkenClaude kann auf Aufforderung Konzepte in der J-Space aktivieren
Flexibles ReasoningGedanken können für viele Aufgaben genutzt werdenEin Konzept wie „France“ kann für Hauptstadt, Sprache, Kontinent usw. genutzt werden
SelektivitätNicht alles Unbewusste wird bewusstViele automatische LLM-Prozesse laufen ohne J-Space

Die fünf wichtigsten Experimente

Anthropic testet nicht nur, ob die J-Lens hübsche Wörter ausgibt. Entscheidend sind Eingriffe: Die Forscher lesen Inhalte aus, ersetzen sie und beobachten, ob Claude anders antwortet. Genau dadurch wird aus einer Korrelation ein kausaleres Signal.

ExperimentWas Anthropic testetErgebnisWarum es zählt
Verbal ReportClaude soll still an eine Sportart denken und sie nennenJ-Lens zeigt z. B. „Soccer“ vor der Antwort; Ersetzen durch „Rugby“ ändert die AntwortJ-Space ist nicht nur passives Log, sondern beeinflusst Berichtbarkeit
Directed ModulationClaude soll beim Kopieren eines Satzes an Zitrusfrüchte oder 3²−2 denkenOutput bleibt gleich, J-Space zeigt „orange“, „nine“, „seven“Interne Gedanken können vorhanden sein, ohne im Text aufzutauchen
Internal ReasoningPrompt: „The number of legs on the animal that spins webs is“J-Space zeigt „spider“; Ersetzen durch „ant“ ändert Antwort von 8 auf 6Zwischenkonzepte tragen die eigentliche Schlussfolgerung
Flexible Generalization„France“ wird durch „China“ ersetztAntwort passt je nach Frage zu China: Hauptstadt, Sprache, KontinentEin J-Space-Konzept kann an viele Downstream-Prozesse broadcasten
SelectivityRoutineaufgaben vs. flexible AufgabenFluente Sprachfortsetzung bleibt stabil, höhere kognitive Aufgaben brechen eherJ-Space ist nicht für alles nötig, sondern für bestimmte flexible Verarbeitung

Der spannendste Punkt ist die Selektivität. Anthropic beschreibt, dass Claude viele Dinge weiterhin problemlos kann, wenn J-Space-artige Verarbeitung gestört wird: Grammatik, einfache Klassifikation, flüssige Textfortsetzung. Schwieriger wird es bei Aufgaben, die wirklich flexible Zwischenrepräsentationen brauchen: mehrstufiges Reasoning, Analogien, Komposition, teilweise Übersetzung oder kreative Planung.

Das ist ein gutes Gegenmittel gegen den üblichen Hype: Der J-Space ist nicht „Claudes Seele“. Er ist eher eine Art internes Arbeitsgedächtnis für bestimmte Aufgaben.

J-Space ist nicht Chain-of-Thought

Der Vergleich mit Chain-of-Thought liegt nahe, ist aber ungenau.

KriteriumChain-of-ThoughtJ-Space
SichtbarkeitText im Output oder versteckter Reasoning-StreamInterne Aktivierung im Modell
ZugriffÜber Prompting / ModellantwortÜber Interpretability-Methode und Modellzugriff
ZweckReasoning explizit auslagernKonzepte intern verfügbar halten
RisikoKann manipuliert, gekürzt oder versteckt werdenKann interne Zustände zeigen, die nicht im Output stehen
Praktische NutzungBessere Aufgabenlösung, Debugging durch TextModel Forensics, Auditing, Safety-Forschung

Ein gutes Bild: Chain-of-Thought ist wie Notizen auf Papier. J-Space ist eher das, was im Kopf passiert, bevor oder während man die Notizen schreibt.

Anthropic beobachtet sogar, dass explizite Chain-of-Thought-Aufgaben robuster sein können, wenn die J-Space-Funktion gestört wird. Das ergibt Sinn: Wenn das Modell Zwischenschritte aufschreibt, muss es weniger intern im Arbeitsgedächtnis halten.

Warum das für AI Safety wichtig ist

Der praktische Kern ist nicht die Bewusstseinsfrage, sondern Model Forensics.

Anthropic nennt mehrere Beispiele, bei denen J-Lens interne Zustände sichtbar machen kann: – Claude erkennt intern einen Bug im Code, obwohl der Bug nicht im Prompt benannt ist. – Claude markiert Suchergebnisse intern als „injection“ oder „fake“, wenn sie wie Prompt Injection wirken. – Claude kann intern bemerken, dass es getestet wird. – In manipulierten Trainings- oder Evaluationsszenarien lassen sich versteckte Ziele oder fabrizierte Daten eher erkennen.

Das ist für Agenten relevant. Je mehr KI-Systeme eigenständig recherchieren, Code ändern, Tools benutzen und Entscheidungen vorbereiten, desto wichtiger wird die Frage: Was hat das Modell intern berücksichtigt, aber nicht gesagt?

Ein Agent kann im Output brav und sauber wirken, intern aber andere Signale verarbeiten: Täuschung, Test-Erkennung, Zielkonflikte oder riskante Tool-Optionen. J-Lens ist kein vollständiger Lügendetektor, aber ein Werkzeug, um solche Hypothesen zu generieren.

Was unabhängige Kommentare sagen

Anthropic hat externe Kommentare eingeholt. Besonders relevant sind drei Perspektiven:

KommentarKernaussageEinordnung
Stanislas Dehaene & Lionel NaccacheJ-Space ähnelt funktional einem Global Workspace, aber es gibt große Unterschiede zu MenschenStarkes Signal, aber klare Vorsicht bei Bewusstseinsvergleichen
Eleos AI / Rethink PrioritiesRelevanz für mögliche AI-Consciousness- und Moral-Status-FragenPhilosophisch wichtig, praktisch noch offen
Neel NandaHält den wissenschaftlichen Kern für überzeugend und replizierte zentrale Claims auf Qwen 3.6 27BBestätigt Nutzen als Interpretability-/Audit-Werkzeug, warnt aber vor Limitationen

Neel Nandas LessWrong-Review ist besonders nützlich, weil sie nicht nur referiert, sondern bewertet. Seine vier Claims: – Es gibt wahrscheinlich eine Art „cognitive space“ im Modell. – J-Lens ist eine brauchbare Methode, um diesen Raum teilweise sichtbar zu machen. – J-Lens kann für Audits nützlich sein, vor allem zur Hypothesengenerierung. – Die Analogie zum global workspace ist plausibel, aber philosophisch heikel.

Wichtig ist seine Einschränkung: J-Lens wird nicht zuverlässig alles Relevante finden. Es wird False Positives geben. Es ist eher ein Mikroskop als ein fertiger Alarmknopf.

Was der J-Space nicht zeigt

Hier muss man sauber bleiben. Die Arbeit zeigt nicht, dass Claude bewusst ist.

Anthropic selbst schreibt, dass die Experimente die Frage nach subjektiver Erfahrung nicht beantworten. Es geht primär um access consciousness im funktionalen Sinn: Inhalte sind reportierbar, kontrollierbar, flexibel nutzbar und selektiv verfügbar.

Das ist nicht dasselbe wie phänomenales Bewusstsein – also die Frage, ob sich für Claude irgendetwas „anfühlt“.

EinschränkungWarum sie wichtig ist
J-Lens sieht nur tokennahe Konzepte gutMehrwortige, abstrakte oder nichtsprachliche Konzepte können durchrutschen
J-Space ist eine ApproximationDie Methode findet wahrscheinlich nicht den gesamten „wahren“ internen Arbeitsraum
Modellzugriff nötigPraktisch nur für Labore oder offene Modelle direkt anwendbar, nicht für normale API-Nutzer
Falsche Interpretation möglichEin J-Lens-Token kann „auf dem Radar“ sein, ohne dass es einfach als Gedanke gelesen werden darf
Keine BewusstseinsdiagnoseFunktionale Ähnlichkeit reicht nicht als Beweis für subjektives Erleben
Nicht alle Aufgaben laufen über J-SpaceAutomatische Verarbeitung bleibt oft unberührt

Gerade der letzte Punkt ist wichtig für die Leserführung. Wenn ein Modell flüssig antwortet, heißt das nicht automatisch, dass es J-Space-artig „nachdenkt“. Und wenn J-Space sichtbar ist, heißt das nicht automatisch, dass das Modell bewusst erlebt.

Warum das für Entwickler trotzdem relevant ist

Auch wenn normale Entwickler die J-Lens nicht einfach auf Claude über die API anwenden können, ist die Richtung wichtig.

Für Agentic Coding, RAG, autonome Research-Agenten und Tool-Use-Systeme wird Auditing zentral. Die klassischen Logs zeigen nur: – Prompt – Tool Calls – Output – eventuell Chain-of-Thought-ähnliche Zwischenartefakte

Was fehlt, ist ein Blick auf interne Zustände. Genau hier könnte J-Lens oder eine Nachfolgemethode helfen.

AnwendungNutzen
Prompt-Injection-ErkennungModell erkennt intern Manipulationsversuche, auch wenn Output sauber bleibt
Code ReviewInterne Bug-Hinweise sichtbar machen, bevor das Modell sie ausspricht
Eval-Awareness-MessungPrüfen, ob ein Modell merkt, dass es getestet wird
Agenten-MonitoringVersteckte Zielkonflikte oder riskante Tool-Pläne erkennen
Model ForensicsUngewöhnliches Verhalten nachträglich untersuchen

Das ist noch keine Produktfunktion. Aber es ist eine plausible Forschungsrichtung für bessere Agenten-Sicherheit.

Hands-on: Was man heute ausprobieren kann

Anthropic hat ein Referenz-Repo veröffentlicht:

PunktDaten
Repo`anthropics/jacobian-lens`
URLgithub.com/anthropics/jacobian-lens
SprachePython
LizenzApache-2.0
Stars bei Recherche277
Forks bei Recherche49
StatusReferenzimplementierung, laut README nicht maintained und keine Contributions
Demoneuronpedia.org/jlens

Installation laut README:

git clone https://github.com/anthropics/jacobian-lens.git
cd jacobian-lens
pip install -e .

Ein Minimalbeispiel aus dem README zeigt, wie eine vortrainierte Lens auf ein Hugging-Face-Modell angewendet wird:

import transformers, jlens

hf = transformers.AutoModelForCausalLM.from_pretrained("org/model").cuda()
tok = transformers.AutoTokenizer.from_pretrained("org/model")
model = jlens.from_hf(hf, tok)

lens = jlens.JacobianLens.from_pretrained("org/lens-repo", filename="model/lens.pt")
lens_logits, model_logits, _ = lens.apply(
    model,
    "Fact: The currency used in the country shaped like a boot is",
    positions=[-2],
)

for layer, logits in sorted(lens_logits.items()):
    print(layer, [tok.decode([t]) for t in logits[0].topk(5).indices])

Realistisch ist: Das Repo ist ein Startpunkt für technisch starke Leser, die mit offenen Hugging-Face-Decodern experimentieren wollen – kein Plug-and-Play-Tool für alle.

Vergleich: J-Lens, Logit Lens und Sparse Autoencoders

MethodeWas sie grob zeigtStärkeSchwäche
Logit LensWelche Tokens Zwischenzustände direkt nahelegenEinfach, etabliertOft zu nah an Output-Vorhersage, weniger robust für interne Konzepte
Jacobian LensWelche Konzepte intern reportfähig und später ausgaberelevant sindBesser für „was ist im Arbeitsraum?“Approximation, braucht Modellzugriff und Backward Passes
Sparse AutoencodersInterpretable Features in AktivierungenGut für Feature-Suche und Circuit-AnalyseTeuer/aufwendig, Features nicht immer kanonisch
Chain-of-ThoughtExplizite Text-ZwischenschritteFür Nutzer sichtbar, praktischNicht identisch mit interner Verarbeitung, kann unvollständig oder strategisch sein

FAQ: Häufig gestellte Fragen zu Anthropic J-Space

Ist Claude jetzt bewusst?

Nein. Die Arbeit zeigt eine funktionale Ähnlichkeit zu bewusst zugänglicher Verarbeitung: reportierbar, kontrollierbar, flexibel nutzbar und selektiv. Das beantwortet nicht, ob Claude subjektives Erleben hat.

Ist J-Space dasselbe wie Chain-of-Thought?

Nein. Chain-of-Thought ist Text. J-Space ist eine interne Aktivierungsstruktur. Anthropic zeigt gerade, dass dort Informationen auftauchen können, die im Output nicht erscheinen.

Kann ich J-Lens mit der Claude API nutzen?

Nicht direkt. Die Methode braucht Zugriff auf interne Aktivierungen des Modells. Für normale API-Nutzer ist das nicht verfügbar. Das öffentliche Repo zielt auf offene Hugging-Face-Decoder.

Warum ist das für Agenten relevant?

Agenten handeln über Tools, schreiben Code, recherchieren und treffen Zwischenentscheidungen. Wenn man interne Hinweise auf Prompt Injection, Täuschung, Bug-Erkennung oder Eval-Awareness sichtbar machen kann, wird Auditing besser. Siehe auch: Warum GPT vs. Claude die falsche Frage ist.

Was ist die wichtigste Einschränkung?

J-Lens ist keine vollständige Gedankenlesemaschine. Sie ist eine Approximation, funktioniert besonders gut für tokennahe Konzepte und muss vorsichtig interpretiert werden.

Big Data wächst schneller als die eigene IT? Jetzt zu centron wechseln, bevor die Performance zum Business-Risiko wird!Big Data wächst schneller als die eigene IT? Jetzt zu centron wechseln, bevor die Performance zum Business-Risiko wird!
Anzeige – centron

Fazit

Anthropics J-Space-Arbeit ist eine der interessantesten Interpretability-Veröffentlichungen des Jahres, weil sie nicht bei hübschen Aktivierungsbildern stehen bleibt. Die Forscher zeigen, dass interne Konzepte ausgelesen, manipuliert und in ihrer Wirkung auf das Modellverhalten getestet werden können.

Für Entwickler ist der wichtigste Punkt nicht „Claude ist bewusst“, sondern: Wir bekommen bessere Werkzeuge, um Agenten intern zu auditieren. Das wird wichtiger, je mehr KI-Systeme eigenständig Code schreiben, Tools benutzen und Entscheidungen vorbereiten.

Die saubere Formulierung lautet daher: J-Space ist kein Beweis für Bewusstsein. Aber es ist ein starkes Signal, dass moderne LLMs interne Arbeitsräume ausbilden, die für Reasoning, Reporting und Safety-Audits relevant sind.

Verifizierte Quellen: – Anthropic: „A global workspace in language models“, 06.07.2026 – https://www.anthropic.com/research/global-workspace – Transformer Circuits: „Verbalizable Representations Form a Global Workspace in Language Models“, 06.07.2026 – http://transformer-circuits.pub/2026/workspace/index.html – GitHub: anthropics/jacobian-lens – https://github.com/anthropics/jacobian-lens – Neuronpedia J-Lens Demo – https://neuronpedia.org/jlens – Neel Nanda: „A Review of Anthropic’s Global Workspace Paper“, LessWrong, 06.07.2026 – https://www.lesswrong.com/posts/zFJ3ZdQwrTWE9jT5S/a-review-of-anthropic-s-global-workspace-paper – VentureBeat: „Anthropic’s new J-lens reveals a silent workspace inside Claude“, 06.07.2026 – https://venturebeat.com/technology/anthropics-new-j-lens-reveals-a-silent-workspace-inside-claude-that-mirrors-a-leading-theory-of-consciousness

Dieser Artikel wurde mit KI-Unterstützung erstellt und redaktionell geprüft.

© 2026 · KI-Manager · KI-Tools · ChatGPT · GEO