Tencent Hy4 preview im Faktencheck: günstiges Langkontext-Modell oder Benchmarkriese?
Tencent Hy4 preview im Faktencheck: Was Architektur, Open-Weight-Lizenz, API-Preis, Benchmarks und Self-Hosting wirklich hergeben.
Kurzfassung
Tencent Hy4 preview ist ein technisch interessantes Open-Weight-Modell, aber noch kein unabhängig bestätigter Benchmarkriese. Tencent dokumentiert 770 Milliarden Backbone-Parameter, davon 49 Milliarden pro Token aktiv, und gut eine Million mögliche Kontextpositionen. Die Gewichte stehen unter Apache 2.0, die API kostet laut Tencent 0,834 US-Dollar pro Million Input- und 2,501 US-Dollar pro Million Output-Tokens. Das ist attraktiv für einen API-Pilot. Tencents Frontier-Narrativ läuft der unabhängigen Evidenz zum Start aber voraus.
Die Einschränkung ist wichtig: Ich habe Hy4 preview nicht mit einem eigenen API-Key getestet. Dieser Faktencheck trennt deshalb veröffentlichte Spezifikationen, Tencent-Messungen, unabhängige Leaderboards, Plattformtelemetrie und Community-Berichte voneinander.
Was ist Tencent Hy4 preview?
Tencent veröffentlichte Hy4 preview am 28. August 2026. Es ist ein textbasiertes Mixture-of-Experts-Modell (MoE) für Coding, Agentenaufgaben, lange Dokumentkontexte und wissenschaftliche Fragen. Der Zusatz „preview“ ist wörtlich zu nehmen: Tencent nennt selbst unnötig langes Reasoning und eine Tendenz zur wiederholten Überprüfung eigener Ergebnisse als bekannte Probleme.
MoE bedeutet, dass nicht für jedes Token alle Modellparameter rechnen. Hy4 besitzt laut offizieller Modellkarte einen Backbone mit 770 Milliarden Parametern, aktiviert pro Token aber 49 Milliarden. Das senkt die Rechenlast gegenüber einem gleich großen dichten Modell. Es macht Hy4 jedoch weder beim Download noch beim Hosting zu einem 49B-Modell, denn alle Expertengewichte müssen weiterhin gespeichert werden.
Wie ist Hy4 preview aufgebaut?
| Baustein | Dokumentierter Stand | Einordnung |
|---|---|---|
| Backbone | 78 Layer: ein Dense-FFN-Layer und 77 MoE-Layer | Ungewöhnlich großer, sparsamer Backbone |
| Experten | 256 geroutete und ein geteilter Experte pro MoE-Layer; Top-8 plus Shared Expert aktiv | 49B aktiv heißt nicht 49B Speicherbedarf |
| Attention | Gated DeepSeek Sparse Attention mit IndexCache | Effizienzclaim aus Herstellerdokumentation, noch ohne unabhängige Reproduktion |
| MTP | Eine native Schicht mit 10B Parametern, davon 0,7B aktiv | Dient spekulativer Dekodierung; kein automatischer Geschwindigkeitsbeweis |
| Kontext | `max_position_embeddings: 1048576` | Kapazitätsgrenze, keine Garantie für zuverlässiges Long-Context-Reasoning |
| Reasoning | Standardmäßig `high`, alternativ `no_think` | Relevant für Latenz und reale Tokenkosten |
| Lizenz | Apache License 2.0 | Kommerzielle Nutzung und Modifikation der veröffentlichten Artefakte möglich |
Die Million Kontextpositionen ist technisch real dokumentiert. Sie beantwortet aber nicht, ob das Modell eine relevante Information über die gesamte Länge zuverlässig wiederfindet, mehrere weit auseinanderliegende Belege korrekt verbindet oder bei maximalem Kontext wirtschaftlich läuft. Eine unabhängige Long-Context-Evaluation speziell für Hy4 preview lag zum Stichtag nicht vor.
Ist Hy4 preview wirklich Open Source?
Präziser ist: Hy4 preview ist ein Open-Weight-Modell mit Apache-2.0-lizenzierten Gewichten und veröffentlichtem Fine-Tuning-Code. Die BF16- und FP8-Checkpoints sind auf Hugging Face ohne Gate abrufbar. Das GitHub-Repository enthält außerdem Fine-Tuning-Unterstützung für DeepSpeed, LLaMA-Factory und ms-swift.
In den bis zum 30. August 2026 geprüften offiziellen öffentlichen Artefakten – Release, Model Cards und GitHub-Baum am Commit `509799be8cc7bfeb63353e7322b2daddf7f73a28` – fanden sich keine Trainingsdaten samt vollständiger Herkunft, kein vollständiger Pretraining-Code, kein reproduzierbares Pretraining-Rezept und keine vollständigen Evaluationslogs mit Prompts, Seeds und Modellantworten. Eine separate systematische System- oder Safety-Card war dort ebenfalls nicht verlinkt.
Tencents Bezeichnung „open source“ ist deshalb weiter gefasst als die praktisch relevante Transparenz. Die Lizenz der veröffentlichten Gewichte ist offen und permissiv. Der vollständige Entstehungsprozess des Modells ist es nicht.
Wie stark ist Hy4 preview wirklich?
Tencent zeigt eine umfangreiche Benchmarktabelle und bezeichnet Hy4 als Modell an der Open-Source-Frontier. Die Zahlen sind nicht wertlos, aber ihre Provenienz begrenzt die Aussagekraft: Der Hy4-Run stammt jeweils von Tencent, während Scaffolds, Budgets und teilweise auch Vergleichswerte zwischen den Benchmarks wechseln.
| Benchmark | Hy4 preview | Was der Wert zeigt | Was offenbleibt |
|---|---|---|---|
| Terminal-Bench 2.1 | 85,4 | Tencent erreichte diesen Wert mit einem Claude-Code-Harness | Kein Hy4-Eintrag im kanonischen verifizierten Leaderboard am Stichtag |
| SWE-bench Pro | 65,7 | Herstellerwert im angegebenen SWE-agent-Setup | Kein Hy4-Run auf dem öffentlichen Scale-Leaderboard am Stichtag |
| DeepSWE | 64,3 | Tencent-Messung mit mini-swe-agent | Kein Hy4-Eintrag im kanonischen mini-swe-agent-Leaderboard am Stichtag |
| Toolathlon-Verified | 74,1 | Tencent-Run mit internem Scaffold und angepasster Werkzeugumgebung | Nicht direkt mit dem Default-Agent-Leaderboard vergleichbar |
| ProgramBench | 17,5 | Deutliche Schwäche innerhalb von Tencents eigener Tabelle | Kein Beleg für durchgehend führende Coding-Leistung |
| GPQA Diamond | 92,3 | Starker Herstellerwert | Keine unabhängige Reproduktion dieses Hy4-Runs |
| HorizonMath pass@4 | 8,8 | Fortschritt gegenüber Hy3 in Tencents Setup | Keine öffentlichen Hy4-Run-Artefakte im 113-Aufgaben-Repository gefunden |
Das Problem ist nicht nur „Herstellerbenchmark versus unabhängiger Benchmark“. Tencents Fußnoten nennen unterschiedliche Agent-Harnesses und Budgets: SWE-agent, mini-swe-agent, Claude Code, Codex CLI und interne Scaffolds. Ein Stern kennzeichnet Tencents eigene Reruns von Vergleichsmodellen; Schrägstrichzellen verbinden teils einen übernommenen Fremdwert mit einem markierten Tencent-Rerun. So steht bei Terminal-Bench 2.1 für DeepSeek V4 Pro 0813 `87,9/80,3*`: Hy4s 85,4 liegt unter dem übernommenen 87,9-Wert, aber über Tencents 80,3-Rerun. Bei Terminal-Bench sind laut Appendix bis zu 500 Turns und zwölf Stunden möglich. Toolathlon nutzt teilweise reimplementierte MCP-Werkzeuge und ein verlängertes Timeout; auf ProgramBench wechselte Tencent für DeepSeek wegen repetitiver Denkloops vom sonst genutzten Claude Code zu mini-swe-agent.
Damit vergleicht die Tabelle häufig vollständige Modell-Harness-Konfigurationen statt ausschließlich Modelle unter identischen Bedingungen. Genau dieses Problem beschreibe ich ausführlicher im Artikel Der Agent-Harness frisst das Modell.
Warum die Benchmarkgrafik mehr verspricht als die Daten
Die begleitende Benchmarkgrafik ist kein neutral sortiertes Leaderboard. Hy4 steht in jeder Teilgrafik links, ist als einziger Balken farbig hervorgehoben und bleibt dort auch dann, wenn ein grauer Vergleichsbalken höher ist.
Das fällt bei schwächeren Ergebnissen besonders auf. In Tencents Benchmark-Appendix erreicht Hy4 auf ProgramBench 17,5, während Claude Opus 5 dort 39,5 erreicht. Bei HorizonMath liegt Hy4 mit 8,8 ebenfalls hinter mehreren Vergleichsmodellen. Solche Werte widerlegen Hy4 nicht, sie widersprechen aber einer pauschalen Spitzenposition über alle Aufgabenklassen.
Was zeigt der Blindtest gegen Kimi K3 und GLM-5.3?
Tencent ließ 163 interne Experten 203 Engineering-Aufgaben bewerten. Hy4 erreichte im Mittel 2,99 von 4 Punkten, Kimi K3 2,94 und GLM-5.3 2,92. Im paarweisen Vergleich berichtet Tencent gegen Kimi K3 51,2 Prozent Siege, 7,9 Prozent Unentschieden und 40,9 Prozent Niederlagen. Gegen GLM-5.3 waren es 46,8 Prozent Siege, 12,8 Prozent Unentschieden und 40,4 Prozent Niederlagen.
Das belegt, was Tencent intern unter seinem Versuchsaufbau gemessen hat. Es belegt keine allgemeine Überlegenheit. Vollständige Aufgaben, Antworten, Raterinstruktionen, Inter-Rater-Reliabilität sowie exakte Endpoint-Snapshots und Budgets wurden nicht veröffentlicht. Wer Hy4 gegen Kimi K3 abwägt, findet im Kimi-K3-Reality-Check die breitere Einordnung des Konkurrenzmodells.
Was zeigen unabhängige Daten bisher?
Die unabhängige Evidenz war am Launch-Wochenende dünn. Artificial Analysis führt Terminal-Bench 2.1 mit dem Terminus-2-Harness in E2B-Sandboxes über 89 Aufgaben und drei Wiederholungen aus. Hy4 war am Stichtag nicht in der sichtbaren Rangliste. Auch die kanonischen Leaderboards für Terminal-Bench 2.1, SWE-bench Pro, DeepSWE und Toolathlon-Verified zeigten noch keinen nachvollziehbaren Hy4-Eintrag.
BenchLM indexiert 28 veröffentlichte Hy4-Werte, während zahlreiche erfasste Benchmarkfelder leer bleiben. Die Seite markiert die vorhandenen Werte als verifiziert, definiert das aber nur als Rückführbarkeit auf eine veröffentlichte Quelle. Es bedeutet nicht, dass BenchLM das Modell unabhängig neu ausgeführt hat; die Werte stammen überwiegend aus der Tencent-Modellkarte.
Was verrät OpenRouter?
OpenRouter zeigte am 30. August einen einzelnen Provider und in der Providerübersicht rund 40 Tokens pro Sekunde sowie etwa 3,2 Sekunden Latenz. Die getrennte Dreitagesansicht meldete hohe Uptime, aber eine niedrigere Availability. Das sind dynamische Plattformdaten aus realem Verkehr, kein neutraler Qualitätsbenchmark. Die Oberfläche zeigte außerdem mehr Fehler bei strukturierten Ausgaben als bei Tool Calls; ohne öffentlichen Request-Nenner, Aufgabenmix und archivierte Momentaufnahme ist daraus jedoch keine belastbare Prozentzahl und keine Produktionsfreigabe ableitbar.
Was kostet Tencent Hy4 preview?
Der API-Preis ist der stärkste unmittelbar überprüfbare Vorteil. Tencent nennt 0,834 US-Dollar Input, 2,501 US-Dollar Output und 0,042 US-Dollar für Cache-Hits je eine Million Tokens. OpenRouter zeigte am Stichtag denselben Listenpreis.
| Modell | Input pro 1 Mio. Tokens | Output pro 1 Mio. Tokens | Cache-Hit pro 1 Mio. Tokens | Quelle |
|---|---|---|---|---|
| Hy4 preview | 0,834 USD | 2,501 USD | 0,042 USD | Tencent Release |
| Hy3 | 0,132 USD | 0,528 USD | 0,033 USD | Tencent TokenHub, Region Singapur |
| GLM-5.3 | 1,40 USD | 4,40 USD | 0,26 USD | Tencent TokenHub, Region Singapur |
| Kimi K3 | 3,00 USD | 15,00 USD | 0,30 USD | Tencent TokenHub, Region Singapur |
In dieser quellenübergreifenden Tabelle ist Hy4 zum veröffentlichten Launch-Preis deutlich günstiger als die Singapur-Promopreise für GLM-5.3 und Kimi K3, aber erheblich teurer als Hy3. Das ist kein global einheitlicher Vier-Modell-Tarifvergleich: Der Hy4-Wert stammt aus der Release-Ankündigung, die Vergleichswerte aus Tencents regionaler TokenHub-Seite. Der Listenpreis ist außerdem nicht mit den Kosten einer erledigten Aufgabe gleichzusetzen. Hy4 denkt standardmäßig auf `high`, und Tencent warnt selbst vor längerem als nötigem Reasoning sowie Überprüfungsschleifen. Mehr Reasoning-Tokens und Retries können den Preisvorteil verkleinern.
Der Cache-Preis ist attraktiv für wiederkehrende lange Systemprompts und stabile Kontextblöcke. Der reale Nutzen hängt von Cache-Trefferrate, Gültigkeitsdauer, Provider-Pinning und Promptstruktur ab. Eine kurzfristig hohe Cache-Hit-Rate auf OpenRouter ist keine feste Modelleigenschaft.
Kann ich Hy4 preview selbst hosten?
Technisch ja, auf normaler Entwicklerhardware praktisch nein. Die über die Hugging-Face-Dateiliste summierten 131 BF16-Safetensors umfassen rund 1,56 TB. Der offizielle FP8-Checkpoint besteht aus 130 Safetensors mit rund 814 GB.
| Variante | Gewichtsgröße | Offizieller oder dokumentierter Startpunkt | Praktische Einordnung |
|---|---|---|---|
| BF16 | rund 1,56 TB | SGLang: TP16 auf 2×8 H200/B200, TP8 auf 8×B300 oder TP8 auf 2×4 GB300 | Rechenzentrumsbetrieb über ein oder zwei Knoten |
| Offizielles MXFP8 | rund 814 GB | vLLM nutzt TP8; SGLang dokumentiert TP8 auf B200 und TP4 auf B300/GB300 | Blackwell/SM100+; H200 unterstützt diesen MXFP8-Pfad nicht |
| Community Q4_K_M | 435,20 GiB | Gepatchtes llama.cpp erforderlich | Weiterhin mehrere große GPUs oder starkes Offloading |
| Community STQ1_0 | 213,66 GiB | Gepatchter, fixierter llama.cpp-Stand erforderlich | Aggressive Quantisierung ohne vollständigen neutralen Qualitätsnachweis |
SGLang kalkuliert für den KV-Cache näherungsweise 95 KB pro Token und TP-Rank. Deshalb empfiehlt das offizielle Cookbook praktisch 131.072 Tokens auf einer H200-Konfiguration und 262.144 Tokens auf den aufgeführten B200-, B300- und GB300-Konfigurationen. Die deklarierte Million Kontextpositionen passt also nicht automatisch in jedes offizielle Serving-Setup.
Auch die Community-GGUFs sind kein bequemer Laptop-Download. Stock llama.cpp unterstützt die `hyv4`-Architektur laut AngelSlim-Dokumentation noch nicht. Für beide Varianten sind Patches gegen einen fixierten Commit nötig. Die dort gemessenen 19,52 Tokens pro Sekunde Decode auf acht H20-GPUs gelten nur für dieses konkrete quantisierte Setup und sind kein allgemeiner Hy4-Durchsatzwert.
Was sind die wichtigsten Einschränkungen?
- Preview-Status: Tencent bezeichnet Hy4 ausdrücklich als frühe Version und nennt Overthinking sowie Überprüfungsschleifen als bekannte Grenzen.
- Benchmarkprovenienz: Die wichtigsten Leistungswerte stammen von Tencent; vollständige Rohdaten und einheitliche Runs fehlen.
- Long Context: 1.048.576 Positionen sind dokumentiert, unabhängige Qualität über diese Länge aber nicht.
- Transparenz: In den geprüften offiziellen Artefakten sind Gewichte und Fine-Tuning-Code offen; Trainingsdaten und ein vollständiges Pretraining-Rezept fanden sich dort nicht.
- Safety: In den geprüften offiziellen Artefakten war am Stichtag keine separate systematische Safety- oder System-Card verlinkt.
- Self-Hosting: Selbst FP8 benötigt rund 814 GB Gewichtsdateien, zuzüglich Runtime- und KV-Cache-Budget.
- Produktion: Frühe OpenRouter-Telemetrie zeigt brauchbaren Durchsatz, aber noch keine langfristige Stabilitäts- oder Qualitätsaussage.
Tencents Formulierung einer „rekursiven Selbstverbesserung“ braucht ebenfalls Kontext. Das Unternehmen berichtet, Hy4 habe Trainingsmethoden, Datenstrategien, Evaluationen und Low-Level-Operatoren mitoptimiert und den End-to-End-Durchsatz um 31,8 Prozent gegenüber einer nicht vollständig dokumentierten Baseline erhöht. Ohne öffentliche Logs, Hardwaredaten und Kontrollversuche ist das ein Herstellerclaim über eine interne Agentenpipeline, kein Beleg für autonome allgemeine Selbstverbesserung. Die begrifflichen Grenzen erkläre ich im Artikel Rekursive Selbstverbesserung bei KI.
Für wen lohnt sich Hy4 preview?
| Zielgruppe | Empfehlung | Begründung |
|---|---|---|
| Teams mit langen Coding- und Agentenaufgaben | API-Pilot | Niedriger Listenpreis, großes Kontextfenster und offene Gewichte sind testenswert |
| Unternehmen mit eigenem Benchmarkset | Kontrollierter Vergleich | Identische Prompts, Harnesses, Budgets und Endpunkte sind aussagekräftiger als die Tencent-Grafik |
| Produktionssysteme mit JSON und Tool Calling | Erst Fehler- und Retry-Test | Frühe Plattformdaten reichen nicht für eine pauschale Freigabe |
| Organisationen mit großer GPU-Infrastruktur | Self-Hosting prüfen | Apache 2.0 ermöglicht Deploymentkontrolle, Hardwarebedarf bleibt hoch |
| Einzelentwickler mit Workstation oder MacBook | Nicht lokal einplanen | Selbst aggressive Community-Quantisierungen liegen bei rund 214 bis 435 GiB |
| Teams, die nur den besten Benchmarkwert suchen | Abwarten | Unabhängige, methodisch vergleichbare Hy4-Runs fehlen noch |
Meine Empfehlung ist ein begrenzter API-Pilot mit deinem eigenen Aufgaben-Set. Miss Erfolgsrate, Gesamttokens, Latenz, Retries, Tool-Calls und Schemafehler gegen genau dieselben Aufgaben bei den Alternativen. Eine Produktionsmigration allein wegen Tencents Benchmarkgrafik wäre verfrüht.
Quellen
- Tencent: Release-Ankündigung vom 28. August 2026
- Tencent Hy Research: Introducing Hy4 preview
- Hugging Face: Tencent Hy4 preview
- GitHub: Tencent-Hunyuan/Hy4-preview
- Apache-2.0-Lizenz am geprüften Snapshot
- vLLM-Rezept für Hy4 preview
- SGLang-Cookbook für Hy4 preview
- Artificial Analysis: Terminal-Bench v2.1
- OpenRouter: Hy4 preview
- AngelSlim: Hy4-preview GGUF
*Quellenstand: 30. August 2026. Dynamische Preise, Plattformmetriken und Leaderboards können sich nach diesem Stichtag ändern.*
FAQ: Häufig gestellte Fragen zu Tencent Hy4 preview
Ist Tencent Hy4 preview wirklich Open Source?
Die Gewichte und der veröffentlichte Fine-Tuning-Code stehen unter Apache 2.0. In den geprüften offiziellen Artefakten fehlen Trainingsdaten, vollständiger Pretraining-Code und ein komplettes Trainingsrezept. „Open Weight“ ist deshalb die präzisere Bezeichnung.
Schlägt Hy4 preview Kimi K3 und GLM-5.3?
In Tencents internem Blindtest mit 163 Experten und 203 Aufgaben lag Hy4 knapp vorn. Eine unabhängige Reproduktion unter identischen Bedingungen fehlt, daher ist keine allgemeine Überlegenheit belegt.
Kann Hy4 preview wirklich eine Million Tokens verarbeiten?
Die Konfiguration dokumentiert 1.048.576 maximale Positionen. Das beweist weder zuverlässiges Reasoning über die gesamte Länge noch praktische Bereitstellung auf jeder Hardware. Offizielle SGLang-Rezepte starten je nach System bei 131K oder 262K Kontext.
Kann ich Hy4 preview lokal betreiben?
Nur mit sehr großer Hardware oder starkem CPU-Offloading. Der offizielle FP8-Checkpoint umfasst rund 814 GB; selbst die aggressive Community-GGUF-Version benötigt rund 214 GiB für vollständige Residency und einen gepatchten Runtime-Stand.
Ist die Hy4-API günstiger als Kimi K3 und GLM-5.3?
Vergleicht man Hy4s veröffentlichten Launch-Preis von 0,834 US-Dollar Input und 2,501 US-Dollar Output pro Million Tokens mit den regionalen TokenHub-Promopreisen, ist Hy4 günstiger als Kimi K3 und GLM-5.3. Das ist kein global einheitlicher Tarifvergleich. Reale Task-Kosten hängen zusätzlich von Reasoning-Länge, Cache-Treffern, Retries und Fehlern ab.
Welche Datenschutzvorteile bietet Open Weight?
Eigene Infrastruktur kann Datenflüsse und Aufbewahrung besser kontrollierbar machen. Bei Hy4 setzt das jedoch Rechenzentrums-Hardware voraus. Wer die Tencent- oder OpenRouter-API nutzt, muss stattdessen die jeweiligen Verträge, Regionen, Logging- und Datenverarbeitungsregeln prüfen.
Was ist das größte Risiko der Preview?
Nicht ein einzelner schlechter Benchmark, sondern die Kombination aus dünner unabhängiger Evidenz, Overthinking, möglichem Schemafehler-Risiko, großer Hosting-Hürde und unvollständiger Trainings- und Safety-Dokumentation.


Fazit
Tencent Hy4 preview ist wegen Apache-2.0-Gewichten, niedrigem API-Preis und großem Kontextfenster einen kontrollierten Test wert. Ein unabhängiger Benchmarkriese ist das Modell am 30. August 2026 noch nicht: Dafür fehlen reproduzierbare Drittanbieter-Runs unter identischen Harnesses. Meine klare Empfehlung lautet deshalb API-Pilot statt Produktionsurteil, mit eigenen Kosten-, Latenz-, Tool-Call- und Structured-Output-Messungen vor jeder Migration.
Verwandte Themen: Kimi K3 im Reality-Check, warum der Agent-Harness das Modell frisst und rekursive Selbstverbesserung bei KI.