Tencent hat die Open-Source-Vorschau Hy4 veröffentlicht, ein neues Flaggschiff-Modell für große Sprachen seines Hunyuan-Teams, das das Unternehmen an der Open-Source-Grenze positioniert. Die Gewichte landeten am 28. August auf Hugging Face, ModelScope, GitCode und CNB unter der freizügigen Apache 2.0-Lizenz, zusammen mit einer FP8-quantisierten Variante für günstigere Schlussfolgerungen.

Die Einführung verschärft den Wettbewerb zwischen chinesischen Laboren, die Frontier-Modelle mit offenem Gewicht anbieten, ein Bereich, der derzeit die GLM-Serie von Z.AI und die Kimi-Modelle von Moonshot AI umfasst. Bloomberg berichtete, dass Tencent behauptet, das neue Modell schneide in internen Tests besser ab als beide Konkurrenten – eine Behauptung, die, wie alle von Anbietern durchgeführten Bewertungen, eine genauere Prüfung verdient. Weitere Informationen zu dieser Geschichte finden Sie in unserer neueste KI-Entwicklungen.

Die Schlagzeilen

Hy4 Preview ist ein Mixture-of-Experts (MoE)-Modell mit 770 Milliarden Gesamtparametern, von denen 49 Milliarden pro Token aktiviert werden. Laut der offiziellen Modellkarte, die im GitHub-Repository von Tencent-Hunyuan veröffentlicht wurde, verfügt das Backbone über 78 Schichten, 256 geroutete Experten sowie einen gemeinsamen Experten und aktiviert die acht besten gerouteten Experten für jeden Token. Für die spekulative Dekodierung ist eine native Multi-Token-Vorhersageschicht (MTP) integriert – 10 Milliarden Gesamtparameter, 0,7 Milliarden aktiviert.

Das Kontextfenster ist die andere Hauptspezifikation: 1 Million Token, eine Länge, die es dem Modell ermöglicht, ganze Codebasen, lange Rechtsdokumente oder stundenlange Besprechungsprotokolle in einem einzigen Durchgang zu verarbeiten.

Architektur von Rivalen geliehen – und darauf aufgebaut

In einem für einen Flaggschiff-Launch ungewöhnlichen Maß an Offenheit heißt es in der Dokumentation von Tencent, dass das Aufmerksamkeitsmodul „von DeepSeek und GLM inspiriert“ wurde. Die Hy4-Vorschau verwendet Gated DeepSeek Sparse Attention (Gated DSA) in Kombination mit IndexCache für die schichtübergreifende Wiederverwendung von Sparse-Indizes, während der Restpfad Identity Hyper-Connections (iHC) verwendet, um den Informationsfluss zwischen den Schichten zu erweitern.

Für Entwickler, die das Modell bewerten, ist die Offenheit wichtig: Geringe Aufmerksamkeit macht einen 1M-Token-Kontext wirtschaftlich nutzbar, da naive volle Aufmerksamkeit bei dieser Länge unerschwinglich teuer wird. Sowohl DeepSeek als auch Z.AI haben Varianten dieses Designs in ihren eigenen Flaggschiffmodellen ausgeliefert.

Auf Produktivität ausgelegt, abgestimmt mit internen Experten

Tencent gibt an, mit Experten innerhalb des Unternehmens zusammenzuarbeiten – Software-Ingenieuren, Spieleentwicklern, Finanzanalysten und Sicherheitsexperten – und Schulungsdaten rund um die Arbeit zu erstellen, die sie tatsächlich liefern. Die Modellkarte hebt vier Schwerpunktbereiche hervor:

  • Software-Engineering: verbesserte Planung, Fehlerbehebung und Verifizierung bei langfristigen Entwicklungsaufgaben sowie Verbesserungen beim „visuellen Geschmack“ des Front-Ends.
  • Büro und Analyse: Konvertieren unübersichtlicher Kontexte aus mehreren Dateien in gemeinsam nutzbare Dokumente, Tabellenkalkulationen und Präsentationen mit besserer Handhabung von Gleichungen und Finanzmodellen.
  • Spieleentwicklung: Generieren spielbarer Prototypen aus einer einzigen Eingabeaufforderung und flüssiges Arbeiten mit Spiel-Engines über mehrere Verfeinerungsrunden hinweg.
  • Wissenschaftliche Forschung: behauptete Fortschritte in der KI-Forschung, der Molekulardynamik, der Physik der kondensierten Materie und reinen Mathematikproblemen.

Tencent sagt außerdem, dass die Hy4-Vorschau gemeinsam mit den eigenen Produkten CodeBuddy und WorkBuddy entwickelt wurde, sodass Modellgewinne zu Produktverbesserungen führen.

Was Tencents eigene Benchmarks zeigen

Der konkreteste Vergleich in den Einführungsmaterialien ist eine blinde Vergleichsbewertung, die Tencent mit 163 internen Experten durchgeführt hat, die Ergebnisse zu 203 technischen Aufgaben bewerteten. In diesen Tests erzielte Hy4 Preview einen Durchschnitt von 2,99 und lag damit leicht vor GLM 5.3 mit 2,92 (46,8 Prozent Siege, 12,8 Prozent Unentschieden, 40,4 Prozent Niederlagen) und Kimi K3 mit 2,94 (51,2 Prozent Siege, 7,9 Prozent Unentschieden, 40,9 Prozent Niederlagen).

Es lohnt sich, zwei Vorbehalte deutlich hervorzuheben. Erstens handelt es sich hierbei um interne Bewertungen von Tencent, nicht um unabhängige Benchmarks; Das Unternehmen hat noch keine von Dritten überprüften Ergebnisse in öffentlichen Bestenlisten veröffentlicht. Zweitens sind die Margen gering – eine Lücke von 0,05 bis 0,07 Punkten auf einer subjektiven Expertenbewertungsskala liegt innerhalb des Bereichs, den verschiedene Bewertungspools leicht umkehren könnten.

Die unabhängige Verifizierung erfolgt durch öffentliche Aggregate, während die Community das Modell in den kommenden Wochen durch standardisierte Codierungs-, Argumentations- und Agenten-Suites ausführt.

Früher Versand, mit bekannten Fehlern

Tencent weist ausdrücklich darauf hin, dass es sich hierbei um eine Vorschau handelt. Auf der Musterkarte sind bekannte Einschränkungen aufgeführt, darunter ein längerer Zeitaufwand für das Nachdenken über komplexe Aufgaben und die Tendenz, die eigene Arbeit zu sehr zu überprüfen. Das Team sagt, es würde „lieber früh ausliefern und hören, was kaputt geht“, und verweist auf den Ansatz, der die Hy3-Generation verbessert hat.

Für die Bereitstellung sind die Gewichtungen sowohl in BF16 als auch in FP8 verfügbar, mit Unterstützung vom ersten Tag an in vLLM und SGLang. Tencent veröffentlicht vorgefertigte Docker-Images für beide, mit Rezepten, die Tensor-Parallelität über 8 GPUs und MTP-basierte spekulative Dekodierung für latenzempfindliche Bereitstellung empfehlen. Im Lieferumfang des Modells sind eine Feinabstimmungspipeline und das AngelSlim-Quantisierungs-Toolkit enthalten.

Warum es wichtig ist

Das Open-Weight-Rennen in China hat sich zu einem Zweifrontenkrieg zwischen der GLM-Serie von Z.AI und den Kimi-Modellen von Moonshot entwickelt, wobei DeepSeek, Qwen und jetzt ein viel größerer Hunyuan-Teilnehmer das Feld drängen. Die Kombination aus Apache 2.0-Lizenzierung, einer 770-B-Parameterskala und einem 1-M-Token-Kontext in Hy4 Preview erhöht die Obergrenze dessen, was jeder herunterladen und selbst hosten kann – und die vLLM- und SGLang-Unterstützung vom ersten Tag an senkt die Hürde für die tatsächliche Ausführung.

Für Unternehmen, die offene Modelle gegen westliche geschlossene APIs abwägen, ist die praktische Frage nicht mehr, ob ein offenes Modell die geschlossene Leistung auf dem Papier erreichen kann, sondern ob die umgebenden Tools – Quantisierung, Bereitstellung, Feinabstimmung – ausgereift genug sind. Tencent geht davon aus, dass Hunyuan wieder ins Gespräch kommt, wenn er alles auf einmal und unter einer freizügigen Lizenz verschickt.

Ob die internen Benchmark-Behauptungen unabhängigen Tests standhalten, wird darüber entscheiden, ob die Hy4-Vorschau als echte Frontier-Open-Source-Version oder als Benchmark eines anderen Anbieters in einem überfüllten Feld in Erinnerung bleibt. Die Gewichte sind jetzt öffentlich, sodass das Urteil der Community nicht lange auf sich warten lassen sollte.

---

Bleib vorne bei KI

Die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.

Mehr KI-Nachrichten lesen →