Heim
27B Math SOTA und emotionales Klonen in 3 Sekunden: Youdao veröffentlicht die multimodale Zi Yue 4-Engine und die TTS-Engine als Open Source
NetEase Youdao hat kürzlich ein umfassendes Upgrade seines großen Modells „Confucius4“ auf Version 4.0 angekündigt. Confucius4 ist nun vollständig multimodal und unterstützt integrierte Interaktionen mit Text, Bildern und Audio. Youdao hat zudem seine zentralen multimodalen Modelle und Text-to-Speech-Modelle (TTS) als Open Source veröffentlicht, während das Übersetzungsmodell einer tiefgreifenden technischen Überarbeitung unterzogen wurde, die sowohl die Qualität als auch die Effizienz verbessert hat.
Das multimodale Modell erreicht SOTA in den Bereichen Bildverarbeitung und Mathematik und zeigt dabei überragende Leistung bei rein textbasierten Mathematikaufgaben
Laut der Ankündigung hat das als Open Source veröffentlichte multimodale Confucius4-Modell mit 27 Milliarden Parametern die auf visuellen Eingaben basierenden mathematischen Fähigkeiten in Bildungsszenarien auf ein branchenführendes Niveau (SOTA) gebracht. Unter Modellen ähnlicher Größenordnung zeichnet sich Confucius4 bei der Bearbeitung anspruchsvoller visueller Mathematik- und Physikaufgaben aus, die Diagramme beinhalten. Es zeigt zudem erhebliche Verbesserungen bei rein textbasierten chinesischen Mathematikaufgaben und erreicht eine branchenführende Genauigkeit von 81,4 %.

▲ Confucius4 erzielt unter Modellen gleicher Größenordnung erstklassige Ergebnisse bei mehreren visuellen Mathematik-Benchmarks
Bildquelle: https://huggingface.co/netease-youdao/Confucius4
Ein noch entscheidenderer Durchbruch liegt in der praktischen Kosteneffizienz. Nach Angaben der zuständigen Verantwortlichen nutzt das neue Modell ein verfeinertes Verfahren zur Rekonstruktion von Argumentationsketten. Durch die Aggregation einer großen Menge hochwertiger, prägnanter Argumentationsbeispiele zur tiefgreifenden Optimierung verkürzt es die Ausgabelänge der Argumentationskette um 43,2 %.
Das bedeutet, dass es Antworten schneller mit weniger Tokens und kürzeren Schlussfolgerungspfaden liefern kann, was die Inferenzkosten in realen Geschäftsszenarien für Unternehmen und Entwickler erheblich senkt.

▲ Confucius4 reduziert die Anzahl der Ausgabetoken bei mehreren visuellen Mathematik-Benchmarks erheblich
Bildquelle: https://huggingface.co/netease-youdao/Confucius4
Darüber hinaus hat das Confucius4-Forschungsteam das Modell für reale Hausaufgaben, Prüfungen und Problemlösungsszenarien, mit denen chinesische Schüler konfrontiert sind, tiefgreifend optimiert. Dadurch kann es authentische Lernherausforderungen bewältigen und wird so zu einem einfühlsameren digitalen Assistenten.
Open-Source-TTS: unterstützt 14 Sprachen, bildet die Originalstimme in 3 Sekunden nach – ohne Akzentprobleme bei der Sprachumschaltung
Neben dem multimodalen Modell wurde auch die Sprachsynthese-Engine (TTS) als Open-Source-Software veröffentlicht. Sie basiert auf einer hochmodernen „Sprach-Encoder + LLM“-Architektur und bietet Entwicklern und Content-Erstellern Zero-Shot-Fähigkeiten sowie leicht zugängliche Funktionen zum Klonen von Stimmen und zur emotionalen Sprachsynthese.
Derzeit werden 14 Sprachen vollständig unterstützt: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Spanisch, Indonesisch, Italienisch, Thailändisch, Portugiesisch, Russisch, Malaiisch und Vietnamesisch. Das System kann die Stimme eines Sprechers ohne zusätzliches Training auf natürliche Weise in verschiedene Sprachen übertragen, wobei die Stimmkonsistenz gewahrt bleibt und sichergestellt wird, dass die synthetisierten Ergebnisse muttersprachlich und flüssig klingen, ohne dass beim sprachübergreifenden Klonen ein Akzent durchscheint.
Beim Stimmklonen bietet Confucius4 vollständige „Upload-and-Clone“-Unterstützung. Nutzer stellen einfach beliebiges Audiomaterial bereit, und das System repliziert die Originalstimme innerhalb von drei Sekunden. Laut der Ankündigung liegt die Genauigkeit der Engine bei Klonaufgaben bei über 97 %, und die Ähnlichkeit zwischen der geklonten Stimme und der Originalstimme beträgt über 85 %. Es bewahrt die einzigartigen stimmlichen Merkmale des Sprechers und gibt gleichzeitig dessen emotionalen Tonfall präzise wieder – mit umfassenden Fähigkeiten, die zu den besten in diesem Bereich zählen.
Darüber hinaus zeigt dieses Open-Source-Modell eine hohe Robustheit in realen mehrsprachigen Szenarien. Es kann verschiedene Syntheseanforderungen bewältigen, darunter Alltagsgespräche, Nachrichtensendungen, Unternehmenswerbung und komplexe emotionale Ausdrucksformen.
Umfassende Verbesserung der Qualität des Übersetzungsmodells mit einer um 80 % höheren Inferenzgeschwindigkeit
Als eines der am tiefsten verwurzelten technologischen Standbeine von Youdao erhielt auch das Übersetzungsmodell in diesem Update bedeutende technische Verbesserungen, wodurch seine Leistung bei Übersetzungsaufgaben weiter gesteigert wurde.
Was die Daten betrifft, so hat das Confucius-Team Milliarden mehrsprachiger Einträge gesammelt und bereinigt sowie Fachleute mit TEM-8-Zertifizierung für eine mehrdimensionale manuelle Bewertung engagiert, um von Anfang an hochwertige Korpora zu gewährleisten.
Auf der algorithmischen Seite nutzt das Modell einen innovativen „Multi-Expert-OPD“-Modus und wendet einen intelligenteren „sanften Ansatz“ an, um die Stärken verschiedener Experten zu bündeln. Zudem führt es durch verstärktes Lernen Formatbelohnungen und Mechanismen zur Spracherkennung ein, wodurch häufige Probleme wie kontextfremde Übersetzungen und mehrsprachige Ausgaben bei der maschinellen Übersetzung effektiv gelöst werden.
Um den Anforderungen hochfrequenter, hochparalleler industrieller Anwendungen gerecht zu werden, ist das aktualisierte Übersetzungsmodell mit einem effizienten Beschleunigungsmechanismus ausgestattet, der die Gesamtgeschwindigkeit der Inferenz direkt um 80 % steigert. In Kombination mit einer maßgeschneiderten Lösung aus automatisierter Bewertung großer Modelle und zufälliger manueller Stichprobenentnahme demonstriert das Übersetzungsmodell der neuen Generation extrem hohe Standards hinsichtlich Geschwindigkeit und Qualität in zahlreichen Anwendungsszenarien, darunter Text-, Bild- und Dokumentübersetzung.
Ein Rückblick auf Youdaos Weg im Bereich der KI – von der Einführung von „Confucius“ als erstem auf den Bildungsbereich ausgerichteten großen Modell über die Einführung des „virtuellen Sprechcoaches Hi Echo“, der traditionelle Methoden des mündlichen Sprachtrainings revolutionierte, bis hin zur umfassenden Integration von „Confucius 2.0“ und „3.0“ in Software- und Hardware-Ökosysteme – hat Youdao die Nutzung von KI in realen Szenarien konsequent vorangetrieben. Im Jahr 2026 beschleunigte Youdao die Anwendung von KI mit einer Reihe von KI-Agent-Produkten wie LobsterAI, Youdao Treasure, Youdao Conference Agent und Thinkflow und realisierte damit eine zukunftsweisende, alle Szenarien abdeckende KI-Agent-Matrix.
Das Upgrade von Confucius 4 und die vollständige Open-Source-Veröffentlichung der Kernmodelle senken nicht nur die Eintrittsbarrieren für Entwickler in den Bereichen Multimodalität und Sprachsynthese erheblich, sondern demonstrieren auch einen ökologischen geschlossenen Kreislauf, in dem zugrunde liegende Kerntechnologien die Agent-Matrizen der oberen Schichten fördern. Youdao hofft, dass dieses Ökosystem aus groß angelegten, multimodalen Modellen durch die gemeinsamen Beiträge globaler Entwickler und der Open-Source-Community eine echte Produktivitätsrevolution in einer Vielzahl von Branchen auslösen wird.
Anhang: Open-Source-Adressen:
Multimodales Modell „Confucius4“: https://huggingface.co/netease-youdao/Confucius4
„Confucius4“-TTS-Modell: https://github.com/netease-youdao/Confucius4-TTS
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
NetEase Youdao hat kürzlich ein umfassendes Upgrade seines großen Modells „Confucius4“ auf Version 4.0 angekündigt. Confucius4 ist nun vollständig multimodal und unterstützt integrierte Interaktionen mit Text, Bildern und Audio. Youdao hat zudem seine zentralen multimodalen Modelle und Text-to-Speech-Modelle (TTS) als Open Source veröffentlicht, während das Übersetzungsmodell einer tiefgreifenden technischen Überarbeitung unterzogen wurde, die sowohl die Qualität als auch die Effizienz verbessert hat.
Das multimodale Modell erreicht SOTA in den Bereichen Bildverarbeitung und Mathematik und zeigt dabei überragende Leistung bei rein textbasierten Mathematikaufgaben
Laut der Ankündigung hat das als Open Source veröffentlichte multimodale Confucius4-Modell mit 27 Milliarden Parametern die auf visuellen Eingaben basierenden mathematischen Fähigkeiten in Bildungsszenarien auf ein branchenführendes Niveau (SOTA) gebracht. Unter Modellen ähnlicher Größenordnung zeichnet sich Confucius4 bei der Bearbeitung anspruchsvoller visueller Mathematik- und Physikaufgaben aus, die Diagramme beinhalten. Es zeigt zudem erhebliche Verbesserungen bei rein textbasierten chinesischen Mathematikaufgaben und erreicht eine branchenführende Genauigkeit von 81,4 %.

▲ Confucius4 erzielt unter Modellen gleicher Größenordnung erstklassige Ergebnisse bei mehreren visuellen Mathematik-Benchmarks
Bildquelle: https://huggingface.co/netease-youdao/Confucius4
Ein noch entscheidenderer Durchbruch liegt in der praktischen Kosteneffizienz. Nach Angaben der zuständigen Verantwortlichen nutzt das neue Modell ein verfeinertes Verfahren zur Rekonstruktion von Argumentationsketten. Durch die Aggregation einer großen Menge hochwertiger, prägnanter Argumentationsbeispiele zur tiefgreifenden Optimierung verkürzt es die Ausgabelänge der Argumentationskette um 43,2 %.
Das bedeutet, dass es Antworten schneller mit weniger Tokens und kürzeren Schlussfolgerungspfaden liefern kann, was die Inferenzkosten in realen Geschäftsszenarien für Unternehmen und Entwickler erheblich senkt.

▲ Confucius4 reduziert die Anzahl der Ausgabetoken bei mehreren visuellen Mathematik-Benchmarks erheblich
Bildquelle: https://huggingface.co/netease-youdao/Confucius4
Darüber hinaus hat das Confucius4-Forschungsteam das Modell für reale Hausaufgaben, Prüfungen und Problemlösungsszenarien, mit denen chinesische Schüler konfrontiert sind, tiefgreifend optimiert. Dadurch kann es authentische Lernherausforderungen bewältigen und wird so zu einem einfühlsameren digitalen Assistenten.
Open-Source-TTS: unterstützt 14 Sprachen, bildet die Originalstimme in 3 Sekunden nach – ohne Akzentprobleme bei der Sprachumschaltung
Neben dem multimodalen Modell wurde auch die Sprachsynthese-Engine (TTS) als Open-Source-Software veröffentlicht. Sie basiert auf einer hochmodernen „Sprach-Encoder + LLM“-Architektur und bietet Entwicklern und Content-Erstellern Zero-Shot-Fähigkeiten sowie leicht zugängliche Funktionen zum Klonen von Stimmen und zur emotionalen Sprachsynthese.
Derzeit werden 14 Sprachen vollständig unterstützt: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Spanisch, Indonesisch, Italienisch, Thailändisch, Portugiesisch, Russisch, Malaiisch und Vietnamesisch. Das System kann die Stimme eines Sprechers ohne zusätzliches Training auf natürliche Weise in verschiedene Sprachen übertragen, wobei die Stimmkonsistenz gewahrt bleibt und sichergestellt wird, dass die synthetisierten Ergebnisse muttersprachlich und flüssig klingen, ohne dass beim sprachübergreifenden Klonen ein Akzent durchscheint.
Beim Stimmklonen bietet Confucius4 vollständige „Upload-and-Clone“-Unterstützung. Nutzer stellen einfach beliebiges Audiomaterial bereit, und das System repliziert die Originalstimme innerhalb von drei Sekunden. Laut der Ankündigung liegt die Genauigkeit der Engine bei Klonaufgaben bei über 97 %, und die Ähnlichkeit zwischen der geklonten Stimme und der Originalstimme beträgt über 85 %. Es bewahrt die einzigartigen stimmlichen Merkmale des Sprechers und gibt gleichzeitig dessen emotionalen Tonfall präzise wieder – mit umfassenden Fähigkeiten, die zu den besten in diesem Bereich zählen.
Darüber hinaus zeigt dieses Open-Source-Modell eine hohe Robustheit in realen mehrsprachigen Szenarien. Es kann verschiedene Syntheseanforderungen bewältigen, darunter Alltagsgespräche, Nachrichtensendungen, Unternehmenswerbung und komplexe emotionale Ausdrucksformen.
Umfassende Verbesserung der Qualität des Übersetzungsmodells mit einer um 80 % höheren Inferenzgeschwindigkeit
Als eines der am tiefsten verwurzelten technologischen Standbeine von Youdao erhielt auch das Übersetzungsmodell in diesem Update bedeutende technische Verbesserungen, wodurch seine Leistung bei Übersetzungsaufgaben weiter gesteigert wurde.
Was die Daten betrifft, so hat das Confucius-Team Milliarden mehrsprachiger Einträge gesammelt und bereinigt sowie Fachleute mit TEM-8-Zertifizierung für eine mehrdimensionale manuelle Bewertung engagiert, um von Anfang an hochwertige Korpora zu gewährleisten.
Auf der algorithmischen Seite nutzt das Modell einen innovativen „Multi-Expert-OPD“-Modus und wendet einen intelligenteren „sanften Ansatz“ an, um die Stärken verschiedener Experten zu bündeln. Zudem führt es durch verstärktes Lernen Formatbelohnungen und Mechanismen zur Spracherkennung ein, wodurch häufige Probleme wie kontextfremde Übersetzungen und mehrsprachige Ausgaben bei der maschinellen Übersetzung effektiv gelöst werden.
Um den Anforderungen hochfrequenter, hochparalleler industrieller Anwendungen gerecht zu werden, ist das aktualisierte Übersetzungsmodell mit einem effizienten Beschleunigungsmechanismus ausgestattet, der die Gesamtgeschwindigkeit der Inferenz direkt um 80 % steigert. In Kombination mit einer maßgeschneiderten Lösung aus automatisierter Bewertung großer Modelle und zufälliger manueller Stichprobenentnahme demonstriert das Übersetzungsmodell der neuen Generation extrem hohe Standards hinsichtlich Geschwindigkeit und Qualität in zahlreichen Anwendungsszenarien, darunter Text-, Bild- und Dokumentübersetzung.
Ein Rückblick auf Youdaos Weg im Bereich der KI – von der Einführung von „Confucius“ als erstem auf den Bildungsbereich ausgerichteten großen Modell über die Einführung des „virtuellen Sprechcoaches Hi Echo“, der traditionelle Methoden des mündlichen Sprachtrainings revolutionierte, bis hin zur umfassenden Integration von „Confucius 2.0“ und „3.0“ in Software- und Hardware-Ökosysteme – hat Youdao die Nutzung von KI in realen Szenarien konsequent vorangetrieben. Im Jahr 2026 beschleunigte Youdao die Anwendung von KI mit einer Reihe von KI-Agent-Produkten wie LobsterAI, Youdao Treasure, Youdao Conference Agent und Thinkflow und realisierte damit eine zukunftsweisende, alle Szenarien abdeckende KI-Agent-Matrix.
Das Upgrade von Confucius 4 und die vollständige Open-Source-Veröffentlichung der Kernmodelle senken nicht nur die Eintrittsbarrieren für Entwickler in den Bereichen Multimodalität und Sprachsynthese erheblich, sondern demonstrieren auch einen ökologischen geschlossenen Kreislauf, in dem zugrunde liegende Kerntechnologien die Agent-Matrizen der oberen Schichten fördern. Youdao hofft, dass dieses Ökosystem aus groß angelegten, multimodalen Modellen durch die gemeinsamen Beiträge globaler Entwickler und der Open-Source-Community eine echte Produktivitätsrevolution in einer Vielzahl von Branchen auslösen wird.
Anhang: Open-Source-Adressen:
Multimodales Modell „Confucius4“: https://huggingface.co/netease-youdao/Confucius4
„Confucius4“-TTS-Modell: https://github.com/netease-youdao/Confucius4-TTS
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13











