Heim
Bailing Team geht eine Partnerschaft mit AReno ein, um einen lokalen Verstärkungslernzyklus für KI-Agenten zu entwickeln
Die Fähigkeit zur lokalen Bereitstellung garantiert noch keine nahtlose Bewältigung realer Geschäftsszenarien. In komplexen Arbeitsabläufen muss KI mehr leisten als nur zu kommunizieren; sie muss komplexe Regeln interpretieren, Sicherheitsbeschränkungen einhalten und externe Tools präzise aufrufen, um konforme Ergebnisse zu generieren. Um diese Herausforderung zu meistern, haben das Ant ASystem-Team und die Open-Source-Community AReno entwickelt, ein Toolkit für das Post-Training lokaler großer Modelle. Vor kurzem wurde AReno in das große BaiLing-Modell integriert, um einen schlanken Post-Training-Workflow zu etablieren, wodurch erfolgreich eine Agentic-Reinforcement-Learning-Schleife (RL) in einer Einzelrechnerkonfiguration geschaffen wurde.
Um die technische Reproduzierbarkeit zu gewährleisten, wurde „Tic-Tac-Toe“ aufgrund seiner klaren Regeln und des unmittelbaren Feedbacks als Validierungsaufgabe ausgewählt. Das Experiment wurde auf DGX-Spark-Hardware durchgeführt, wobei das Ling-3.0-tiny-Modell (insgesamt 7,9 Mrd. Parameter, davon 1,3 Mrd. aktiv) einem Post-Training unterzogen wurde. Anfangs verstand das Modell zwar die Grundregeln, führte jedoch unzulässige Züge aus. Durch die Umwandlung der Aufgabenregeln in einen präzisen Belohnungs-Feedback-Mechanismus und ein Training über 400 Schritte unter Verwendung des GSPO-Algorithmus stieg die durchschnittliche Belohnung des Modells sprunghaft an, und die Ausgabelänge stabilisierte sich. Nachfolgende Tests bestätigten einen qualitativen Sprung in der Stabilität und Rationalität des Modells hinsichtlich des Aufrufs von Werkzeugen und der Aktionsauswahl.

Diese Untersuchung validiert eine transparente, reproduzierbare Methodik zur Aufgabenanpassung: Identifizierung von Fehlern, Definition überprüfbarer Rückmeldungen sowie Durchführung von lokalem Training und erneuten Tests in derselben Umgebung. Dieses Rahmenwerk geht über Schach-Experimente hinaus und lässt sich nahtlos auf reale Produktionsszenarien anwenden, wie beispielsweise die Reparatur von Werkzeugaufrufen, die Extraktion strukturierter Felder, das Befolgen domänenspezifischer Anweisungen und intelligente Agenten in Geschäftsprozessen.
Ling-3.0-tiny ist in mehreren Open-Source-Versionen verfügbar, darunter BF16, FP8 und INT4. Entwickler können über Hugging Face oder die Moka-Community auf diese Modelle zugreifen. Darüber hinaus steht das Open-Source-Repository AReno für Code-Beiträge und technische Diskussionen zur Verfügung.
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (2)
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。
Die Fähigkeit zur lokalen Bereitstellung garantiert noch keine nahtlose Bewältigung realer Geschäftsszenarien. In komplexen Arbeitsabläufen muss KI mehr leisten als nur zu kommunizieren; sie muss komplexe Regeln interpretieren, Sicherheitsbeschränkungen einhalten und externe Tools präzise aufrufen, um konforme Ergebnisse zu generieren. Um diese Herausforderung zu meistern, haben das Ant ASystem-Team und die Open-Source-Community AReno entwickelt, ein Toolkit für das Post-Training lokaler großer Modelle. Vor kurzem wurde AReno in das große BaiLing-Modell integriert, um einen schlanken Post-Training-Workflow zu etablieren, wodurch erfolgreich eine Agentic-Reinforcement-Learning-Schleife (RL) in einer Einzelrechnerkonfiguration geschaffen wurde.
Um die technische Reproduzierbarkeit zu gewährleisten, wurde „Tic-Tac-Toe“ aufgrund seiner klaren Regeln und des unmittelbaren Feedbacks als Validierungsaufgabe ausgewählt. Das Experiment wurde auf DGX-Spark-Hardware durchgeführt, wobei das Ling-3.0-tiny-Modell (insgesamt 7,9 Mrd. Parameter, davon 1,3 Mrd. aktiv) einem Post-Training unterzogen wurde. Anfangs verstand das Modell zwar die Grundregeln, führte jedoch unzulässige Züge aus. Durch die Umwandlung der Aufgabenregeln in einen präzisen Belohnungs-Feedback-Mechanismus und ein Training über 400 Schritte unter Verwendung des GSPO-Algorithmus stieg die durchschnittliche Belohnung des Modells sprunghaft an, und die Ausgabelänge stabilisierte sich. Nachfolgende Tests bestätigten einen qualitativen Sprung in der Stabilität und Rationalität des Modells hinsichtlich des Aufrufs von Werkzeugen und der Aktionsauswahl.

Diese Untersuchung validiert eine transparente, reproduzierbare Methodik zur Aufgabenanpassung: Identifizierung von Fehlern, Definition überprüfbarer Rückmeldungen sowie Durchführung von lokalem Training und erneuten Tests in derselben Umgebung. Dieses Rahmenwerk geht über Schach-Experimente hinaus und lässt sich nahtlos auf reale Produktionsszenarien anwenden, wie beispielsweise die Reparatur von Werkzeugaufrufen, die Extraktion strukturierter Felder, das Befolgen domänenspezifischer Anweisungen und intelligente Agenten in Geschäftsprozessen.
Ling-3.0-tiny ist in mehreren Open-Source-Versionen verfügbar, darunter BF16, FP8 und INT4. Entwickler können über Hugging Face oder die Moka-Community auf diese Modelle zugreifen. Darüber hinaus steht das Open-Source-Repository AReno für Code-Beiträge und technische Diskussionen zur Verfügung.
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。











