Option
Heim
Nachricht
Optimierung der Auswahl von KI-Modellen für reale Leistung

Optimierung der Auswahl von KI-Modellen für reale Leistung

11. August 2025
156

Unternehmen müssen sicherstellen, dass ihre anwendungstreibenden KI-Modelle in realen Szenarien effektiv funktionieren. Die Vorhersage dieser Szenarien kann herausfordernd sein und Bewertungen erschweren. Der aktualisierte RewardBench 2-Benchmark bietet Organisationen klarere Einblicke in die praktische Leistung eines Modells.

Das Allen Institute for AI (Ai2) hat RewardBench 2 eingeführt, eine verbesserte Version seines RewardBench-Benchmarks, der entwickelt wurde, um eine umfassende Bewertung der Modellleistung und Ausrichtung auf Unternehmensziele zu bieten.

Ai2 entwickelte RewardBench mit Klassifikationsaufgaben, die Korrelationen über Inferenzzeit-Berechnungen und nachgelagertes Training bewerten. RewardBench konzentriert sich auf Belohnungsmodelle (RMs), die die Ausgaben großer Sprachmodelle bewerten, indem sie Punktzahlen oder „Belohnungen“ vergeben, um Reinforcement Learning mit menschlichem Feedback (RHLF) zu steuern.

RewardBench 2 ist da! Wir haben lange gelernt aus unserem ersten Belohnungsmodell-Bewertungstool, um eines zu entwickeln, das deutlich schwieriger ist und stärker mit nachgelagertem RLHF und Inferenzzeit-Skalierung korreliert. pic.twitter.com/NGetvNrOQV

— Ai2 (@allen_ai) 2. Juni 2025

Nathan Lambert, ein leitender Forschungswissenschaftler bei Ai2, sagte VentureBeat, dass der ursprüngliche RewardBench zunächst gut funktionierte, aber sich entwickelnde Modellumgebungen aktualisierte Benchmarks erforderten.

„Da Belohnungsmodelle ausgefeilter wurden und Anwendungsfälle komplexer, sahen wir zusammen mit der Gemeinschaft, dass die erste Version die Komplexitäten menschlicher Präferenzen in der realen Welt nicht vollständig abdeckte“, erklärte er.

Lambert betonte, dass RewardBench 2 den Bewertungsumfang und die Tiefe verbessert, indem es vielfältige, herausfordernde Eingaben und verfeinerte Methoden integriert, um menschliche Urteile über KI-Ausgaben besser widerzuspiegeln. Es umfasst neue menschliche Eingaben, ein härteres Bewertungssystem und zusätzliche Domänen.

Nutzung von Bewertungen für die Modellbeurteilung

Belohnungsmodelle bewerten die Modellleistung, aber die Ausrichtung auf Unternehmenswerte ist entscheidend. Nicht ausgerichtete RMs können Probleme wie Halluzinationen verstärken, die Verallgemeinerung reduzieren oder schädliche Antworten während des Feinabstimmens und Reinforcement Learnings übermäßig begünstigen.

RewardBench 2 umfasst sechs Domänen: Faktenhaltigkeit, präzise Befolgen von Anweisungen, Mathematik, Sicherheit, Fokus und Gleichstand.

„Unternehmen können RewardBench 2 auf zwei Arten je nach ihren Bedürfnissen nutzen. Für RLHF sollten sie Best Practices und Datensätze von Top-Modellen in ihre Pipelines integrieren, da Belohnungsmodelle ein On-Policy-Training erfordern. Für Inferenzzeit-Skalierung oder Datenfilterung hilft RewardBench 2, das beste Modell für ihre Domäne mit korrelierter Leistung auszuwählen“, sagte Lambert.

Lambert betonte, dass Benchmarks wie RewardBench Nutzern ermöglichen, Modelle basierend auf ihren wichtigsten Prioritäten zu bewerten, anstatt auf eine generische Punktzahl. Er merkte an, dass die Leistung subjektiv ist, stark an den Nutzerkontext und die Ziele gebunden, wobei menschliche Präferenzen oft sehr nuanciert sind.

Ai2 brachte den ursprünglichen RewardBench im März 2024 auf den Markt und nannte ihn den ersten Benchmark und Leaderboard für Belohnungsmodelle. Seitdem sind neue Methoden wie Meta’s FAIR reWordBench und DeepSeek’s Self-Principled Critique Tuning für intelligentere, skalierbare RMs entstanden.

Super begeistert, dass unsere zweite Belohnungsmodell-Bewertung veröffentlicht ist. Sie ist deutlich schwieriger, viel sauberer und gut korreliert mit nachgelagertem PPO/BoN Sampling.

Frohes Hillclimbing!

Herzlichen Glückwunsch an @saumyamalik44, die das Projekt mit vollem Einsatz für Exzellenz leitete. https://t.co/c0b6rHTXY5

— Nathan Lambert (@natolambert) 2. Juni 2025

Erkenntnisse zur Modellleistung

Mit RewardBench 2 testete Ai2 sowohl bestehende als auch neu trainierte Modelle, einschließlich Varianten von Gemini, Claude, GPT-4.1 und Llama-3.1, neben Datensätzen und Modellen wie Qwen, Skywork und Tulu.

Die Ergebnisse zeigten, dass größere Belohnungsmodelle aufgrund stärkerer Basismodelle hervorragend abschneiden. Llama-3.1 Instruct-Varianten führten den Benchmark an, wobei Skywork-Daten Fokus und Sicherheit unterstützten und Tulu in Faktenhaltigkeit gut abschnitt.

Ai2 stellte fest, dass RewardBench 2 zwar die multidomänen- und genauigkeitsorientierte Bewertung für Belohnungsmodelle vorantreibt, aber in erster Linie Unternehmen dabei leiten sollte, Modelle auszuwählen, die am besten ihren spezifischen Bedürfnissen entsprechen.

Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Schreiben Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln
Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln

Die besten und am besten bewerteten KI-Outline-Generatoren für lange SEO-Artikel im Jahr 2026, sorgfältig zusammengestellt von XIX.AI. Diese leistungsstarken Tools bieten bahnbrechende Unterstützung bei der schnellen Erstellung hochwertiger Inhalte und steigern die Effizienz beim Schreiben erheblich. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und detaillierte Rankings, damit Sie die für Sie passende Option finden, die Sie unbedingt ausprobieren sollten. Entdecken Sie jetzt die Möglichkeiten und sichern Sie sich Ihren KI-Vorteil.

8 Tools
xix.ai
Bildung und Lernen KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung
KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung

Die besten KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung im Jahr 2026! XIX.AI hat eine Liste der besten leistungsstarken, bahnbrechenden Tools zusammengestellt, die Schülern helfen, ihre Produktivität zu steigern, Hausaufgaben effizienter zu erledigen und Prüfungen dank praxisnaher Tests mit Bravour zu meistern. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, detaillierte Rankings und unverzichtbare Optionen, um Ihren KI-Vorteil zu nutzen. Entdecken Sie es jetzt!

10 Tools
xix.ai
Musikkomposition KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions
KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions

2026 Neueste und beste KI-Stimm-Demo-Tools für Songwriter, Hook-Ersteller und mehrsprachige Content-Teams! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden detaillierte Vergleichsdaten zu kostenlosen und kostenpflichtigen Optionen, umfassende Rankings und empfehlenswerte Auswahlmöglichkeiten, die Ihnen helfen, Ihre Schreibeffizienz zu steigern und Ihr kreatives Potenzial zu entfalten. Entdecken Sie jetzt das perfekte Tool für all Ihre Content-Bedürfnisse!

9 Tools
xix.ai
Geschäft Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen
Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen

Die besten und am besten bewerteten KI-Tools für die Wettbewerbsanalyse für kleine Unternehmen im Jahr 2026! XIX.AI hat eine äußerst leistungsstarke, bahnbrechende Auswahl zusammengestellt, die wöchentlich anhand strenger Praxistests und detaillierter Rankings aktualisiert wird. Hier finden Sie einen umfassenden Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen dabei hilft, die unverzichtbaren Tools zu identifizieren, die Ihre Produktivität steigern und Ihnen einen Wettbewerbsvorteil verschaffen. Entdecken Sie jetzt das perfekte Tool für sich!

9 Tools
xix.ai
Bildbearbeitung Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz
Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz

2026 Neueste beste Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonsistenz! Diese hoch bewertete kuratierte Liste bietet leistungsstarke, bahnbrechende Lösungen, die Ihnen helfen, die Schreibeffizienz zu steigern, die Content-Erstellung zu optimieren und mühelos perfekte visuelle Ergebnisse zu erzielen. Jedes Tool wurde durch wöchentlich aktualisierte Rankings mit echten Tests geprüft, einschließlich detaillierter Vergleiche zwischen kostenlosen und kostenpflichtigen Versionen. Unterstützt von XIX.AI ist es der unverzichtbare Leitfaden für alle, die ihre KI-Vorteile nutzen möchten. Jetzt entdecken!

10 Tools
xix.ai
Prompt Die besten KI-Prompt-Bibliotheken für ChatGPT-Workflows
Die besten KI-Prompt-Bibliotheken für ChatGPT-Workflows

Die besten und am besten bewerteten KI-Prompt-Bibliotheken des Jahres 2026 zur Optimierung aller Arten von ChatGPT-Workflows. XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung zusammengestellt, die strengen Praxistests unterzogen wird, um Spitzenleistung zu gewährleisten. Hier finden Sie detaillierte Vergleiche zwischen kostenlosen und kostenpflichtigen Angeboten sowie Experten-Rankings, die Ihnen dabei helfen, die unverzichtbaren Tools auszuwählen, mit denen Sie Ihre Produktivität steigern und Ihren KI-Vorteil ausschöpfen können. Entdecken Sie sie jetzt!

11 Tools
xix.ai
Kommentare (3)
0/500
JeffreyThomas
JeffreyThomas 13. März 2026 21:01:22 MEZ

Como usuario que solo tiene conocimientos básicos, elegir el modelo adecuado es un dolor de cabeza. Este artículo menciona problemas prácticos que son ciertos; a veces, el modelo parece brillar en la prueba, pero en la práctica simplemente falla. Me pregunto si el RewardBench actualizado ayuda a predecir cuándo un modelo se 'descompone' de manera realista. Si las empresas confían demasiado en las métricas, podrían terminar con un fiasco en producción 😅. ¿Habrá herramientas más accesibles para los equipos pequeños?

DonaldGonzález
DonaldGonzález 6. Dezember 2025 23:30:36 MEZ

この記事、実運用でのAIモデルの難しさをしっかり分析してますね。特にリアルワールドでの性能評価の課題は興味深い。AI導入が進む中で、本当に役立つモデル選びができる企業が勝ち残るのかも。ユーザー体験を考えると、ベンチマークだけで選ぶのは危険かもしれない... 😅

CarlMartin
CarlMartin 17. September 2025 08:30:37 MESZ

C'est intéressant, mais j'aimerais voir plus d'exemples concrets sur comment évaluer la performance des modèles en situation réelle. Parfois les benchmarks ne reflètent pas la complexité du terrain 😅

OR