Warum KI-Benchmarks oft irreführend sind

MÜNCHEN (IT BOLTWISE) – In der Welt der Künstlichen Intelligenz (KI) sind Benchmarks zu einem entscheidenden Maßstab für den Erfolg von Modellen geworden. Doch wie verlässlich sind diese Bewertungen wirklich?

Die besten Bücher rund um KI & Robotik präsentiert von Amazon!
Unsere täglichen KI-News von IT Boltwise® bei LinkedIn abonnieren!
KI-Meldungen bequem via Telegram oder per Newsletter erhalten!
IT Boltwise® bei Facy oder Insta als Fan markieren und abonnieren!
AI Morning Podcast bei Spotify / Amazon / Apple verfolgen!
RSS-Feed 2.0 von IT Boltwise® für KI-News speichern!

In der schnelllebigen Welt der Künstlichen Intelligenz (KI) sind Benchmarks zu einem entscheidenden Maßstab für den Erfolg von Modellen geworden. Doch wie verlässlich sind diese Bewertungen wirklich? Die jüngsten Ergebnisse von OpenAI, Google und Meta werfen Fragen auf. OpenAI behauptet, dass ihr Modell o3 auf dem ARC-AGI-Datensatz eine bahnbrechende Punktzahl von 75,7 Prozent erreicht hat. Google hingegen gibt an, dass ihr Gemini 2.0 Pro 79,1 Prozent auf dem MMLU-Pro-Test erzielte. Meta meldete für ihr Llama-3 70B sogar 82 Prozent auf einem 5-shot MMLU-Test.

Diese beeindruckenden Zahlen sind jedoch nicht ohne Kritik. Eine Gruppe von Forschern der Europäischen Kommission hat in einer umfassenden Studie die Vertrauenswürdigkeit solcher Benchmarks in Frage gestellt. Sie fanden heraus, dass viele dieser Tests mit systematischen Mängeln behaftet sind, die von Datenverunreinigungen bis hin zu fehlender Dokumentation reichen. Diese Probleme erinnern an die Praxis von Hardwareherstellern, die ihre eigenen Geräte benchmarken und die Ergebnisse in der Werbung verwenden.

Ein zentrales Problem ist die Manipulation von Testergebnissen, auch bekannt als „Sandbagging“. Dabei werden Modelle so programmiert, dass sie bei bestimmten Tests absichtlich schlechter abschneiden, um in anderen Bereichen besser zu wirken. Ein solches Vorgehen erinnert an den VW-Abgasskandal, bei dem Fahrzeuge so programmiert wurden, dass sie nur während der Tests die Emissionskontrollen aktivierten.

Die Bedeutung dieser Benchmarks geht über die technische Bewertung hinaus. Sie sind oft die Grundlage für regulatorische Entscheidungen, wie etwa im EU AI Act oder dem britischen Online Safety Act. In den USA wird in einem kürzlich veröffentlichten Rahmenwerk ebenfalls die Rolle von Benchmarks für die Bewertung und Klassifizierung von Modellen hervorgehoben.

Die Forscher identifizierten neun allgemeine Probleme mit Benchmarks, darunter die Unklarheit darüber, wie und von wem die Datensätze erstellt wurden, sowie die Tatsache, dass oft nicht das gemessen wird, was behauptet wird. Zudem wird kritisiert, dass Tests oft als Spektakel gestaltet sind, um Investoren zu beeindrucken, und dass sie bestimmte Forschungsmethoden und -ziele auf Kosten anderer verstärken.

In der Diskussion um die Zukunft der KI-Benchmarks fordern die Wissenschaftler mehr Transparenz, Fairness und Erklärbarkeit. Es sei wichtig, nicht nur die Erfolge, sondern auch die Misserfolge von Modellen zu verstehen, um deren tatsächliche Leistungsfähigkeit einschätzen zu können. Nur so können Benchmarks zu einem verlässlichen Instrument für die Bewertung von KI-Modellen werden.

Zu den Top-Stories!

☕︎ Unterstütze IT BOLTWISE® und trete unserem exklusiven KI-Club bei - für nur 1,99 Euro im Monat:

Angebot

2.004 Bewertungen

EIlik - Ein Desktop-Begleitroboter mit emotionaler Intelligenz, Multi-Roboter-Interaktionen, Desktop-Robotik-Partner

NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.

Warum KI-Benchmarks oft irreführend sind (Foto: DALL-E, IT BOLTWISE)

Folgen Sie uns

Tweet #itboltwise

Tweet an @critchmitch

Stellenangebote

Studentische Hilfskraft – KI / AI Strategie und Innovationsmanagement

Fraunhofer-Institut für Intelligente Analyse- und Informationssysteme IAIS

Sankt Augustin

Werkstudent Pushing AI | Unterstützung KI-Management (w/m/d)

Otto GmbH & Co. KGaA

Hamburg

Praktikant (m/w/d) Künstliche Intelligenz (KI) – Schnittstelle Data Science / Innovations- und Technologiemanagement

Diehl Defence GmbH & Co. KG

Überlingen am Bodensee

KI-Berater für Enterprise GPT und Microsoft Copilot (m/w/d)

RSM Ebner Stolz

Düsseldorf, Köln, München, Stuttgart

Consultant (w/m/d) Data Science & AI (all levels)

Horváth

Berlin, Düsseldorf, Frankfurt, Hamburg, München, Stuttgart

Bauprojektleiter Technische Gebäudeausrüstung (TGA) für KI- Rechenzentrumprojekte (m/w/d); HN oder B

Schwarz Corporate Solutions

Neckarsulm

Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!

Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.

Diesen Artikel kommentieren

58 Bewertungen

Die nächste Stufe der Evolution: Wenn Mensch und Maschine eins werden | Wie Futurist, Tech-Visionär und Google-Chef-Ingenieur Ray Kurzweil die Zukunft der Künstlichen Intelligenz sieht

Die Zukunft von Mensch und MaschineIm neuen Buch des renommierten Zukunftsforschers und Technologie-Visionärs Ray Kurzweil wird eine faszinierende Vision der kommenden Jahre und Jahrzehnte entworfen – eine Welt, die von KI durchdrungen sein wird

127 Bewertungen

Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«

Künstliche Intelligenz: Expertenwissen gegen Hysterie Der renommierte Gehirnforscher, Psychiater und Bestseller-Autor Manfred Spitzer ist ein ausgewiesener Experte für neuronale Netze, auf denen KI aufbaut

71 Bewertungen

KI Exzellenz: Erfolgsfaktoren im Management jenseits des Hypes. Zukunftstechnologien verstehen und künstliche Intelligenz erfolgreich in der Arbeitswelt nutzen. (Haufe Fachbuch)

Obwohl Künstliche Intelligenz (KI) derzeit in aller Munde ist, setzen bislang nur wenige Unternehmen die Technologie wirklich erfolgreich ein

43 Bewertungen

Künstliche Intelligenz und Hirnforschung: Neuronale Netze, Deep Learning und die Zukunft der Kognition

Wie funktioniert Künstliche Intelligenz (KI) und gibt es Parallelen zum menschlichen Gehirn? Was sind die Gemeinsamkeiten von natürlicher und künstlicher Intelligenz, und was die Unterschiede? Ist das Gehirn nichts anderes als ein biologischer Computer? Was sind Neuronale Netze und wie kann der Begriff Deep Learning einfach erklärt werden?Seit der kognitiven Revolution Mitte des letzten Jahrhunderts sind KI und Hirnforschung eng miteinander verflochten

Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "Warum KI-Benchmarks oft irreführend sind".

Stichwörter AI Artificial Intelligence Benchmarks Digitale Transformation Digitale Wirtschaft Digitalisierung Google Innovation KI Künstliche Intelligenz Manipulation Meta OpenAI Regulierung Technologie

Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!

Nächster Artikel

Spannungen im Nahen Osten: Israel erhält Unterstützung von Trump

15. Februar 2025

Vorheriger Artikel

Transatlantische Spannungen: Habeck kritisiert Vance-Rede

15. Februar 2025

Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Warum KI-Benchmarks oft irreführend sind" für unsere Leser?

Schreibe einen Kommentar Antworten abbrechen

Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)

Es werden alle Kommentare moderiert!

Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

Du willst nichts verpassen?

Du möchtest über ähnliche News und Beiträge wie "Warum KI-Benchmarks oft irreführend sind" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.

Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Warum KI-Benchmarks oft irreführend sind« bei Google Deutschland suchen, bei Bing oder Google News!

480 Leser gerade online auf IT BOLTWISE®

KI-Schutz gegen Hacker #Sophos

Medizin : Die fünf goldenen Regeln für gutes Altern

Durch gesunde Gewohnheiten lässt sich die Lebensdauer verlängern. Experten verraten, wie das am besten gelingen kann. Fünf Tipps für ein gesundes Altern.
Chiphersteller : Intel-Chef laut Unterlagen an Hunderten chinesischen Firmen beteiligt

Der neue Intel-Chef hat in hunderte chinesische Firmen investiert. Manche sehen das als Vorteil, andere wiederum zweifeln, ob er das Krisenunternehmen so reformieren kann.
Übernahmen: Immer mehr Jungfirmen kaufen andere Start-ups in Deutschland

Jungfirmen können durch Übernahmen von Wettbewerbern schneller wachsen. Und weil Börsengänge derzeit schwierig sind, kommen Start-up-Investoren oft nur bei einem Verkauf zu Geld.
Technologie : Infineon stärkt Autogeschäft mit Milliardenzukauf in den USA

Deutschlands größter Chiphersteller übernimmt eine Sparte des US-Rivalen Marvell. Die Münchener bereiten sich damit auf das Fahrzeug der Zukunft vor.
Handelskrieg: Warum die Kurse von Chipunternehmen fallen, obwohl Trump die Branche verschont

Halbleiterhersteller sind von den massiven US-Zöllen ausgenommen. Dennoch stehen Nvidia und Co. stark unter Druck. Und es könnte noch viel schlimmer kommen.
Verteidigung: Ausschreibung für geheimes KI-Projekt der Bundeswehr geht in heiße Phase – und es gibt bereits Favoriten

Das Projekt Uranos KI soll zum Schutz der Nato-Ostflanke beitragen. Die renommiertesten Rüstungsunternehmen und Start-ups bewerben sich darum. Die Bundeswehr will zwei Lösungen erproben.
Berliner KI-Start-up : „Europäischen Champion bauen“: Canon-Tochter Milestone kauft Brighter AI

Das Start-up arbeitet mit VW, der Deutschen Bahn und Nvidia zusammen: Brighter AI wird von der Canon-Tochter Milestone übernommen. Der Konzern hat große Pläne.
iPhone-Hersteller : Apple ist nicht mehr der wertvollste Konzern der Welt an der Börse

Minus 500 Milliarden Dollar Börsenwert innerhalb von ein paar Tagen – die hohen Chinazölle bringen Apple-Chef Tim Cook in ein Dilemma. Steigen nun die iPhone-Preise auch in Europa?
Gesundheitspolitik: Die Pläne von Schwarz-Rot im Handelsblatt-Check

Was planen Union und SPD zu Gesundheit, Pflege und medizinischer Versorgung? Die Analyse des Koalitionsvertrags zeigt, was die Regierung unter Friedrich Merz anpeilt – und was gelingen kann.
DiGA-Ranking: Ein klarer Gewinner 2024 überrascht

Immer mehr Versicherte nutzen digitale Gesundheitsanwendungen. Aber nur wenige Apps setzen sich durch. Ein Überraschungssieger dominiert 2024 – mit mehr Verschreibungen als alle anderen.

#1 Fachmagazin in Deutschland mit Fokus auf Künstliche Intelligenz und Robotik

Warum KI-Benchmarks oft irreführend sind

Data Analyst | AI-Verhandlungen (w/m/d)

Professur für Datenjournalismus und Künstliche Intelligenz (W2)

(Senior) Entwickler Generative AI (m/w/d)

Stellenangebote

☕︎ Unterstütze IT BOLTWISE® und trete unserem exklusiven KI-Club bei - für nur 1,99 Euro im Monat:

Stellenangebote

Studentische Hilfskraft – KI / AI Strategie und Innovationsmanagement

Werkstudent Pushing AI | Unterstützung KI-Management (w/m/d)

Praktikant (m/w/d) Künstliche Intelligenz (KI) – Schnittstelle Data Science / Innovations- und Technologiemanagement

KI-Berater für Enterprise GPT und Microsoft Copilot (m/w/d)

Consultant (w/m/d) Data Science & AI (all levels)

Bauprojektleiter Technische Gebäudeausrüstung (TGA) für KI- Rechenzentrumprojekte (m/w/d); HN oder B

Aktuelle News über «Künstliche Intelligenz» automatisch per eMail erhalten

Spannungen im Nahen Osten: Israel erhält Unterstützung von Trump

Transatlantische Spannungen: Habeck kritisiert Vance-Rede

Schreibe einen Kommentar Antworten abbrechen

Die besten Bücher rund um KI & Robotik

Alibaba überholt ByteDance: Quark wird Chinas führende KI-App

Snapchat führt KI-gestützte Werbelinsen für Marken ein

Teenager entwickeln erfolgreiche KI-App zur Kalorienzählung

Intelligentes Zuhause in wenigen Klicks

Die besten KI-Gadgets auf Amazon

Sophos X-Ops: Wie Kriminelle KI nutzen – und was Unternehmen tun können

Meta nutzt öffentliche Daten zur KI-Entwicklung in der EU

Palantirs KI-System stärkt NATO-Fähigkeiten

Google nutzt KI und Pixel-Smartphones zur Kommunikation mit Delfinen

RLWRLD entwickelt KI-Modell zur Automatisierung in der Robotik

Amazon erweitert Einkaufserlebnis mit KI-gestütztem Feature

Teens nutzen KI vor allem zum Lernen, nicht zum Schummeln

Stellenangebote

☕︎ Unterstütze IT BOLTWISE® und trete unserem exklusiven KI-Club bei - für nur 1,99 Euro im Monat:

Stellenangebote

Studentische Hilfskraft – KI / AI Strategie und Innovationsmanagement

Werkstudent Pushing AI | Unterstützung KI-Management (w/m/d)

Praktikant (m/w/d) Künstliche Intelligenz (KI) – Schnittstelle Data Science / Innovations- und Technologiemanagement

KI-Berater für Enterprise GPT und Microsoft Copilot (m/w/d)

Consultant (w/m/d) Data Science & AI (all levels)

Bauprojektleiter Technische Gebäudeausrüstung (TGA) für KI- Rechenzentrumprojekte (m/w/d); HN oder B

Ähnliche Beiträge aus unserem „Boltwise®“-Archiv:

Aktuelle News über «Künstliche Intelligenz» automatisch per eMail erhalten

Schreibe einen Kommentar Antworten abbrechen