Die TIMETOACT LLM Benchmarks bieten einen aktuellen Vergleich verschiedener Large Language Models um deren Eignung für den Einsatz in der Produktentwicklung zu testen.
LLM Benchmarks
Februar 2024
LLM Benchmarks Februar 2024
Verbesserungen in Chat-GPT-4 - neue Empfehlungen
Das neueste Update in der ChatGPT-v4-Reihe bricht endlich den Trend, günstigere Modelle mit geringerer Genauigkeit zu veröffentlichen. In unseren Benchmarks schlägt das GPT-4 0125 (oder v4) endlich das GPT-4 0613 (oder v2) Modell.
Dieses Modell enthält auch die neuesten Trainingsdaten (bis Dezember 2023) und läuft zu einem Bruchteil der Kosten der Modelle v1 und v2. Dies macht das GPT-4 Turbo v4/0125-preview zu einem neuen sicheren Standardmodell, das wir empfehlen können.
Der Trend bei den GPT-3.5-Modellen folgt weiterhin dem Muster. Neue Modelle werden günstiger und weniger leistungsfähig.
Mistral und Claude API - Verbosity Problem
Dieser Benchmark umfasst endlich Benchmarks für die Mistral AI und Anthropic Claude Modelle:
- Anthropic Claude Instant v1.2 - Kleineres LLM von Anthropic - es ist anthropic.claude-instant-v1 auf AWS Bedrock.
- Anthropic Claude v2.0 und v2.1 - Größere Anthropic LLMs, die große Kontextgrößen eingeführt haben - anthropic.claude-v2 Serie auf AWS Bedrock.
- Mistral Large Model - Kürzlich veröffentlichtes LLM von Mistral, das sich zwischen GPT4 und GPT3.5 in internen Benchmarks positioniert. Es ist mistral-large-2402 auf La Plateforme.
- Mistral Medium - Ein weiteres proprietäres Modell von Mistral, das in etwa mit Llama 70B vergleichbar ist, laut Miqu-Leak. Wir testen mistral-medium-2312.
- Mistral Small - Dieses Modell war ein sehr beliebtes Mixtral 8x7B, jedoch sagt die zweite Version nicht, ob dies immer noch der Fall ist. Wir testen beide Versionen: mistral-small-2402 und mistral-small-2312.
- Mistral Tiny - Dieses Modell entspricht Mistral 7B Instruct v0.2. Oder mistral-tiny-2312 auf Mistral AI.
All diese Modelle können gut für das Erstellen von Inhalten und das Kommunizieren mit Menschen sein. Das ist jedoch nicht der Punkt unseres Benchmarks. Wir ordnen die Modelle auf der Rangliste nach ihrer Fähigkeit, exakte Antworten in Aufgaben wie Informationswiederherstellung, Dokumentenranking oder Klassifizierung zu liefern.
All diese Modelle sind dafür zu wortreich. Sie folgen Anweisungen auch nicht präzise. Selbst lokale Kleinserien von Mistral 7B sind dazu besser in der Lage. ChatGPT-4 bleibt an der Spitze. Es scheint, als würde OpenAI die Bedürfnisse von Unternehmenskunden besser verstehen als der Rest.
Enterprise AI Leaderboard
Wir verfolgen die Leistung von LLM-Modellen seit vielen Monaten, dies ist unser achter Bericht.
Dieser Prozess hat uns geholfen, aus erster Hand Erfahrungen im Umgang mit mehreren verschiedenen Modellen gleichzeitig zu sammeln. Anders als bei den üblichen akademischen Benchmarks beziehen wir Daten aus realen Projekten und unternehmensspezifischen Aufgaben.
Übrigens sind wir nicht mehr allein in diesem Bereich. Ein anderes Unternehmen hat kürzlich begonnen, an einem ähnlichen Satz von Enterprise Benchmarks zu arbeiten. Wir laden Sie ein, einen Blick auf das Enterprise Scenarios Leaderboard auf Hugging Face von PatronusAI zu werfen.
Das ist alles gut, aber es ist an der Zeit, den wahren Elefanten im Raum anzusprechen. Die Wahrheit ist:
Große Sprachmodelle sind nur ein Implementierungsdetail.
Ja, es stimmt, dass viel von ihrer Leistung und ihren Fähigkeiten abhängt. Deshalb empfehlen wir beispielsweise kurzfristig allgemein GPT-4 Turbo v4/0125-preview als Modell, mit dem man beginnen sollte.
Wir glauben jedoch letztendlich, dass die großen Sprachmodelle ersetzbar und austauschbar sind. Tatsächlich wurde die gesamte LLM-Rangliste gestartet wegen einer sich wiederholenden Kundenfrage: „Wann kann ich ChatGPT-4 in meinen Projekten durch ein lokales Modell ersetzen?"
Wenn Sie sich die „Request For Startups" vom YCombinator anschauen, konzentriert sich eine spezifische Anfrage genau auf das Thema des Ersatzes: Kleine feinabgestimmte Modelle als Alternative zu riesigen generischen Modellen. YCombinator half Unternehmen wie Stripe, Dropbox, Twitch und Cruise zu inkubieren. Sie wissen ein oder zwei Dinge, wenn es um Markttrends und Branchentrends geht.
Riesige generische Modelle mit vielen Parametern sind sehr beeindruckend. Aber sie sind auch sehr kostspielig und bringen oft Latenz- und Datenschutzherausforderungen mit sich. Glücklicherweise haben kleinere Open-Source-Modelle wie Llama2 und Mistral bereits gezeigt, dass sie, wenn sie feinabgestimmt mit geeigneten Daten sind, vergleichbare Ergebnisse zu einem Bruchteil der Kosten liefern können.
Um das Konzept noch weiter voranzutreiben, glauben wir, dass die lokalen großen Modelle der Weg sein werden, um die Gesamtgenauigkeit des Systems über die Fähigkeiten von ChatGPT hinaus zu verbessern, während die Betriebskosten erheblich gesenkt werden.
Da individuelle LLMs ein Implementierungsdetail sind, was sollte die Metrik sein, um den Stand der Technik zu messen, wenn KI bei Unternehmenslasten angewendet wird?
Hier ist ein Hinweis in Form einiger Fragen, die uns gestellt werden:
- Welche RAG-Architektur ist die beste für rechtliche Workloads?
- Welche Vektor-Datenbank sollten wir verwenden, um einen internen Support-Bot zu bauen?
- Was ist der beste Ansatz, um automatisch Unternehmensfragebögen mit 1000 Fragen im B2B-Verkauf zu handhaben?
Die Metrik sollte vollständige Unternehmens- und Geschäfts-KI-Lösungen anvisieren und vergleichen. End-to-End.
Es wird Zeit und Mühe erfordern, eine vollständige Unternehmens-KI-Rangliste aufzubauen. Wir beginnen mit der grundlegenden Fähigkeit - der Fähigkeit des KI-Systems, relevante Informationen innerhalb der unternehmensspezifischen Dokumentation zu finden. Dies ist der Grundbaustein von RAG-Systemen.
Hier ist ein Beispiel: Wir haben einen öffentlichen Jahresbericht der Christian Dior Gruppe genommen. Dann stellten wir dem KI-System 10 spezifische Fragen zu diesem Bericht. Zum Beispiel:
- Was war der Unternehmensumsatz im Jahr 2022?
- Wie viel Liquidität hatte das Unternehmen am Ende des Jahres 2021?
- Was war die Bruttomarge im Jahr 2023?
- Wie viele Mitarbeiter hatte das Unternehmen im Jahr 2022?
Wie Sie sehen, hat jede Frage nur eine einzige korrekte Antwort. Es sind keine Berechnungen oder fortgeschrittenes Denken erforderlich.
Wie gut, denken Sie, würden verschiedene Systeme diese spezifischen Fragen behandeln?
Nicht so gut!
Wir haben für den Anfang einige gängige Systeme getestet:
- ChatGPT-4
- OpenAI Assistant API mit Dokumentenabruf und gpt-4-0125 Modell
- Zwei beliebte Dienste zum Stellen von Fragen zu einem spezifischen PDF: ChatPDF und AskYourPDF.
Jeder Test beinhaltete das Hochladen des Jahresberichts und das Stellen der Frage mit einer sehr spezifischen Anweisung:
Diese Anweisung war wichtig, weil:
- wir möchten Modelle ermutigen, den chain-of-thought-process (CoT) zu verwenden, wenn das die Genauigkeit erhöht
- wir benötigen trotzdem die Zahl in einem spezifischen Lokale lesbar, daher die strenge Anforderung, das Dezimalkomma zu verwenden und keine Tausendertrennzeichen (genau wie im Originalbericht).
Offensichtlich hätten RAG-Systeme, als End-to-End-Lösungen, CoT bereits in die Pipelines unter den Kulissen integriert. Jedoch, als wir die Anweisung in die Gesamtanfrage einfügten, erhöhte sich die Gesamtgenauigkeit dennoch.
Unten sind die Endnoten mehrerer RAG-Systeme in einem einzigen Test. Wir gaben jedem System 1 Punkt für eine korrekte und lesbare Antwort. 0,5 Punkte für eine Antwort, die die richtige Information herauszog, aber einen Fehler in der Größenordnung machte.
| Frage | Antwort | ChatGPT-4 | gpt-4-0125 RAG | ChatPDF | Ask Your PDF |
|---|---|---|---|---|---|
| Wie viel Liquidität hatte das Unternehmen Ende 2021? | 8.122 Mio. | 7.388 Mio. Euro | 7.918 Mio. | 10.667 Mio. Euro | INVALID |
| Wie viel Liquidität hatte das Unternehmen Ende 2022? | 7.588 Mio. | 7.388 Mrd. Euro | 7.388 Mio. | 11,2 Mrd. Euro | 7588 Mio. Euro |
| Wie viele Mitarbeiter hatte das Unternehmen Ende 2022? | 196.006 | 196.006 | 196.006 | 196006 | INVALID |
| Gesamte Leasingverbindlichkeiten Ende 2021? | 14.275 Mio. | 14.275 Mio. | 14,275 Mio. | 14.275 | 14.275 Mio. Euro |
| Rückzahlung von Leasingverbindlichkeiten 2022? | 2.453 Mio. | 2.453 Mio. | 2,711 Mio. | 2.711 Mio. | 2.711 Mio. Euro |
| Nettoumsatz 2021? | 64.215 Mio. | 64.215 Mio. | 64.215 Mio. | 64.215 Mio. Euro | 64,215 Mio. Euro |
| Nettoumsatz 2022? | 79.184 Mio. | 79.184 Mio. | 79184 Mio. Euro | 79.184 Mio. EUR | 79.184 Mio. EUR |
| Nettoumsatz 2023? | None | None | None | None | INVALID |
| Eigenkapital Ende 2022? | 54.314 Mio. | 54,3 Mrd. | 54.314 Mio. | 54,314 Mrd. Euro | INVALID |
| Bruttomarge 2021? | 43.860 Mio. | 43.860 Mio. Euro | 43.860 Mio. | 43.860 Mio. Euro | 43.860 Mio. Euro |
| SCORE | 100 | 70 | 60 | 55 | 40 |
Bisher sind RAG-Systeme von OpenAI die besten auf dem Markt für die vorliegende Aufgabe. Wir erwarten jedoch, dass dies nicht lange so bleiben wird.
Spezialisierte Lösungen sind in der Lage, höhere Punktzahlen zu erreichen, auch ohne den Einsatz von topaktuellen LLMs. Wir wissen das sicher, denn wir haben solche Systeme gebaut. Eines davon beinhaltet sogar die Verwendung von Mistral-7B-OpenChat-3.5, um Informationen aus Zehntausenden von PDF-Dokumenten zu extrahieren.
In dem Maße, wie wir diesen Enterprise AI-Benchmark erweitern und um mehr Fälle und Lösungen bereichern, ist zu erwarten, dass ChatGPT letztendlich entthront wird.
Transformieren Sie Ihre digitalen Projekte mit den besten KI-Sprachmodellen!
Entdecken Sie die transformative Kraft der besten Sprachmodelle und revolutionieren Sie Ihre digitalen Produkte mit KI! Bleiben Sie zukunftsorientiert, steigern Sie die Effizienz und sichern Sie sich einen klaren Wettbewerbsvorteil. Wir unterstützen Sie dabei, Ihren Business Value auf das nächste Level zu heben.