Die TIMETOACT LLM Benchmarks bieten einen aktuellen Vergleich verschiedener Large Language Models um deren Eignung für den Einsatz in der Produktentwicklung zu testen.
LLM Benchmarks
Januar 2024
LLM Benchmarks Januar 2024
Mistral 7B OpenChat v3 (0106) übertrifft ChatGPT-3.5
Open-Source-Modelle werden von Monat zu Monat besser. Das sind großartige Neuigkeiten, denn Sie können diese Modelle lokal auf Ihren eigenen Rechnern betreiben. Unsere Kunden schätzen diese Möglichkeit sehr!
Fortschritt bei Open-Source-Modellen: Immer mehr lokale Varianten möglich
Mistral 7B OpenChat-3.5: Ein Top-Kandidat unter den Open-Source-Modellen
Unter diesen Open-Source-Modellen ist einer der besten Kandidaten eine Fine-Tune-Version von Mistral 7B namens Mistral 7B OpenChat-3.5, die eine sehr gute Balance zwischen Qualität, Leistung und den benötigten Rechenressourcen bietet, um lokal auf eigener Hardware betrieben zu werden.
Überlegenheit der dritten Version: Mistral 7B OpenChat-3.5 übertrifft ChatGPT-3.5 bei Business-Aufgaben
Bisher haben wir hauptsächlich die erste Version von Mistral 7B OpenChat-3.5 (Fine-Tune) verwendet. Unsere neuesten Benchmarks zeigen jedoch, dass die dritte Version deutlich besser ist. Sie schlägt ChatGPT-3.5 sogar bei unseren geschäftsorientierten Aufgaben!
Dennoch ist es noch ein weiter Weg, da die Version von ChatGPT-3.5, die von Mistral 7B OpenChat-3.5 übertroffen wurde, die älteste und schwächste ist. Trotzdem ist dies ein Anfang, und wir sind sehr gespannt, was uns in den kommenden Wochen und Monaten erwartet.
Warum gibt es keine Benchmarks für Mixtral 8x7B oder Mistral-Medium?
Sie haben wahrscheinlich schon von einer anderen, deutlich leistungsfähigeren Version von Mistral gehört: Mixtral 8x7B. Dieses Modell verwendet eine andere Architektur namens Sparse Mixture of Experts (MoE).
Dieses MoE-Modell ist leistungsfähiger als Mistral 7B. Es treibt auch das gehostete Modell mistral-small von MistralAI an. Wir haben keines dieser Modelle in diesem LLM-Benchmark. Auch das Mistral-Medium-Modell, das noch leistungsfähiger als Mixtral 8x7B ist, ist nicht enthalten.
Der Grund, warum wir sie noch nicht in die Benchmarks aufgenommen haben
Die zweite Generation der Mistral-Modelle wurde darauf trainiert, bessere Leistungen zu erbringen als die erste Generation. Diese Modelle liefern bessere Antworten, halten sich aber manchmal nicht exakt an das im Prompt und den Few-Shot-Beispielen vorgegebene Antwortformat. Sie sind ausführlicher als nötig.
Diese Ausführlichkeit macht das Modell für geschäftsorientierte Aufgaben und die Automatisierung von Geschäftsprozessen weniger nützlich.
Natürlich könnte man bei der Verwendung des Modells eine Nachbearbeitung hinzufügen, um zusätzliche Erklärungen zu entfernen. Es wäre jedoch unfair gegenüber den anderen Modellen, eine Mistral-spezifische Nachbearbeitung in die TIMETOACT LLM Benchmarks einzubauen, daher werden wir das nicht tun.
Die TIMETOACT Benchmarks halfen dem Mistral-AI-Team, Probleme mit dem Modell besser zu verstehen
Wir haben das Problem dem Mistral-AI-Team gemeldet und reproduzierbare Beispiele bereitgestellt. Die TIMETOACT LLM Benchmarks halfen dabei, die Auswirkungen zu verstehen und den Umfang einzugrenzen: Die erste Modellgeneration hatte dieses Problem nicht.
Das Mistral-AI-Team macht schnelle Fortschritte und arbeitet bereits an dem Problem:
Benchmark-Update nach Behebung des Problems
Zum jetzigen Zeitpunkt haben wir uns entschieden, die aktuellen Benchmark-Ergebnisse von mistral-tiny/mistral-small/mistral-medium nicht aufzunehmen, da es sich hierbei nur um ein vorübergehendes Problem handelt, das bald behoben sein wird. Sobald dies der Fall ist, werden wir ein Update der Benchmarks veröffentlichen.
Planung synthetischer Benchmarks: Wizards, Q&A und RAGs
Auch wenn reine LLM-Benchmarks interessant und spannend sind, können sie manchmal zu technisch und wenig relevant sein.
Wie wir von unseren Kunden gelernt haben, ist die Leistung eines LLM nur einer von vielen Faktoren, die zum Wert eines vollständigen Produkts oder einer Dienstleistung beitragen. Wir überlegen derzeit, einen weiteren synthetischen Benchmark zu erstellen - einen, der die Leistung vollständiger KI-Systeme bei geschäftsspezifischen Aufgaben bewertet. Zum Beispiel:
- Die richtige Antwort in einem umfangreichen PDF finden
- Eine korrekte Antwort synthetisieren, die das Nachschlagen in mehreren Dokumenten erfordert
- Eingehende Dokumentation korrekt bewerten und verarbeiten
Ihre Meinung ist gefragt: Welche geschäftsspezifischen Aufgaben sollten wir benchmarken?
Gibt es weitere geschäftsspezifische Aufgaben, die Sie gerne in unserem Benchmark sehen würden? Wir freuen uns auf Ihr Feedback und würden uns freuen, von Ihnen zu hören!
Sie sind auch herzlich eingeladen, uns zu kontaktieren, um bereits vor der Veröffentlichung einen Einblick in einen solchen Benchmark zu erhalten.
Transformieren Sie Ihre digitalen Projekte mit den besten KI-Sprachmodellen!
Entdecken Sie die transformative Kraft der besten Sprachmodelle und revolutionieren Sie Ihre digitalen Produkte mit KI! Bleiben Sie zukunftsorientiert, steigern Sie die Effizienz und sichern Sie sich einen klaren Wettbewerbsvorteil. Wir unterstützen Sie dabei, Ihren Business Value auf das nächste Level zu heben.