Die TIMETOACT LLM Benchmarks bieten einen aktuellen Vergleich verschiedener Large Language Models um deren Eignung für den Einsatz in der Produktentwicklung zu testen.
LLM Benchmarks
März 2024
LLM Benchmarks März 2024
Anthropic Claude 3 Modelle
Anthropic hat kürzlich die dritte Generation ihrer Modelle veröffentlicht:
- Haiku
- Sonnet
- Opus
Alle Modelle weisen enorme Verbesserungen gegenüber den vorherigen Versionen in unseren produktorientierten LLM-Benchmarks auf.
Es scheint, als hätte Anthropic endlich begonnen, auf die Kunden zu hören, die Sprachmodelle nutzen, um echte Produkte für Unternehmen zu entwickeln.
Claude 3 Opus überholt GPT-4-Modelle
Claude 3 Opus hat den größten Sprung nach vorne gemacht und hat die GPT-4-Modelle eingeholt.
In der Kategorie „Dokumente" erreichte Opus die perfekte Punktzahl von 100, was bedeutet, dass es sehr gut bei Aufgaben funktionieren kann, die das Lesen von Dokumenten, das Extrahieren und Umwandeln von Informationen umfassen. Diese Aufgaben werden in unseren Produkten und Prototypen, die Domain-Driven Design und Knowledge Maps verwenden, um mit komplexen Geschäftsbereichen zu arbeiten, intensiv eingesetzt.
Claude 3 Sonnet: Das Mittelklasse-Modell
Claude 3 Sonnet ist das Mittelklasse-Modell. Es hat sich ebenfalls gegenüber den Claude 2-Modellen verbessert, obwohl der Sprung auf den ersten Blick nicht so erheblich ist.
Jedoch sind die Kosten für den Betrieb des Modells um mehr als das Zweifache gesunken, was auf erhebliche Verbesserungen hindeutet. Ein weiterer wichtiger Aspekt - alle Modelle der Claude 3-Reihe bieten eine bessere Mehrsprachigkeits-Unterstützung (was für internationale Unternehmen wichtig ist) und einen riesigen Kontext von 200K Token. Dies sind große Verbesserungen, die es zu feiern gilt!
Claude 3 Haiku
Claude 3 Haiku von Anthropic verdient besonderes Lob. Es ist das kleinste Modell, das es sogar geschafft hat, Claude 3 Sonnet in unseren Benchmarks zu übertreffen.
Fokus auf "Enterprise Workloads"
Anthropic erwähnt „Enterprise Workloads" mehrmals, wenn über dieses Modell gesprochen wird. Vielleicht war diese Ausrichtung der Schlüssel dazu, bei solchen Aufgaben so gut abzuschneiden.
Das Modell selbst ist in unseren Benchmarks nicht so gut wie in ihrer PR beschrieben. Es übertrifft weder GPT-3.5 noch Gemini Pro. Das ist jedoch nicht der Punkt. Angesichts seines riesigen Kontextfensters von 200k und des attraktiven Preismodells von 1:5 (Eingabetoken kosten 5x weniger als Ausgabetoken), kann es das Standardmodell für die Arbeit mit umfangreichen Unternehmensdokumenten zu niedrigen Kosten sein.
Das Modell selbst ist 12x günstiger als Claude 3 Sonnet und 60x günstiger als Claude 3 Opus.
Gemini Pro 1.0 - vergleichbar mit Claude 3 Haiku
Gemini Pro 1.0 ist ein neues Mittelklasse-Modell von Google. Die gesamte Produktlinie umfasst Nano, Pro und Ultra.
Dieses Modell schlägt die erste Version von GPT-3.5 (die vor fast einem Jahr veröffentlicht wurde) und performt auf dem Niveau von guten Mistral 7B-Fine-Tunes bei unseren Aufgaben.
Das Modell ist auch ziemlich günstig, ungefähr vergleichbar mit Claude 3 Haiku.
Allerdings, typisch für Google, ist die Integration mit Gemini Pro 1.0 etwas schwieriger, insbesondere wenn man innerhalb der EU tätig ist. Die Kontextgröße ist ebenfalls kleiner.
Herausforderung beim Verstehen von Tabellen
Hier ist ein Beispiel für einen Benchmark aus der Suite für Enterprise-KI-Benchmarks. Es wird nicht mehr nur die Textmanipulation getestet, sondern eine komplexere Aufgabe.
Gegeben sei ein PDF-Dokument mit technischen Spezifikationen für LEDs. Es wird folgende Frage gestellt: Was ist die typische Peak Forward Voltage für GL538?
Wie Sie unten sehen können, steht die Zahl genau da. Wenn Sie das PDF in ein KI-System Ihrer Wahl hochladen, wird das System daran scheitern, eine korrekte Antwort zu liefern. Selbst ChatGPT-4 mit Vision wird nicht in der Lage sein, diese Aufgabe zu bewältigen.
Ausblick auf kommende Benchmarks
Dies ist eine der Aufgaben, die in den kommenden Enterprise-KI-Benchmarks vorgestellt werden. Tabellen und Spreadsheets sind das Wesen von Geschäftsprozessen, und alle guten von LLM angetriebenen Assistenten müssen sie verstehen, um nützlich zu sein. Wir werden herausfinden, welche Modelle sich dafür besonders gut eignen!
Transformieren Sie Ihre digitalen Projekte mit den besten KI-Sprachmodellen!
Entdecken Sie die transformative Kraft der besten Sprachmodelle und revolutionieren Sie Ihre digitalen Produkte mit KI! Bleiben Sie zukunftsorientiert, steigern Sie die Effizienz und sichern Sie sich einen klaren Wettbewerbsvorteil. Wir unterstützen Sie dabei, Ihren Business Value auf das nächste Level zu heben.