LLM Benchmarks
November 2023

 Die TIMETOACT LLM Benchmarks bieten einen aktuellen Vergleich verschiedener Large Language Models um deren Eignung für den Einsatz in der Produktentwicklung zu testen.

LLM Benchmarks November 2023 

Bewertungen neuer ChatGPT Modelle

Wir haben neue Modelle bewertet, die kürzlich von OpenAI veröffentlicht wurden (eine Zusammenfassung ihrer Präsentation findet man hier).

GPT-4 Turbo ("GPT-4 Turbo v3/1106-preview" in der Tabelle) ist günstiger und weniger leistungsfähig als die vorherige Version. Wir haben eine Qualitätsverschlechterung bei komplexen Programmieraufgaben und CRM-Aufgaben festgestellt, die auf wenigen Beispieltexten basieren.

Der neue GPT-3 Turbo ("GPT-3.5 v3/1106") ist ebenfalls günstiger und wesentlich schneller als sein Vorgänger. Er ist jedoch auch weniger leistungsfähig als die vorherige Version. Die Verschlechterung der Modellfähigkeiten entspricht den größeren GPT-4-Modellen.

Positiv zu erwähnen ist allerdings, dass beide Modelle folgende Eigenschaften aufweisen:

  • Aktuellere Trainingsdaten
  • Bessere Fähigkeiten in der Kategorie des logischen Denkens

Bessere Sprachunterstützung im GPT-4 Turbo

Der GPT-4 Turbo hat eine versteckte Überraschung, über die OpenAI nirgendwo erwähnt hat.

Aus Erfahrung wissen wir, dass OpenAI-Sprachmodelle im Allgemeinen wirklich gut in Englisch sind. Sie können auch in Chinesisch, Deutsch, Spanisch und romanogermanischen Sprachen angemessen sein. Fragen an die Sprachmodelle in anderen Sprachen führen jedoch im Vergleich zu Fragen auf Englisch in der Regel zu sehr schlechten Ergebnissen. Je kleiner der Sprachumfang ist, desto weniger schriftliche Materialien stehen im Internet zur Verfügung, und desto schlechter sind die Ergebnisse.

Hier glänzt der GPT-4 Turbo plötzlich. Experten, die mit ML in Nischensprachen arbeiten, berichten, dass ChatGPT nicht nur wesentlich besser darin ist, in kleinen Sprachen zu kommunizieren, sondern auch ein tieferes Verständnis für die zugehörige Geschichte und Kultur zeigt.

Das sind großartige Neuigkeiten für die Sprachmodelle! Doch damit hören sie nicht auf.

Mistral 7B OpenChat holt auf und zieht mit ChatGPT 3 gleich

In den Oktober-LLM Benchmarks haben wir ein neues Open-Source-Modell namens Mistral 7B vorgestellt. Es war für seine Größe ausreichend, lag jedoch immer noch unter Llama2 70B Hermes und ChatGPT.

Die November-Benchmarks stellen eine neue Variante von Mistral 7B namens Mistral 7B OpenChat vor. Es übertrifft Llama 70B Hermes und zieht mit ChatGPT 3.5 (der ersten Version) gleich.

Der beeindruckendste Aspekt dieses Modells ist seine geringe Größe von lediglich 7B, wodurch es problemlos auf einfacher Standard-Hardware betrieben werden kann.

Zum Beispiel konnten wir bei einer Aufgabe zur Generierung von Suchbegriffen für Produktkataloge 10-15 Produkte pro Sekunde verarbeiten. Das alles auf einem Server mit einer NVidia 3090 GPU mit vLLM.

Mistral 7B OpenChat wäre auch besonders interessant für Unternehmen, die über gute LLM-Fähigkeiten verfügen möchten, aber nicht von der Betriebszeit der OpenAI-Services abhängig sein wollen (sie hatten kürzlich Ausfälle).

Beam Search verbessert die Genauigkeit von Sprachmodellen

Bei genauerem Vergleich unserer vorherigen Benchmarks mit den November-Benchmarks würde man feststellen, dass kleinere lokale Modelle "plötzlich" 4-5 Genauigkeitspunkte gewonnen haben. Wir haben die Beam-Search-Optimierung aktiviert. Dieser Algorithmus bewertet automatisch mehrere Antwortoptionen, bevor er die beste auswählt.

Diese Optimierung wird ab sofort für alle lokalen Modelle aktiviert sein. Später planen wir, den besten Branchenpraktiken zu folgen und noch mehr Varianten von Hilfestellungen in den Benchmark einzuführen.

Transformieren Sie Ihre digitalen Projekte mit den besten KI-Sprachmodellen!

Entdecken Sie die transformative Kraft der besten Sprachmodelle und revolutionieren Sie Ihre digitalen Produkte mit KI! Bleiben Sie zukunftsorientiert, steigern Sie die Effizienz und sichern Sie sich einen klaren Wettbewerbsvorteil. Wir unterstützen Sie dabei, Ihren Business Value auf das nächste Level zu heben.

* Pflichtfelder

Wir verwenden die von Ihnen an uns gesendeten Angaben nur, um auf Ihren Wunsch hin mit Ihnen Kontakt im Zusammenhang mit Ihrer Anfrage aufzunehmen. Alle weiteren Informationen können Sie unseren Datenschutzhinweisen entnehmen.

Bitte Captcha lösen!

captcha image
Martin Warnung
Sales Consultant TIMETOACT GROUP Österreich GmbH +43 664 881 788 80