LLM Benchmarks
Oktober 2023

 Die TIMETOACT LLM Benchmarks bieten einen aktuellen Vergleich verschiedener Large Language Models um deren Eignung für den Einsatz in der Produktentwicklung zu testen.

LLM Benchmarks Oktober 2023 

Besonderheiten & Neuigkeiten der Oktober Benchmarks

9 Neue Benchmarks

Wir haben 9 neue Benchmarks in die Suite integriert. Diese Benchmarks konzentrieren sich auf die Bereiche "Documents", "Integration" und "Reason". Dadurch wird die Bewertung der Modellfähigkeiten präziser, und die Gesamtzahl der verschiedenen Bewertungen steigt von 85 auf 134.

Ein Beispiel hierfür sind Situationen, in denen große Sprachmodelle strukturierte Daten erstellen und verarbeiten.

In der Kategorie Integration testen wir nun die Fähigkeit von großen Sprachmodellen, Text in den Formaten CSV, TSV, JSON und YAML zu verstehen und zu manipulieren.

Ein weiteres Beispiel betrifft unsere Arbeit an Business-Assistenten und Informationssuchsystemen für Kunden. In solchen Fällen müssen große Sprachmodelle relevante Informationsstücke identifizieren, finden und bewerten. Unsere Bewertungen helfen dabei, verschiedene Aspekte dieser Fähigkeit zu messen. Zusätzlich zu diesen neuen Bewertungen haben wir die Leistung einiger bestehender Bewertungen verbessert, indem wir Few-Shot-Beispiele und bessere Anfragen eingeführt haben. Die meisten großen Sprachmodelle reagieren darauf sehr positiv.

Mehr Guidance

Guidance ist ein Prozess, bei dem großen Sprachmodellen geholfen wird, gewünschte Texte zu generieren. Sie funktioniert, indem die Aufmerksamkeit des Modells auf bestimmte Textelemente (Tokens) gelenkt wird.

Mit zunehmender Erfahrung bei der Gewinnung besserer Ergebnisse von großen Sprachmodellen integrieren wir diese Erkenntnisse in die Benchmarks. Unsere Oktober-Version enthält bereits Anleitungen in einigen der Bewertungen und verbessert so die Leistung einiger Modelle noch weiter.

In den kommenden Monaten planen wir, noch tiefere Anleitungen für Modelle in aufgabenbezogenen Bereichen bereitzustellen.

Neues Modell mit beeindruckender Leistung: Mistral 7B

Mistral 7B ist ein neues Modell eines französischen KI-Unternehmens gleichen Namens. Obwohl es deutlich kleiner ist als die anderen Modelle, hat es die Basiskonfigurationen von Llama2 70B sowie alle Modelle mit den Größen 7B und 13B übertroffen.

Das ist wirklich beeindruckend. Es lohnt sich, in den nächsten Monaten mehr Aufmerksamkeit auf dieses Modell zu legen. Die Kosten- und Durchsatzmerkmale dieses Modells machen es noch attraktiver für lokale Implementierungen.

Ein weiteres Highlight dieses Modells ist, dass es unter der Apache-Lizenz veröffentlicht wurde, die verständlicher und weniger restriktiv ist als die Lizenz von Llama 2. Es gibt keine "Google"-Klauseln oder mögliche Verwirrungen hinsichtlich der Verwendung dieses Modells für nicht-englische Sprachen. Unsere Modellmarkierungen spiegeln diese Änderung in der Tabelle wider.

Transformieren Sie Ihre digitalen Projekte mit den besten KI-Sprachmodellen!

Entdecken Sie die transformative Kraft der besten Sprachmodelle und revolutionieren Sie Ihre digitalen Produkte mit KI! Bleiben Sie zukunftsorientiert, steigern Sie die Effizienz und sichern Sie sich einen klaren Wettbewerbsvorteil. Wir unterstützen Sie dabei, Ihren Business Value auf das nächste Level zu heben.

* Pflichtfelder

Wir verwenden die von Ihnen an uns gesendeten Angaben nur, um auf Ihren Wunsch hin mit Ihnen Kontakt im Zusammenhang mit Ihrer Anfrage aufzunehmen. Alle weiteren Informationen können Sie unseren Datenschutzhinweisen entnehmen.

Bitte Captcha lösen!

captcha image
Martin Warnung
Sales Consultant TIMETOACT GROUP Österreich GmbH +43 664 881 788 80