LLM Benchmarks
August 2023

 Die TIMETOACT LLM Benchmarks bieten einen aktuellen Vergleich verschiedener Large Language Models um deren Eignung für den Einsatz in der Produktentwicklung zu testen.

LLM Benchmarks August 2023 

Neuste Versionen von ChatGPT, Anthropic Claude und Meta LlaMA auf dem Markt

  • OpenAI hat neue Versionen von ChatGPT (v0613) herausgebracht, die Effizienzsteigerungen und JavaScript-function calling conventions bieten.
  • Anthropic hat die zweite Ausgabe von Claude veröffentlicht - den engsten kommerziellen Konkurrenten von OpenAI ChatGPT.
  • Meta hat die zweite Generation von LLaMA - Llama v2 - eingeführt.

Jede dieser Veröffentlichungen verspricht bedeutsame Verbesserungen in den Fähigkeiten großer Sprachmodelle. Wir haben für Sie analysiert, ob sich ein Upgrade jedoch wirklich lohnt und was es zu beachten gibt.

OpenAI ChatGPT-4 0613: kann upgegradet werden

In unseren Tests schneidet die neue Version von ChatGPT-4 etwas besser ab als die vorherige Version. Sie hat einen spürbaren Geschwindigkeitsschub erhalten, die Leistung bei Aufgaben im Zusammenhang mit Code und Marketing hat sich signifikant verbessert. Allerdings ist gleichzeitig die Fähigkeit zur Schlussfolgerung und zur Arbeit mit Dokumenten leicht gesunken.

Wenn Sie die bestmögliche Leistung von Ihrem wissensorientierten Unternehmensassistenten herausholen möchten, könnte es sich lohnen, bei der Migration vorsichtig vorzugehen.

Anthropic Claude v2: nicht upgraden

Anthropic Claude v2 hat in unseren Tests spürbar schlechter abgeschnitten. Es scheint, als wäre er darauf abgestimmt worden, ein besseres Chat-Bot zu sein, auf Kosten der Produktfähigkeiten.

Wenn möglich, empfehlen wir, Claude v1 weiterhin zu verwenden, bis die zweite Version sich weiter verbessert.

Meta Llama v2: upgrade empfohlen

Das Llama v2-Modell ist ein offenes Modell von Meta (Facebook) mit einer kommerziell großzügigen Lizenz. Diese Lizenz macht das Modell endlich für ernsthafte Projekte nutzbar.

Llama v2 sollte ein besseres Modell sein. Allerdings performt das Basismodell signifikant schlechter als das Basismodell von v1. Die Hauptursache dafür ist, dass es ebenfalls zu gesprächig ist und sensibel auf Promts reagiert. Das Basismodell dominiert die unteren Ränge unserer Rangliste.

Doch bei offenen Modellen bedeuten schlechte Ergebnisse nicht das Ende der Geschichte. Sie können von der Community weiter trainiert werden.

Nous Research hat ihre eigene feinabgestimmte Version von Llama v2 veröffentlicht, die Nous Hermes genannt wird. Hermes übertrifft nicht nur Vicuna, sondern holt auch Claude v2 ein.

Transformieren Sie Ihre digitalen Projekte mit den besten KI-Sprachmodellen!

Entdecken Sie die transformative Kraft der besten Sprachmodelle und revolutionieren Sie Ihre digitalen Produkte mit KI! Bleiben Sie zukunftsorientiert, steigern Sie die Effizienz und sichern Sie sich einen klaren Wettbewerbsvorteil. Wir unterstützen Sie dabei, Ihren Business Value auf das nächste Level zu heben.

* Pflichtfelder

Wir verwenden die von Ihnen an uns gesendeten Angaben nur, um auf Ihren Wunsch hin mit Ihnen Kontakt im Zusammenhang mit Ihrer Anfrage aufzunehmen. Alle weiteren Informationen können Sie unseren Datenschutzhinweisen entnehmen.

Bitte Captcha lösen!

captcha image
Martin Warnung
Sales Consultant TIMETOACT GROUP Österreich GmbH +43 664 881 788 80