None
Nachrichten

KI-Wochenrückblick KW 17/2023

by Viktor Garske on April 30, 2023, 11:08 p.m.

Diese Woche hat auch wieder spannende Neuigkeiten geboten, die ich euch gerne vorstellen möchte. Legen wir los!

StableLM

Eingangs möchte ich euch heute das Modell StableLM vorstellen. Hierbei handelt es sich um ein Open-Source-LLM aus dem Hause Stability AI – das Team, das auch schon Stable Diffusion populär gemacht hat. Es wurde am 19. April 2023 vorgestellt und steht in verschiedenen Parameterzahlen zur Verfügung, darunter z. B. 7 Milliarden Parameter. Technisch wird die Grundlage durch Pythia und somit auch GPT-NeoX gebildet.

Das Grundtraining von StableLM basiert auf The Pile mit einigen Anpassungen. Diese Anpassungen ermöglichen es, dass ein qualitativ hochwertiges Modell mit deutlich weniger Parametern erstellt werden konnte.

DeepFloyd IF

Stability AI hat in dieser Woche zwei weitere interessante Modelle veröffentlicht, darunter eines in Partnerschaft mit der DeepFloyd-Gruppe. DeepFloyd IF wurde am 28. April 2023 veröffentlicht. Eine der spannendsten Neuigkeiten ist die Fähigkeit, sauberen Text in generierte Bilder einzuarbeiten. Wer Modelle wie DALLE-2 oder Stable Diffusion kennt, weiß, dass dies oft eine Herausforderung ist und oft schlecht aussieht.

Diese Fähigkeiten ermöglichen auch völlig neue Anwendungen in Kunst und Design, weil die Gestaltung von Schrift besser abgedeckt werden kann. Das Modell ist auf HuggingFace verfügbar, im Veröffentlichungsartikel sind schon einige Beispiele dargestellt worden.

StableVicuna

Das zweite Modell in dieser Woche von Stability AI heißt StableVicuna und wurde ebenfalls am 28. April veröffentlicht. Es ist eines der ersten großen Open-Source-Sprachmodelle, das nicht nur klassisch auf Instruktionen gefinetuned, sondern auch mittels RLHF verbessert wurde. Beide Konzepte sind einige der Erfolgsgeheimnisse von ChatGPT.

Um StableVicuna einsetzen zu können, wird allerdings ein Zugang zu LLaMA von Meta AI benötigt, da dies die Grundlage für Vicuna bildet, worauf StableVicuna aufsetzt. Aus diesem Grund sind die Gewichte nur als Deltas verfügbar.

Großes Übersichtsarbeit zu LLMs

Die Arbeit Harnessing the Power of LLMs in Practice: A Survey on ChatGPT and Beyond ist momentan eine der aktuellsten und besten Übersichtsarbeiten zum Thema LLMs. Neben einem Stammbaum, der im Gegensatz zu meiner Timeline eher auf die Grundarchitektur und weniger auf die Details abzielt, werden konkrete Bemerkungen und Einordnungen zu Architektur, Aufgabenstellungen und Abwägungen bei der Entwicklung gegeben.

Für alle, die mit oder an LLMs entwickeln möchten, lohnt sich ein Blick in das dazugehörige GitHub-Repository, das eine Linkliste beinhaltet.

ChatGPT in Italien wieder verfügbar

Das vor einigen Wochen in Italien gesperrte ChatGPT ist nun wieder verfügbar. OpenAI hat an vielen Stellen nachgebessert und konnte den akuten Anliegen entgegenkommen. Nun beginnt die Detailarbeit, die allerdings erwartungsgemäß eher im Hintergrund ablaufen wird.

LLMs als Sprachgeneratoren werden in den praktischen Anwendungen allerdings noch vielen Herausforderungen gegenüber stehen: so sind weiterhin Sprachgenerierung und Wissensbereitstellung in meinen Augen zu eng miteinander verbunden. Speziell wenn wir das "Recht auf Vergessen" diskutieren, müssen wir uns vor Augen führen, dass die verbreiteten LLMs über keinen Wissensspeicher verfügen, in dem falsches Wissen steht und dann korrigiert oder entfernt werden kann. Vielmehr ist dieses Wissen die Fähigkeit selbst, eine Sprache zu sprechen. In der Praxis sollen allerdings logischerweise falsche Aussagen vermieden werden. Damit das zuverlässiger möglich ist, wird vermutlich noch einiges an Forschung benötigt werden. Und vielleicht sind die Transformer in Zukunft nicht das Mittel der Wahl, wenn Projekte wie RWKV-LM voranschreiten.

Author image
Viktor Garske

Viktor Garske ist der Hauptautor des Blogs und schreibt gerne über Technologie, Panorama sowie Tipps & Tricks.

Comments (0)

Comments are not enabled for this entry.