Schulpraxis

Bessere Bilderstellung ChatGPT

Von Volker Wacker

DruckenPDF

ChatGPT dazu selbst:

ChatGPT dazu selbst:

Verbesserungen der ChatGPT-Bilderstellung - Aktuelles Modell vs. Vorgänger

Im April 2024 hat OpenAI ein neues Bildgenerierungsmodell in ChatGPT eingeführt (GPT - 4o), welches den bisherigen DALL·E-3-Generator ablöste . Seitdem wurden mehrere Aspekte der Bilderstellung deutlich verbessert, darunter Bildqualität, Stilvielfalt, Konzepttreue, Benutzerfreundlichkeit, Generierungsgeschwindigkeit und neue Funktionen. Im Folgenden werden diese Punkte strukturiert verglichen.

Bildqualität (Auflösung, Detailgrad, Klarheit)

Beispiel einer fotorealistischen Darstellung mit dem neuen Modell: Das KI-generierte Bild einer historischen Villa mit Brunnen zeigt hohe Detailtreue und realistische Lichtverhältnisse. Bereits auf den ersten Blick wirken solche KI-Bilder nun deutlich glaubwürdiger und weniger "künstlich" als früher . OpenAI spricht von präziseren, klareren und schärferen Ergebnissen gegenüber der Vorgängergeneration . Die Auflösung und der Detailreichtum der generierten Bilder wurden erhöht - das neue GPT-4o-Modell erzeugt wesentlich detailreichere und realistischere Bildinhalte als DALL·E 3 zuvor . Dadurch gelingen auch komplexe Texturen, Beleuchtung und feine Details deutlich besser. Insgesamt kommen die Bilder qualitativ näher an echte Fotografien heran ("photorealistisch") , wodurch der auffällige KI-Look früherer Bilder reduziert wurde.

Stilvielfalt und Anpassungsfähigkeit

Die Bandbreite an Bildstilen hat sich mit dem neuen Modell erheblich vergrößert. Nutzer können nun aus einer breiteren Auswahl an visuellen Darstellungsmöglichkeiten schöpfen - von fotorealistischen Szenen über retro, futuristisch bis hin zu cartoonhaft oder minimalistischen Looks ist alles möglich. Die aktualisierte Bilderzeugung bietet eine größere Vielfalt künstlerischer Stile, die sich an den gewünschten Verwendungszweck anpassen lassen . So konnte ChatGPT in letzter Zeit beispielsweise beeindruckend den Stil des Studio Ghibli nachahmen .

Allerdings bleiben urheberrechtliche Grenzen gewahrt: Namen lebender Künstler bleiben als Prompt untersagt, doch ästhetische Anlehnungen an bekannte Studios oder Genres (für Fan-Art etc.) sind weiterhin erlaubt . Insgesamt ist ChatGPT also wesentlich anpassungsfähiger in Bezug auf Bildstil und kann Outputs erzeugen, die vom realistischen Foto bis zur Grafik im Wunschstil reichen.

Genauigkeit bei komplexen oder abstrakten Konzepten

Dank verbesserter Text- und Diagrammdarstellung kann das neue Modell z. B. Buchcover mit lesbarer Schrift generieren - eine Aufgabe, an der frühere Systeme oft scheiterten. Die Treffsicherheit in der Umsetzung komplexer Beschreibungen hat sich stark erhöht. GPT-4o befolgt Prompt-Anweisungen jetzt deutlich genauer, sodass selbst vielschichtige Szenen mit bis zu 20 Objekten korrekt in Beziehung gesetzt dargestellt werden können . Wo frühere Modelle bei abstrakten oder detaillierten Vorgaben ins Straucheln gerieten, liefert das neue Modell wesentlich konsistentere Ergebnisse. Beispielsweise hält sich die KI nun viel besser an Vorgaben zu bestimmten Objekten und deren Anordnung im Bild - wenn bestimmte Gegenstände an bestimmten Positionen oder in bestimmten Posen gefordert sind, werden diese deutlich getreuer umgesetzt . Auch schwer zu visualisierende Inhalte gelingen genauer: Diagramme und Infografiken werden akkurater gezeichnet und komplexe Konzepte wie wissenschaftliche Experimente visuell logisch dargestellt . Besonders hervorzuheben ist die enorme Verbesserung bei Text im Bild - Schriftzüge auf Schildern, Menüs, Bucheinbänden etc. sind jetzt oft klar lesbar und konsistent, was früher kaum möglich war . So können sogar Poster, Einladungen oder Visitenkarten mit verständlichem Text von der KI gestaltet werden . Diese gesteigerte Genauigkeit macht sich auch in besserer Kontextverständnis bemerkbar: Selbst abstrakte Anweisungen oder konzeptionelle Kunstideen setzt das Modell zuverlässiger in passende Bildelemente um, mit weit weniger Zufallselementen als beim Vorgänger.

Benutzerfreundlichkeit und Prompt-Eingabe

Die Benutzung der Bildfunktion ist durch die Neuerungen erheblich intuitiver geworden. Da GPT-4o ein einheitlich multimodales Modell ist, entfällt das vorherige Umschalten zwischen separatem Text- und Bildmodell - die Bildgenerierung ist jetzt nahtlos in den Chat integriert . Einfache Beschreibungen genügen oft für ein präzises Ergebnis, weil das neue System Prompt-Texte wesentlich besser versteht und interpretiert . Nutzer*innen erhalten Bilder, die ihrer kreativen Vision sehr nahe kommen, ohne mühsames Nachjustieren: Selbst ungewöhnliche oder komplexe Szenenbeschreibungen werden treffend umgesetzt, was die Interaktion erheblich erleichtert . Insgesamt muss man weniger aufwändige Detailanweisungen geben als zuvor, da GPT-4o implizite Zusammenhänge und Wünsche aus dem Prompt kontextuell erfasst . Die Konversation mit ChatGPT kann nun dynamisch für die Bilderstellung genutzt werden - man kann im Dialog weitere Anpassungen verlangen, zusätzliche Details hinzufügen oder bestehende Bilder verfeinern, und das Modell behält den Kontext im Blick. Korrekturwünsche lassen sich also direkt im Chat anbringen, was die iterative Verbesserung eines Bildes vereinfacht. Außerdem hat OpenAI die inhaltlichen Beschränkungen etwas gelockert: Das neue Modell verweigert deutlich weniger harmlose Anfragen aus Sicherheitsgründen und gibt den Nutzern mehr Freiheit bei der Motivwahl . (Extremfälle und policy-Verstöße werden natürlich weiterhin gefiltert, aber legitime kreative Ideen passieren nun eher die Filter.) All dies führt zu einer deutlich steigernden Benutzerfreundlichkeit, da ChatGPT-Bildgenerierung jetzt sowohl leichter zugänglich als auch flexibler in der Handhabung ist.

Geschwindigkeit der Generierung

Die Geschwindigkeit der Bildgenerierung hat sich mit der Aktualisierung verändert. Durch die komplexeren Modelle und die höhere Detailtreue dauert eine Bildanfrage aktuell etwas länger als zuvor - OpenAI gibt an, dass eine einzelne Bildgenerierung häufig bis zu etwa einer Minute in Anspruch nimmt . Im Vergleich dazu lieferte DALL·E 3 oft in wenigen Sekunden Ergebnisse, allerdings mit geringerem Detailgrad. Die etwas längere Wartezeit resultiert daraus, dass GPT-4o teils mehrere Entwürfe intern durchspielt und das bestmögliche Bild auswählt (wie z. B. im OpenAI-Demo ein "Best-of-8"-Bild ). Andererseits wurde die Effizienz der Architektur verbessert, sodass pro Zeiteinheit mehr Qualität erzielt wird - einige Quellen berichten, dass qualitativ hochwertige Bilder jetzt mit weniger Rechenaufwand generiert werden können . In der Praxis bedeutet dies: Die Durchlaufzeit pro Bild ist moderat gestiegen, bleibt aber mit meist unter einer Minute durchaus annehmbar, zumal die Ausgabequalität deutlich höher ist. Für den Anwender fühlt sich der Prozess immer noch zügig an, zumal die Integration in ChatGPT den Workflow vereinfacht. (Zu beachten ist, dass kostenlose Nutzer anfangs Limitierungen hatten - etwa nur wenige Bilder pro Tag - um die Serverlast zu bewältigen . Inzwischen wurde der Dienst aber breit optimiert und allen Usern zugänglich gemacht, wodurch Wartezeiten durch Kontingente seltener ins Gewicht fallen.)

Neue Funktionen (Bildbearbeitung, Transparenz, Größenwahl etc.)

Neben Qualitäts- und Bedienungsverbesserungen bringt das neue System zusätzliche Funktionen mit sich, die zuvor nicht oder nur eingeschränkt verfügbar waren. Erstens beherrscht GPT-4o nun Bildbearbeitung und -transformation: Man kann ein bestehendes Bild hochladen und per Prompt verändern lassen (sogenanntes Inpainting oder Variationen erstellen). Laut OpenAI kann das Modell z. B. ein Wohnzimmerfoto nehmen und daraus verschiedene Interior-Design-Ideen generieren . Es ist einfacher geworden, nur bestimmte Teile eines Bildes zu ändern, während der Rest unverändert bleibt - beispielsweise eine Figur im Bild auszutauschen oder Details hinzuzufügen, ohne alles neu zu generieren . Zweitens unterstützt der Generator jetzt transparente Hintergründe: Man kann explizit Bilder ohne Hintergrund (PNG-Transparenz) erstellen lassen , was für Grafiken, Logos oder Präsentationen sehr nützlich ist. Drittens gibt es mehr Kontrolle über das Format und die Farbgestaltung der Ausgabe. Nutzer*innen können das Seitenverhältnis vorgeben (z. B. quadratisch, hochkant, breit) anstatt immer ein fixes Format zu bekommen . Auch genaue Farbwünsche lassen sich durch Angaben wie Hexadezimal-Farbcodes umsetzen, was etwa für Corporate Designs wichtig ist . Viertens ist die Bilderstellung jetzt multimodal initierbar: Man kann nicht nur einen reinen Textprompt eingeben, sondern auch im laufenden Chat per Spracheingabe ein Bild anfordern oder eine Skizze/Foto als Anhaltspunkt senden . GPT-4o nutzt dann sowohl die sprachliche Beschreibung als auch sein eigenes Weltwissen und den Dialogkontext, um daraus ein passendes Bild zu erzeugen . Diese neuen Fähigkeiten - vom Editieren bestehender Bilder über transparente oder anders formatierte Outputs bis hin zur Kontextnutzung - erweitern die Einsatzmöglichkeiten erheblich. Zusammenfassend können Anwender nun viel gezielter und kreativer mit ChatGPT Bilder gestalten, sei es durch präzisere Einstellungen oder durch Interaktion mit eigenen Vorlagen.

← Zurück zum Archiv