KI-Bildgeneratoren im Test: Sechs Modelle, ein Prompt, kein Sieger

Welchen KI-Bildgenerator sollte man 2026 nutzen? Olaf Giermann vergleicht in einem neuen Video die Modelle in AI Lab und kommt zu einem Ergebnis, das Benchmark-Fans enttäuschen dürfte: Das beste Modell gibt es nicht. Es gibt nur das passende.
Das rote Kleid flattert sechsmal im Sturm. Sechsmal steht dieselbe Frau am selben Strand, neben ihr eine schwarze Dogge, dahinter vom Wind zerzauste Kiefern. Oder auch nicht: Bei Flux.2 Flex sind die Kiefern verschwunden, und die Frau trägt plötzlich blondes Haar, geborgt aus dem Referenzbild, das eigentlich nur das Kleid liefern sollte. Seedream 4.5 verzieht ihr das Gesicht. GPT Image 1.5 setzt ihr einen zu großen Kopf auf und legt einen HDR-Schleier darüber, als hätte jemand gerade den Tonemapping-Regler entdeckt. Nano Banana Pro trifft Gesicht, Kleid und Stimmung.
Der Vergleich stammt aus einem gut 16-minütigen Video, das Picture Instruments veröffentlicht hat. Olaf Giermann geht darin der Frage nach, welches der KI-Modelle, die in der Software AI Lab zur Wahl stehen, man zum Generieren und Bearbeiten von Bildern einsetzen sollte. Die kurze Antwort: keins für alles. Die lange Antwort ist lehrreicher, auch für alle, die AI Lab gar nicht nutzen.
Vier Familien unter einem Dach
AI Lab bündelt aktuell Modelle von vier Anbietern. Google liefert die Nano-Banana-Reihe aus dem Gemini-Umfeld: das ältere Nano Banana, das aktuelle Nano Banana 2 mit der besonders flinken Lite-Variante und Nano Banana Pro, das laut Giermann bei Prompttreue und der Konsistenz von Figuren und Details weiterhin Googles stärkstes Pferd im Stall ist. OpenAI steuert GPT Image bei, in Version 2 als Staffel von „Fast“ über „Standard“ bis „Complex“.
Qualitativ ordnet Giermann diese Stufen etwa zwischen Nano Banana 2 Lite und Nano Banana Pro ein. Vom TikTok-Konzern Bytedance kommt Seedream 4.5, schnell, günstig und mit 4K-Ausgabe. Die vierte Familie stammt aus Deutschland: Black Forest Labs, gegründet von Entwicklern aus dem Umfeld von Stable Diffusion, steht mit seinen Flux-Modellen für Fotorealismus und Bildbearbeitung.
Sechs Kriterien statt einer Rangliste
Giermann sortiert nach sechs Faktoren. Wie genau befolgt ein Modell die Anweisung (Prompt Adherence)? Wie realistisch wirkt das Ergebnis? Wie groß wird das Bild? Was kostet es, wie lange dauert es? Und welche Funktionen bietet das Modell überhaupt? Der letzte Punkt klingt nach Kleingedrucktem, entscheidet aber oft darüber, ob ein Modell für eine Aufgabe infrage kommt.
Prompttreue. Im Test soll ein Mann aus einem Referenzfoto im Raumanzug ohne Helm vor einer startenden Rakete stehen, eine Getränkedose mit Strohhalm in der einen Hand, eine Katze auf der Schulter. Nano Banana Pro schlägt Seedream 4.5 deutlich. Es vertauscht zwar links und rechts beziehungsweise liest sie aus Sicht des Betrachters, setzt Dose und Katze aber korrekt auf gegenüberliegende Seiten, und der Mann trinkt tatsächlich durch den Strohhalm, statt nur in die Kamera zu lächeln. Nano Banana und GPT Image haben einen strukturellen Vorteil: Sie greifen auf das Weltwissen der Sprachmodelle Gemini und ChatGPT zurück. Das macht sie zur ersten Wahl für Infografiken.
Bildqualität. Seedream 4.5 und Nano Banana 2 Lite liefern oft den typischen KI-Look mit übertrieben sauberen Details. Nano Banana Pro wirkt durchweg erstaunlich realistisch, was nicht immer erwünscht ist. Flux.2 Pro neigt beim selben Prompt dazu, unnötig viele Details einzubauen, bis ein hyperrealistischer HDR-Effekt entsteht. Mit Referenzbildern geraten bei Flux und GPT Image außerdem gern die Proportionen durcheinander: zu großer Kopf, zu kleine Katze.
Bildgröße. AI Lab erzeugt Bilder zwischen 1K und 4K. Ein quadratisches 1K-Bild misst 1024 × 1024 Pixel, ein 4K-Bild 4096 × 4096 Pixel, also die vierfache Kantenlänge und die sechzehnfache Pixelzahl. Für soziale Medien reicht 1K. Wer druckt oder Bereiche in modernen Digitalfotos retuschiert, braucht mehr.
Kosten. Hier lohnt der Blick auf die Credits, die AI Lab pro Generierung berechnet:
| Modell | Auflösung | Credits |
|---|---|---|
| GPT Image 2 Fast | 1K | 1 |
| Flux.2 Pro | 1K / 2K | 3 / 12 |
| Nano Banana 2 Lite | 1K | 4 |
| Seedream 4.5 | 4K | 4 |
| GPT Image 2 Standard | 1K / 2,8K | 6 / 18 |
| Nano Banana 2 | 1K / 2K / 4K | 7 / 10 / 15 |
| Nano Banana Pro | 1K / 2K / 4K | 14 / 14 / 24 |
| GPT Image 2 Complex | 1K / 2,8K | 21 / 72 |
| Flux.2 Flex | 2K | 24 |
Referenzbilder können je nach Modell weitere Credits kosten. Auffällig ist Seedream 4.5, das für vier Credits bereits 4K liefert. Am anderen Ende steht GPT Image 2 Complex mit 72 Credits für ein Bild in 2,8K. Giermann gibt dabei eine Rechnung zu bedenken, die viele Plattformen gern verschleiern: Ein teureres Modell, das beim ersten Versuch trifft, ist oft billiger als ein günstiges, das man zehnmal neu würfeln lässt.
Geschwindigkeit. Die Wartezeiten im Video sind ausdrücklich grobe Richtwerte, abhängig von Prompt und Serverlast. Die Faustregel: Je besser das Modell, desto länger rechnet es. Nano Banana 2 Lite und GPT Image 2 Fast liefern 1K-Bilder in wenigen Sekunden. GPT Image 2 Complex braucht über eine Minute und eignet sich damit kaum für Serienproduktion.
Funktionen. Ältere Modelle wie Flux.1 Kontext oder das erste Nano Banana verarbeiten ein oder gar kein Referenzbild, Nano Banana 2 nimmt in AI Lab bis zu 14. Auch die nativ unterstützten Seitenverhältnisse unterscheiden sich, etwa zwischen GPT Image 1.5 und Nano Banana 2.
Das Kleingedruckte aus dem Schwarzwald
Ein Detail dürfte vor allem professionelle Anwender aufhorchen lassen. Wer AI Lab zum ersten Mal öffnet, sucht die Flux-Modelle vergeblich. Sie sind bewusst ausgeblendet, weil sich Black Forest Labs laut Giermann in den Nutzungsbedingungen umfangreiche Rechte an den hochgeladenen Bildern sichert, darunter das Training von KI-Modellen. Wer damit leben kann, schaltet Flux in den Einstellungen frei. Wer Kundenmaterial bearbeitet, sollte vorher die Bedingungen lesen.
Die Stärke der Chirurgen

Das beste Modell zum Generieren ist nicht automatisch das beste zum Bearbeiten. Giermann zeigt das an einem Porträt, bei dem Spiegelungen in einer Brille verschwinden sollen. Nano Banana 2, Nano Banana Pro und GPT Image erledigen das eindrucksvoll, erfinden dabei aber die Augen oft neu und verändern sie leicht. Flux.2 Pro arbeitet dagegen chirurgisch: Es folgt dem Prompt genau, greift nur im angegebenen oder ausgewählten Bereich ein und bewahrt die Originaldetails. An dieser Stelle spricht Giermann eine klare Empfehlung für Flux aus.
Bei Infografiken empfiehlt er die Reasoning-Modelle von Google und OpenAI. Nano Banana neigt zu verspielten, gelegentlich kitschigen Ergebnissen, GPT Image zu zeitgemäßeren Grafiken. Welches besser passt, hängt vom Prompt ab. Er rät, beide auszuprobieren.
Dafür hat AI Lab einen praktischen Kniff: Über mehrere Tabs lässt sich derselbe Prompt mit einem Klick gleichzeitig an verschiedene Modelle schicken. So ist auch das Sturmbild vom Anfang entstanden. Die generierten Bilder samt vollständiger Prompts stellt Giermann in voller Auflösung in der AI Lab School Community bereit.
Filmmaterial für das KI-Zeitalter
Wer die Analogfotografie noch erlebt hat, kennt das Prinzip. Kein Fotograf hätte ernsthaft gefragt, welcher der beste Film sei. Man griff zum Diafilm mit knalligen Farben für die Landschaft, zum Negativfilm mit weichen Hauttönen für das Porträt und zum körnigen Schwarzweißfilm für die Reportage. Jedes Material hatte seinen Charakter und seine Macken, und die Wahl war Teil der Bildidee.
Mit den KI-Modellen verhält es sich ähnlich. Der „KI-Look“ von Seedream, der HDR-Hang von GPT Image, die Detailwut von Flux sind Eigenheiten mit Wiedererkennungswert. Sie prägen die Bildsprache, und aufmerksame Betrachter lernen gerade, sie zu erkennen, so wie man früher einen Velvia-Himmel auf den ersten Blick erkannte. Die Modellwahl wird damit zur gestalterischen Entscheidung.
Giermanns persönliche Arbeitsteilung sieht so aus: Für fotografische Bilder nutzt er Nano Banana 2 als Standardwerkzeug und greift zu Nano Banana Pro, wenn das Ergebnis nicht reicht. GPT Image 2 ist seine Wahl für Infografiken oder wenn er eine zweite kreative Sicht auf einen Prompt sucht. Für die Fotobearbeitung setzt er auf Flux.2 Pro, weil derzeit kein anderes Modell die Originaldetails annähernd so gut bewahrt.
Wer 4K billig braucht, nimmt Seedream 4.5 und prüft Gesichter und Hände. Wer viele 1K-Bilder schnell braucht, greift zu Nano Banana 2 Lite oder GPT Image 2 Fast. Und wer ein Foto verändern will, ohne dass danach fremde Augen hineinschauen, landet bei Flux.
FAQ – KI-Bildgeneratoren im Test
Welcher KI-Bildgenerator ist 2026 der beste?
Es gibt 2026 kein KI-Bildmodell, das für alle Aufgaben das beste ist. Olaf Giermann kommt in seinem Vergleich der Modelle in AI Lab zu dem Schluss, dass sich jedes Modell für bestimmte Aufgaben besser eignet als andere. Nano Banana 2 gilt als vielseitiger Allrounder für fotografische Bilder, GPT Image 2 als bevorzugte Wahl für Infografiken und Flux.2 Pro als bestes Modell für die Fotobearbeitung.
Welche KI-Bildmodelle stehen in AI Lab zur Verfügung?
AI Lab von Picture Instruments bündelt KI-Bildmodelle von vier Anbietern. Google liefert Nano Banana, Nano Banana 2, Nano Banana 2 Lite und Nano Banana Pro. OpenAI steuert GPT Image 1.5 und GPT Image 2 in den Stufen Fast, Standard und Complex bei. Von Bytedance kommt Seedream 4.5, von Black Forest Labs stammen die Flux-Modelle wie Flux.1 Kontext, Flux.2 Pro und Flux.2 Flex.
Nach welchen Kriterien wählt man ein KI-Bildmodell aus?
Für die Wahl eines KI-Bildmodells sind sechs Kriterien entscheidend: Prompttreue, Bildqualität, Ausgabegröße, Kosten, Geschwindigkeit und Funktionsumfang. Die Prompttreue beschreibt, wie genau ein Modell die Anweisung befolgt. Zum Funktionsumfang zählen die Zahl der unterstützten Referenzbilder und die nativ verfügbaren Seitenverhältnisse. Auch die Nutzungsbedingungen eines Anbieters können entscheiden, ob ein Modell infrage kommt.
Was kostet ein KI-Bild in AI Lab?
Die Kosten in AI Lab reichen von 1 bis 72 Credits pro Generierung. Am günstigsten ist GPT Image 2 Fast mit 1 Credit für ein 1K-Bild, gefolgt von Flux.2 Pro mit 3 Credits in 1K. Seedream 4.5 liefert für 4 Credits bereits 4K. Nano Banana Pro kostet in 4K 24 Credits, GPT Image 2 Complex in 2,8K 72 Credits. Referenzbilder können je nach Modell zusätzliche Credits kosten.
Welches KI-Bildmodell ist am schnellsten?
Am schnellsten sind Nano Banana 2 Lite und GPT Image 2 Fast, die Bilder in 1K-Auflösung in wenigen Sekunden erzeugen. Das langsamste Modell ist GPT Image 2 Complex, das über eine Minute pro Bild benötigt. Grundsätzlich rechnen Modelle mit erweitertem Reasoning wie Nano Banana Pro länger. Die tatsächliche Dauer hängt von der Komplexität des Prompts und der Serverauslastung ab.
Welches KI-Modell eignet sich am besten für Infografiken?
Für Infografiken eignen sich vor allem Nano Banana von Google und GPT Image von OpenAI. Beide greifen auf das Wissen der Sprachmodelle Gemini beziehungsweise ChatGPT zurück und setzen Inhalte dadurch treffender um. Nano Banana neigt zu verspielten, gelegentlich kitschigen Ergebnissen, GPT Image zu zeitgemäßeren Grafiken. Olaf Giermann empfiehlt, beide Modelle mit dem eigenen Prompt auszuprobieren.
Welches KI-Modell ist am besten für die Bildbearbeitung?
Für die Bearbeitung vorhandener Fotos empfiehlt Olaf Giermann Flux.2 Pro von Black Forest Labs. Das Modell verändert nur den angegebenen oder ausgewählten Bereich und bewahrt die Originaldetails. Nano Banana 2, Nano Banana Pro und GPT Image entfernen etwa Brillenreflexe zwar eindrucksvoll, erfinden dabei aber die Augen oft neu und verändern sie leicht gegenüber dem Original.
Warum sind die Flux-Modelle in AI Lab standardmäßig ausgeblendet?
Die Flux-Modelle sind in AI Lab standardmäßig ausgeblendet, weil sich Black Forest Labs laut Olaf Giermann in den Nutzungsbedingungen umfangreiche Rechte an den hochgeladenen Bildern sichert. Dazu gehört auch das Training von KI-Modellen. Wer diese Bedingungen akzeptiert, kann die Flux-Modelle in den Einstellungen von AI Lab aktivieren. Bei Kundenmaterial sollten die Bedingungen vorher geprüft werden.
Welche Auflösung brauche ich für KI-Bilder?
Für soziale Medien reicht in der Regel eine Auflösung von 1K, also 1024 × 1024 Pixel bei einem quadratischen Bild. Für den Druck oder die Retusche von Bereichen in modernen Digitalfotos empfiehlt sich eine größere Ausgabe bis 4K. Ein 4K-Bild mit 4096 × 4096 Pixeln hat die vierfache Kantenlänge und sechzehnmal so viele Pixel wie ein 1K-Bild.
Wie vergleicht man mehrere KI-Bildmodelle mit demselben Prompt?
In AI Lab lässt sich derselbe Prompt über mehrere Tabs mit einem Klick gleichzeitig an verschiedene KI-Modelle senden. So entstehen parallele Ergebnisse, die sich direkt nach Prompttreue, Realismus und Fehlern vergleichen lassen. Olaf Giermann hat auf diese Weise einen längeren Prompt mit zwei Referenzbildern in sechs Modellen getestet. Nano Banana Pro lieferte dabei das beste Ergebnis.




