Midjourney Bild-zu-Bild
Midjourney Bild-zu-Bild und Bildreferenz: Vom Referenzbild zum kontrollierten Ergebnis
Midjourney.ing7 Min. Lesezeit

Inhalt+
Nur mit Midjourney-Prompts aus Text lassen sich manchmal Komposition, Materialien oder Charakterstimmung noch schwer festhalten. Dann lohnt sich Bild-zu-Bild / Bildreferenz: Mit einem (oder mehreren) Bildern sagst du dem Modell „in diese Richtung“, und Text korrigiert präzise. Dieser Artikel richtet sich an Midjourney V8.1 und erklärt die Aufgabenteilung zwischen Text-zu-Bild und Bildreferenz, typische Fehler und einen kontrollierten Weg vom Referenzbild bis zur Run as HD-Auslieferung.
Wenn du noch am Prompt-Gerüst baust, starte mit Midjourney Prompt-Tipps: Eine Struktur für V8.1 oder Midjourney Prompt-Fallbibliothek: 10 anpassbare V8.1-Szenenvorlagen; für die ganze Kette kombiniere mit Midjourney KI-Kunst von Anfang bis fertig: Der komplette Workflow 2026 (V8.1).
Zuerst trennen: Text-zu-Bild, Bild-zu-Bild, Stilreferenz
Im Midjourney-Alltag werden diese Begriffe oft vermischt. Praktisch kannst du so denken:
| Methode | Haupteingabe | Hält am besten fest | Typischer Einsatz |
|---|---|---|---|
| Text-zu-Bild | Text-Prompt | Motiv und narrative Absicht | Richtung von null erkunden |
| Bildreferenz (image prompt) | Referenzbild + Text | Komposition, Materialien, Charakter-/Produktstimmung | Du hast ein Muster und willst „ähnlich, aber keine Kopie“ |
| SREF (Stilreferenz) | Stilbild | Pinselführung, Farbe, Gesamtton | Visuelle Einheit in einer Serie |
| Moodboards | Stilboard | Ästhetischer Anker auf Projektebene | Langfristige Marken-/Account-Konsistenz |
Bild-zu-Bild meint auf dieser Site allgemein „Bilder steuern die Generierung mit“—am häufigsten die Bildreferenz, optional plus SREF / Moodboards. Es klebt nicht das Original pixelgenau; das Modell generiert neu unter Referenzvorgaben.
Warum sich Bildreferenz in V8.1 mehr lohnt
Midjourney V8.1 ist schneller, promptbewusster und unterstützt natives 2K-HD. Für die Bildreferenz-Kette heißt das:
- Geringere Iterationskosten: In SD kannst du mehr Kombinationen aus „Referenzstärke × Textbeschreibung“ testen.
- Stabilere Details: Materialien, kleine Objekte und Lichtbeziehungen lassen sich leichter an die Referenz angleichen.
- Klarer Auslieferungsweg: Richtung gesetzt → Run as HD oder
--hd—nicht alles in HD ausprobieren.
Hinweis: V8.1 / V8.2 unterstützen nicht das alte Qualitätsflag --q. Wenn dein alter Workflow auf --q 2 / --q 4 baute, wechsle zu SD/HD-Strategie statt Parameter hart zu übernehmen.
Wann Bildreferenz (statt weiterer Adjektiv-Stapel)
Signale, dass ein Referenzbild hilft:
- Du hast bereits Produktverpackung, Charakterdesign oder Raumfotos und brauchst „neues Bild mit gleicher Stimmung“
- Text-zu-Bild trifft das Motiv, aber die Komposition driftet
- Du machst Seriencontent: gleiche Figur/Produkt in verschiedenen Szenen
- Kunde oder Marke lieferte klare visuelle Muster, Text erfasst Material und Licht nicht vollständig
Wann reines Text-zu-Bild noch passt:
- Du suchst noch die grobe Richtung ohne jede Vorlage
- Die Referenz selbst hat schlechte Komposition und „vergiftet“ das Ergebnis
- Du brauchst vor allem Stileinheit, nicht Kompositionsübertragung—priorisiere SREF / Moodboards
Ein wiederverwendbarer kontrollierter Workflow (empfohlen)
1. Zuerst Text-zu-Bild für die Richtung „Inhalt stimmt“
Nicht mit Referenzbild starten. Lass ein paar Runden in SD mit kurzen Prompts laufen, um Motiv, Blickwinkel und grobe Beleuchtung zu bestätigen. So erkennst du, ob die Referenz „Komposition rettet“ oder „Stil rettet“.
2. Den richtigen Referenztyp wählen
| Was du festhalten willst | Passendere Referenz |
|---|---|
| Komposition / Pose / Produktplatzierung | Klares Foto oder fertiges Bild mit vollständigem Motiv |
| Charakterstimmung / Make-up-Gefühl | Lesbares Halbnah mit Gesicht und Licht |
| Materialien und Verpackungstextur | HD-Stilleben, sauberer Hintergrund |
| Pinselführung und Farbsystem | Stilmuster → priorisiere SREF |
| Gesamte Markenästhetik | Moodboards |
Prinzip: Ein Bild, eine Hauptaufgabe. Kompositions- und Stilreferenz in einem „Universalbild“ scheitert oft an beiden Fronten.
3. Bildreferenz + Text: Text sagt „was ändern“
Die Referenz steuert „wonach es aussehen soll“; der Text „worin es sich unterscheidet“. Effektives Muster:
- Strukturelle Vorteile der Referenz behalten (Komposition, Motivbeziehungen)
- Im Text die Dimensionen benennen, die du änderst: Szene, Tageslicht, Kleidung, Hintergrund, Objektiv
- Keine neue lange Stil-Adjektivkette, die der Referenz widerspricht
Beispielansatz (nur Textteil):
same product silhouette and label layout, place on a sunlit oak breakfast table, soft morning window light, lifestyle product photography –stylize 100
Hier fixiert die Referenz Produkt-Silhouette und Etiketten-Anordnung; Text ändert Szene und Licht.
4. Bei Seriengefühl SREF / Moodboards dazunehmen
Übliche Stapel-Reihenfolge:
- Bildreferenz hält Motiv/Komposition
- SREF oder Moodboards halten Pinselführung und Farbe
- Mit Personalization kannst du
--stylizeerhöhen, damit dein persönliches Ästhetikprofil stärker die Stimmung prägt - Vary / Remix für kleine Iterationsschritte, nicht jedes Mal neu anfangen
V8.1 ist für Stilkonsistenz nutzbarer als frühe Versionen; bei Marken- und Account-Content zuerst Anker setzen, dann in Serien erweitern.
5. Parameter kombinieren: --raw, --stylize, chaos, HD
--raw: Sehr nützlich bei Produkt, Architektur und neutral-realistischer Referenzübertragung—dämpft den Standard-Kinofilter, Ergebnis näher an Referenz und wörtlichem Prompt.--stylize: Höhere Werte = stärkere ästhetische Eingriffe; mit Personalization oder starker Stilreferenz höheren stylize testen.--chaos: In der Erkundung etwas höher; sobald die Referenzbeziehung stabil ist, chaos senken, damit die Komposition nicht zerstreut wird.- Auflösung: Erkunden immer in SD; nach Fixierung Run as HD für ~2K-Auslieferung.
6. Checkliste vor der Auslieferung
Kurz durchgehen:
- Stimmen Motivproportionen und Schlüsselstruktur noch mit der Referenzabsicht überein?
- Haben sich die Teile wirklich geändert, die du im Text „unbedingt ändern“ wolltest?
- Sind Kanten, Etiketten, Finger/Verpackungsdetails akzeptabel?
- Teilen Bilder einer Serie Farbtemperatur und Objektivsprache?
- Wurde in HD ausgegeben—nicht Erkundungsframes abgeliefert?
Drei häufige Szenarien
Szenario A: E-Commerce-Produkt, neue Szene
Ziel: dieselbe Flasche/Verpackung in Küche, Bad, Reise-Szenen.
- Sauberes Weiß-Hintergrund- oder Stillebenbild als Bildreferenz
- Im Text nur Szene und Licht ändern; Verpackung wenig neu beschreiben
--rawfür stärkere Befolgung- In SD Seed wählen, bei dem Etiketten lesbar bleiben, dann Run as HD
- Bei Multi-Szenen-Serie SREF fixieren, damit der Stil nicht pro Bild driftet
Szenario B: Gleiche Figur, verschiedene Szenen
Ziel: gleiche Charakterstimmung, neue Hintergründe und Kleidungszustände.
- Von einem erfolgreichen Text-zu-Bild-„Look“ oder Live-Referenz ausgehen
- Bildreferenz hält Gesicht/Stimmung; Text beschreibt neue Szene und Aktion
- Stil driftet → SREF dazu—nicht nur Stilwörter stapeln
- Remix zum Feintuning des Prompts; Vary Subtle für bessere Komposition
- Hinweis: Ein Teil der Legacy-Charakterreferenz hat sich in der V8-Familie geändert; praktisch auf aktuelle Bildreferenz + Stilanke setzen und in kleinen Schritten validieren
Szenario C: Raum-/Architekturkonzept „fühlt sich wie die Vorlage an“
Ziel: Kunde lieferte Konkurrenzraum oder Moodboard; du brauchst neuen Entwurf, aber gleiche Bildsprache.
- Vorlage als Kompositions- oder Materialreferenz (keine Grundriss-Präzision erwarten)
- Im Text klar „neue Funktionszone / neues Mobiliar / Licht anderer Tageszeit“
--raw+ niedriges chaos für stabile Perspektive- Moodboards für Projekteinheit
- Vor HD prüfen, ob Perspektive und Materialien lesbar sind, dann ausliefern
7 Fallen, in die Einsteiger am häufigsten tappen
- Referenz zu unscharf oder Motiv beschnitten — das Modell lernt falsche Struktur.
- Text und Referenz widersprechen sich — Referenz ist soft japanisch-minimalistisch; Text sagt „Cyber-Neon dicker Impasto“.
- Eine Referenz für Komposition, Stil und Figur — aufteilen.
- Referenzstärke komplett in HD testen — teuer und langsam; in V8.1 SD→HD.
- Nur Bildreferenz, obwohl SREF nötig war — Komposition passt, Stil driftet weiter.
- Keine kleinen Iterationsschritte — jedes Mal große Prompt-Wechsel + neue Referenz; du sammelst keine brauchbaren Kombinationen.
- Bild-zu-Bild als „verlustfreie Originalbearbeitung“ verstehen — Midjourney generiert neu; du willst kontrollierte Ähnlichkeit, keine Pixel-Replik.
Wie es zum restlichen Site-Content passt
- Prompt-Struktur: lies Midjourney Prompt-Tipps: Eine Struktur für V8.1
- Anpassbare Vorlagen: lies Midjourney Prompt-Fallbibliothek: 10 anpassbare V8.1-Szenenvorlagen
- Auflösungsstrategie: lies Midjourney HD vs SD: Zeit und Kosten mit einer Auflösungsstrategie sparen
- V8.1-Fähigkeiten und Migration: lies Midjourney V8.1 im Detail: Schneller, prompttreuer und mit nativem 2K-HD
- End-to-End-Workflow: lies Midjourney KI-Kunst von Anfang bis fertig: Der komplette Workflow 2026 (V8.1)
- Stilserien in der Praxis: folge dem Tutorial Serien-Visuals mit Style Reference: Markenkonsistenz in Midjourney
midjourney.ing konzentriert sich auf kontrollierte Generierungsmethoden mit Midjourney V8.1. Mit einem klaren Referenzbild betrittst du den Workspace über Try Midjourney in der Kopfzeile: in SD prüfen, ob „Referenz + Text“ gehorcht, dann Run as HD ausliefern.
Schluss
Der Wert von Midjourney Bild-zu-Bild und Bildreferenz liegt darin, Raten in Vorgaben zu verwandeln. Text-zu-Bild für die Richtung, Bildreferenz für Struktur und Stimmung, SREF / Moodboards für Serienstil, Run as HD für 2K-HD-Auslieferung—das bleibt 2026 ein gültiger kontrollierter Weg der KI-Bildgenerierung. Starte mit dem klarsten Produkt- oder Charakterbild, das du hast: ändere eine Szenenvariable, führe die erste SD→HD-Runde durch, und du spürst, warum „kontrolliert“ mehr wert ist als „ein zufälliges Meisterwerk“.


