Waarom werken de meeste prompts niet?
Bij een taalmodel zeg je meestal wat je wilt dat er wordt uitgelegd, geschreven of bedacht. Bij beeld en video draait het om iets heel anders: je beschrijft wat de kijker letterlijk moet zien. Een prompt als "maak een mooie foto van een parfumflesje" laat de tool gokken naar stijl, belichting, camerastandpunt en sfeer, en dat gokken levert bijna altijd iets generieks op.
Het probleem zit 'm meestal niet in te weinig woorden, maar in de verkeerde woorden. Mensen beschrijven een gevoel of een oordeel ("mooi", "professioneel", "cinematic") in plaats van wat er precies in beeld staat. Een AI-model kan niets met "mooi", maar wel met "zacht studiolicht, marmeren ondergrond, scherptediepte op de voorgrond".
De oplossing: denk in bouwstenen, niet in één zin
De truc is om een prompt op te bouwen uit vaste onderdelen in plaats van uit één vage zin. Voor beeld werkt deze volgorde het beste: onderwerp, actie of houding, omgeving, stijl, compositie, licht en kleur, sfeer, en tot slot beperkingen zoals "geen tekst" of "geen watermerk". Voor video komt daar nog iets bij: camerabeweging, hoe lang het shot duurt, en wat er precies beweegt in het beeld.
Een simpel ezelsbruggetje: schrijf eerst wat je wilt zien, dan hoe het eruitziet, en pas daarna wat je wilt vermijden. Die volgorde houdt je prompt kort en maakt 'm ook makkelijker om achteraf bij te sturen. Deze aanpak is geen eigen bedenksel: ook grote tools als Kling en Google's Nano Banana raden zelf precies deze bouwstenen-volgorde aan in hun eigen prompthandleidingen.
Zo ziet het eruit in de praktijk
De meeste beeld- en videomodellen zijn vooral getraind op Engelstalige data en reageren daardoor preciezer op Engelse prompts dan op Nederlandse. Schrijf je liever gewoon in het Nederlands, dan werkt het ook, maar met net iets minder scherpe controle over stijl en details.
Neem een simpel voorbeeld voor een productfoto.
Maak een sfeervolle foto van een boekenwinkel.
A cozy independent bookshop interior, warm afternoon light through tall windows, wooden shelves filled with books, shallow depth of field, centered composition, realistic photography style, no text, no people.
Het verschil zit in de details: de tweede prompt benoemt de setting, het licht, de stijl en de compositie, en sluit expliciet uit wat je niet wilt. Daardoor krijg je een voorspelbaar resultaat in plaats van een gok.
Voor video komt daar beweging en timing bij.
Maak een video van een fietser in de stad.
A cyclist riding through a quiet European street at golden hour, camera tracks alongside at a steady pace, warm cinematic light, gentle motion blur on the wheels, 6-second horizontal video, realistic and calm mood.
Deze versie werkt beter omdat 'm precies vertelt wat de camera doet, hoe lang de clip duurt en welke sfeer je zoekt. Zonder die toevoegingen laat je de tool gissen naar tempo en beweging, en dat levert bijna altijd een statisch of onsamenhangend resultaat op.
Schrijf je volgende prompt meteen beter
Je hoeft niet alle bouwstenen tegelijk perfect te gebruiken. Begin met onderwerp, stijl en licht, en voeg camerabeweging toe zodra je aan video werkt. Wil je eerst de basis van prompten helemaal onder de knie krijgen, lees dan Wat is een prompt? En hoe schrijf je er één die écht werkt?. En wil je deze technieken meteen in de praktijk brengen, begin dan met Hoe kun je een AI foto maken? Handleiding voor absolute beginners.
Meer leren over AI?
Bekijk al onze gratis artikelen, geschreven voor beginners, in gewone mensentaal.
Bekijk alle blogs →