Afhankelijk van welke uithoeken van het internet je graag bezoekt, is je misschien net als mij een toename in specifieke AI-gegenereerde video's opgevallen. Met name video's van scènes van Seinfeld en The Big Bang Theory. Dit komt omdat er weer een nieuw AI-model is uitgekomen, dat vrij goed lijkt te zijn in het genereren van dit soort video's.
We hebben het hier over het model MiniMax H3 van de Chinese startup MiniMax.
Vaak is het nog goed te zien dat dit AI-gegenereerde video's zijn. Omgevingen kloppen niet helemaal, hoofden van mensen veranderen, en er is vaak gewoon een vrij incoherent gevoel aanwezig in de gehele video. Maar ondanks dat ben ik ook al een aantal video's tegengekomen waarvan ik bijna begon te twijfelen of het toch wel scènes waren van de bestaande afleveringen.
Hier is een voorbeeld dat ik recent op Reddit tegenkwam:
Waarom is het model hier zo goed in?
Over het algemeen is het niet mogelijk of toegestaan om auteursrechtelijk beschermde afbeeldingen of video's te genereren. De grote partijen, zoals Google en OpenAI, zijn namelijk geen grote fans van rechtszaken rondom copyright.
Maar in China gaan ze doorgaans losser om met IP-rechten. Het is heel duidelijk dat het model getraind is op dit specifieke materiaal. Het is namelijk uitzonderlijk goed in staat om vergelijkbare video's te maken. Daarnaast is dit een open model, dat je kunt downloaden en zonder restricties kunt gebruiken. De beveiligingen (safeguards) rondom de detectie van 'misbruik' zitten vaak niet ingebakken in het model, maar in de laag eromheen. Bovendien is het model erg geschikt om te draaien op een lokale computer. Veel haalbare computerconfiguraties zijn in staat om dit model te draaien.
Over de situatie rondom copyrightschendingen en andere juridische of ethische zaken laten we ons verder niet uit, want daar hebben we totaal geen verstand van. We gaan ons richten op iets veel leukers: namelijk het uitproberen van het model.
Disclaimer: Video's niet zichtbaar? Lees dit
Werken de video-voorbeelden hieronder niet goed? Grote kans dat je nog geen cookies hebt geaccepteerd, terwijl embedded YouTube-video's die vereisen. Helaas heeft dit artikel weinig waarde als je deze video's niet kunt zien.Hier zijn twee mogelijkheden:
1. Wil je ze graag op onze website zien? Dan kun je hier je cookietoestemming aanpassen.
2. Wil je dat liever niet? Dan staat er bij iedere video ook nog een losse URL naar YouTube waar je op kunt klikken.
De terugkeer van de fotograap
Trouwe lezers van dit blog herinneren zich misschien nog onze artikelen over Veo 3 en Wan 2.2. Zo hadden we daar bijvoorbeeld de 'Fotograap'-video. De video die Wan 2.2 hiervan maakte kon het best omschreven worden als een koortsdroom. Veo 3 maakte iets wat wel meer in de buurt kwam van de prompt, en vooral heel grappig was.
Hoe zal MiniMax H3 het doen? Mijn eerlijke verwachtingen waren dat het meer in de buurt zou zijn van Wan 2.2, dan van Veo 3. Het is immers een 'lightweight openweight model', wat lokaal gedraaid kan worden. Dat kan vast niet opboksen tegen zo'n groot gesloten commercieel model.
Maar niets bleek minder waar.
De fotograapVideo
Ik stond ervan versteld hoe goed MiniMax H3 hier mijn opgegeven prompt volgde. Ongelooflijk. Dit is min of meer exáct wat ik bedoelde en voor me zag, toen ik vorig jaar deze prompt verzon. Toen ik zag wat de video-modellen van toen daarmee produceerden, stelde ik al snel mijn mentale model bij over de capaciteiten en limitaties van video-modellen in het algemeen. Nu ik dit heb gezien, is het dus tijd om dat weer te doen, maar dan de andere kant op.
Hoe is deze kwaliteit mogelijk uit zo'n model?
Ik had geen video van deze kwaliteit verwacht van zo'n klein en vrij beschikbaar model. Alhoewel de meningen erover verschillen, is het al enige tijd de 'algemene' wijsheid dat de Chinese modellen ongeveer zes maanden achterlopen op de Amerikaanse modellen. Maar dit gaat met name op voor de tekst-modellen. Rondom de video-generatiemodellen heb ik namelijk het idee dat er weinig (interessante) vooruitgang is geweest van Amerikaanse bodem in de afgelopen tijd.
Zo kondigde OpenAI in maart 2026, tot mijn grote verrassing en grotere teleurstelling, aan dat ze gingen stoppen met de Sora-modellen. Midjourney bracht vorig jaar in juni zijn video-model uit, en voegde vorig jaar augustus een HD/720p mode eraan toe, maar heeft sindsdien ook niks nieuws meer uitgebracht. En ook Veo 3 van Google is inmiddels al vrij oud. Er zijn wel updates uitgekomen met wat verbeteringen (Veo 3.1) en een transitie naar een combinatiemodel (Omni) dat gericht is op multimodaliteit, maar eigenlijk vind ik dat er sinds de originele release van Veo 3 geen echte 'grote stap' meer is gemaakt op het vlak van de capaciteiten van video-generatie.
De focus lijkt bij de grote Amerikaanse partijen dus echt meer op de tekst-modellen te liggen, en de vooruitgang van de video-modellen lijkt wat gestagneerd te zijn. Terwijl in China de ontwikkelingen en innovatie van video-modellen juist flink doorzetten.
Ik weet niet of dit echt het geval is - misschien verrast één van de grote Amerikaanse bedrijven ons binnenkort toch met een waanzinnig nieuw model. Daarmee zou dit hoofdstuk van dit blogartikel gelijk een stuk minder sterk zijn. Maar gelukkig houden we de rest van dit artikel nog wel relevant, want we gaan nu de resultaten van mijn tests bekijken. Tijd om wat video's te bekijken dus.

Aquamentus
Voor wie hier nieuw is: Aquamentus is onze balkendraak. Hij dankt zijn bestaan aan een vertaalfout uit Vertalen met AI - Deel 1: Lost in Translation: de Engelse zin over deze vijand uit The Legend of Zelda, die 'beams in three directions' schiet, werd door het ene na het andere model vertaald als een draak die met balken schiet. Sindsdien is hij de vaste testzin van onze vertaalkaarten, en inmiddels ook een terugkerend personage in onze video-experimenten.
Aquamentus mag dan met pensioen gegaan zijn voor zijn vertaalwerk, maar ik zie hem toch graag af en toe nog een gastverschijning maken voor dit soort activiteiten. Zowel Wan 2.2 als Veo 3 genereerden hier redelijke video's, maar wel met duidelijke fouten. De video die MiniMax H3 heeft gemaakt vond ik beduidend beter.
Balkendraak in bewegingVideo
while a person in a green shirt is watching him with a wondering expression.
Len en de trein
Een oude favoriet van mij - Len in de Efteling-trein. MiniMax H3 doet hier iets wat ik nog geen enkel ander model heb zien doen: achteruit rijden.
Harry Potter-krant
Ben je een fan van Harry Potter? Misschien herinner je je dan nog de bewegende afbeeldingen in de kranten. Met Wan 2.2 wist ik dat effect te reproduceren - en met MiniMax H3 lukt het ook aardig.
De nieuwe Webenable-sitcom
Aan het begin van dit artikel schreef ik over hoe goed het model was in het (na)maken van sitcoms uit zijn trainingsmateriaal. Dit komt doordat generatieve modellen heel goed zijn in het generaliseren en extrapoleren op basis van patronen in hun trainingsdata.
Bovendien kunnen ze geleerde patronen overdragen naar nieuwe contexten: concepten die ze in het ene domein
hebben geleerd, kunnen ze soms ook in een ander domein toepassen. Bij taalmodellen zien we iets vergelijkbaars
in de vorm van cross-lingual transfer: een meertalige LLM kan kennis die hij in de ene taal heeft opgedaan,
vaak ook in andere talen toepassen. Dit zien we ook terug in programmeertalen, en, zoals benoemd, dus
ook in video-generatie.
Het is dus tijd om de Webenable-sitcom te gaan maken!
Webenable SitcomVideo
Persoon 1: “Ik heb vandaag echt keihard gesport.”
Persoon 2: “Serieus? Wat heb je gedaan?”
Persoon 1: “Ik heb de sportschool opgezocht op Google Maps.”
Persoon 2: “Rustdag morgen?”
Persoon 1: “Sowieso.”
Ik weet niet hoe het met jullie zit, maar ik kan zelf niet wachten tot dit op TV komt!
Lachband
Maar een fatsoenlijke sitcom heeft wel een lachband nodig! Anders is het natuurlijk niet leuk. Bovendien is het ook een goede test van dit model. Tijd dus om dezelfde scène nogmaals te maken. Dit keer heb ik een groot deel van de prompt in het Engels gedaan, en wat meer omschrijvingen toegevoegd. Zoals ook een static camera, zodat we de close-up van Henk niet nogmaals hoeven te ondergaan.
Webenable Sitcom (met lachband)Video
Person 1 says in Dutch: “Ik heb vandaag echt keihard gesport.”
Person 2 replies in Dutch: “Serieus? Wat heb je gedaan?”
Person 1 says in Dutch: “Ik heb de sportschool opgezocht op Google Maps.”
A short audience laugh track plays.
Person 2 replies in Dutch: “Rustdag morgen?”
Person 1 replies in Dutch: “Sowieso.”
A louder audience laugh track plays after the final two lines.
Veel beter zo, met een fatsoenlijke lachband! Ik denk dat we een goede stap hebben gemaakt naar onze
bedrijfssitcom. Binnenkort dus verplicht materiaal voor alle Webenablers om naar te kijken. Hoe zullen
we de sitcom noemen? Ik zat te denken aan Web & Able.
Hoeveel kost dit model?
Volgens mij heb ik zo'n acht tot tien video's gemaakt. In het Webenable-OpenRouter-account zag ik onze credits van 38 naar 28 euro gaan. Het model kost daar 13 cent per gegenereerde seconde. Als je het lokaal draait is het natuurlijk nog goedkoper.
Ik moest hierbij terugdenken aan de oorspronkelijke kosten van Veo 3. Toen dat model uitkwam, waren de kosten hiervan zo'n zes tot acht euro per video (voor video's van acht seconden). Behoorlijk hoge kosten dus, maar dat is hier niet relevant. We zijn een jaar verder en ik denk dat het duidelijk is dat het model zowel beter als goedkoper is. Deze laatste video was destijds gemaakt als reactie op de hoge kosten van Veo 3. Dat stukje is nu wat minder relevant. Maar wat mij betreft is ie nog wel legendarisch.
Jeroen, stop met die flauwe grappen! Dit kost ons een fortuin!Video
Person 1 (Casper) tells person 2 (Jeroen) to stop it with the jokes (in dutch), person 2 (Jeroen) responds by bungie jumping. In the background behind him explosions are everywhere.
Audio:
Howling wind under Casper, heartbeat-thump build into Jeroen’s scream, bass drop on explosion.
Casper (on edge):
"Jeroen, stop met die flauwe grappen! Dit kost ons een fortuin."
Jeroen (yelling, mid-jump):
"NEEEEE, dit wordt legendarisch!"