quote:Op dinsdag 4 augustus 2026 03:32 schreef raptorix het volgende:
Eerste tests gedaan, eerste indruk, erg sterk en snel, daarnaast doorbreken we nu eindelijk de kwaliteit van wan2.2 met de lengte van LTX, ik zal morgen nog wat resultaten posten.
Hoeveel werk is het om die hele santemekraam op te tuigen? Vergt het enorm veel configuratie/kennis? Kun je wat zeggen over eventuele beperkingen? (als een ander topic hiervoor handiger is, by all means).quote:Op dinsdag 4 augustus 2026 18:43 schreef ffoyle-involutus het volgende:
[..]
Ik ben niet onder de indruk van dit model, krijg het gewoon niet voor elkaar iets leuks te genereren, zelfs als ik voorbeeld prompts gebruik krijg ik niet hetzelfde als wat de voorbeelden weergeven. Veel artifacts en ik vind de kwaliteit zeer matig, zelfs als ik hogere resoluties gebruik lijkt alles wazig en vaag. Misschien dat het komt door het gebruik van INT8 ConvRot quantized modellen, geen idee. Het ligt vermoedelijk aan mijn setup gezien anderen er de leukste dingen mee maken. Ik gebruik de modellen geleverd door Comfy en hun officiële workflow.
Benieuwd wat jij ermee kunt genereren.
Zit geluid bij de filmpjes, dit is hoorbaar als je de video in een nieuw tabblad opent.
Vind het realisme hier tegenvallen, bomen zien er imo veel te plat uit:
[ afbeelding ]
Dit is de enige van de inmiddels 20 die een beetje goed gelukt is. Vind hier het geluid echter tegenvallen.
[ afbeelding ]
I2V, de startframe was een foto van mijn eenden op het terras. In de prompt aangegeven dat de eend aan de linkerkant de zwarte een schop moest geven zodat die in het water zou vallen. Dat is redelijk gelukt maar aan het einde zie je duidelijk uitgesmeerde meuk bij de eend die in het water viel.
[ afbeelding ]
Een danser op het ijs. De eerste frame is al een puinhoop en de rest is niet beter. Het gezicht is één en al uitgesmeerde troep. Vind het wel knap dat hij redelijk goed omgaat met ledematen (aan het einde zie je een glitch), de meeste andere modellen falen hard op dit soort zaken.
[ afbeelding ]
De kabel is een beetje vreemd gepositioneerd, verder wel goed gelukt. Ik zat er vanmiddag nog over na te denken hoever we in korte tijd zijn gekomen. Kunnen lokaal geavanceerde AI modellen draaien op GPU's die miljarden bewerkingen per seconde kunnen uitvoeren, ik had dat nooit verwacht.quote:Op dinsdag 4 augustus 2026 19:07 schreef atohemert het volgende:
[ afbeelding ]
Was niet veel bijzonders maar toch een goed eindresultaat van een oude PC die al veel slijtage had en gebruiksuren. Dit is wel een herkenbaar moment toen internet nog traag was, inbellen de norm en een ratelende harde schijf onderdeel was van de hele situatie
Klopt viel mij ook op, maar had dat volgens mij zo geprompt destijds om het wat absurdistischer te maken, voor zover ik weet waren zulke aansluitingen doorgaans aan de achterkant van de PCquote:Op dinsdag 4 augustus 2026 19:13 schreef ffoyle-involutus het volgende:
[..]
De kabel is een beetje vreemd gepositioneerd, verder wel goed gelukt. Ik zat er vanmiddag nog over na te denken hoever we in korte tijd zijn gekomen. Kunnen lokaal geavanceerde AI modellen draaien op GPU's die miljarden bewerkingen per seconde kunnen uitvoeren, ik had dat nooit verwacht.
Als je met een terminal om kunt gaan heb je Comfy zo draaien, mits je hardware ervoor geschikt is. 16 gig aan vram en veel ram/snelle opslag is eigenlijk wel een must. Je zult je wel moeten verdiepen in de modellen die je wilt gebruiken, ze hebben veelal allemaal een eigen manier van prompten. En daarbij is het ene model beter in sommige zaken dan een ander, wat weer beter kan zijn op andere gebieden. Meeste tijd zal in het inlezen gaan zitten...quote:Op dinsdag 4 augustus 2026 19:11 schreef 2dope het volgende:
[..]
[..]
Hoeveel werk is het om die hele santemekraam op te tuigen? Vergt het enorm veel configuratie/kennis? Kun je wat zeggen over eventuele beperkingen? (als een ander topic hiervoor handiger is, by all means).
Ik vraag het ff omdat ik sinds ongeveer een half jaar rete-verslaafd ben aan Blender. Ik ben in korte tijd aardig bekwaam geworden in het maken van animaties, alleen het is zooooo tijdrovend. Uiteindelijk wil ik wellicht iets "groots" maken en heb gemerkt dat bepaalde fragmenten prima aan/op te vullen zijn met AI short animations (gebaseerd op mijn eigen blends). Tot op heden gebruikte ik Sora (volledige/betaalde) en voor het wat insignificantere spul, tools als pika.art.
Blijft leuk eh?quote:Op dinsdag 4 augustus 2026 21:19 schreef ffoyle-involutus het volgende:
Het plaatje gepost door @:LordofLeaves in LordofLeaves in SEX / Ontwerp jouw eigen droomvrouw?! geanimeerd met Minimax. Het is niet verkeerd maar ook niet geweldig. Beetje jammer. Vind het genereren ook best lang duren, een turbo lora zou fijn zijn.
[ afbeelding ]
[ afbeelding ]
Die eerste is erg leuk. Snelle beweging heeft het toch wat moeite mee en zitten nog wat glitches in, blijkbaar is dat gewoon hoe het model is. Maar goed, andere open modellen hebben dat ook. Ben je tevreden met het resultaat?quote:
Ja wel tevredenen hoor, de 2e was meer een experiment, omdat er al een tijdje een vergelijkbaar filmpje rondging op socials die zelfde showed, dus dacht, kijken hoe dit model het benaderd, eigenlijk doet dit model snelle bewegingen verrassend goed, ik zal je uitleggen waarom dat zo is, een LLM dat getrained is op videos split een video doorgaans op in losse frames die het weer als images leert, kortom een filmpje waar iemand bijvoorbeeld een klap geeft, heeft maar 2-5 frames waar dat daadwerkelijk plaats vind, kortom het model leert niet echt hoe dat er echt uitziet, maw alles wat in snelle bewegingen plaats vind is doorgaans lastig, als het al goed gaat, dan zie je ook vaak dat dat alleen lukt in een soort slowmotion version. Ik vermoed dat dit model ook getrained is op videos met een extreem hoge framerate, of anders op een andere slimme manier.quote:Op woensdag 5 augustus 2026 20:22 schreef ffoyle-involutus het volgende:
[..]
Die eerste is erg leuk. Snelle beweging heeft het toch wat moeite mee en zitten nog wat glitches in, blijkbaar is dat gewoon hoe het model is. Maar goed, andere open modellen hebben dat ook. Ben je tevreden met het resultaat?
Ben ook benieuwd welk model je gebruikt hebt. Ik heb de BF16 variant gecheckt maar deze is bij mij qua output heel erg vergelijkbaar met INT8. Wat ook iets zegt over de kwaliteit van INT8 ConvRot.
Het is dat ik je ken, maar anders was ik hier 'waarom dat zo is, een LLM' gestopt met lezenquote:Op donderdag 6 augustus 2026 03:38 schreef raptorix het volgende:
[..]
Ja wel tevredenen hoor, de 2e was meer een experiment, omdat er al een tijdje een vergelijkbaar filmpje rondging op socials die zelfde showed, dus dacht, kijken hoe dit model het benaderd, eigenlijk doet dit model snelle bewegingen verrassend goed, ik zal je uitleggen waarom dat zo is, een LLM dat getrained is op videos split een video doorgaans op in losse frames die het weer als images leert, kortom een filmpje waar iemand bijvoorbeeld een klap geeft, heeft maar 2-5 frames waar dat daadwerkelijk plaats vind, kortom het model leert niet echt hoe dat er echt uitziet, maw alles wat in snelle bewegingen plaats vind is doorgaans lastig, als het al goed gaat, dan zie je ook vaak dat dat alleen lukt in een soort slowmotion version. Ik vermoed dat dit model ook getrained is op videos met een extreem hoge framerate, of anders op een andere slimme manier.
Model wat ik gebruik is: minimax_h3_fl2va_pruned_int8_convrot.safetensors
Doorgaans met dit soort modellen is dat als je een dubbele grote gebruikt je ongeveer 10-15 procent meer kwaliteit hebt, ik moet nog wat testen, maar me schijf is ramvol, dus even gaan kijken wat er weg kan
Haha ja, dat komt omdat ik namelijk net met mijn lokale LLM bezig was de system prompt goed in te stellen, die glitches heb ik ook wel gezien, vooral met image2video. Ik vind het zelf niet heel storend moet ik zeggen!quote:Op donderdag 6 augustus 2026 08:58 schreef ffoyle-involutus het volgende:
[..]
Het is dat ik je ken, maar anders was ik hier 'waarom dat zo is, een LLM' gestopt met lezenHet is natuurlijk geen LLM (Large Language Model) maar een Diffuser.
En klopt, de framerate van het materiaal wordt tijdens het trainen verlaagt maar ergens hoopte ik dat ze hier iets slims hadden bedacht wat dat zou verbeteren, de voorbeelden zagen er namelijk niet verkeerd uit maar nu ik het zelf lokaal draai lijk ik niet zulke mooie generaties te krijgen. Daarnaast zie ik best wel veel glitches in de output en ik heb het idee dat dit model daar gevoeliger voor is dan bijv. een Wan2.2.
Verder is het een leuk model en de community gaat vast nog wel wat mooie uitbreidingen hiervoor maken. Enige wat beetje jammer is, is de vage licentie constructie van dit model. In de EU, UK en US mag je dit model niet gebruiken voordat je een licentie form hebt ingevuld en goedkeuring hebt gekregen. Ik heb het maar gedaan en heb goedkeuring maar blijft wel een restrictief iets. Ook voor makers van Lora's en dergelijke.
| 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 | subject_definitions: <Subject 1> is the squirrel wearing a vintage brown leather stunt suit with brass buckles, a round glass-and-leather aviator helmet with goggles pushed up on its forehead, and a small red scarf tied around its neck. <Subject 2> is the large African elephant with textured grey skin, expressive eyes, and a long muscular trunk capable of precise gripping and explosive airflow. <Subject 3> is the circular wooden-framed catching net with thick rope mesh, suspended from a high canopy branch against a sunlit jungle clearing backdrop. summary: [reference generation] The target video follows <Subject 1> being lifted by <Subject 2>, launched like a cannonball from its trunk, soaring through the air in slow motion, and landing perfectly inside <Subject 3>. The sequence emphasizes dynamic camera movement, expressive character acting, and Pixar-style lighting. retention_analysis: <Subject 1> (appears in [Shot 1], [Shot 2], [Shot 3]): fully_preserved - the leather stunt suit, brass buckles, aviator helmet with goggles, and red scarf are retained throughout. <Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the elephant's textured grey skin, expressive eyes, and trunk mechanics are consistent. <Subject 3> (appears in [Shot 3]): fully_preserved - the wooden frame, rope mesh, and suspension position remain unchanged upon impact. detailed_description: The target video is a Pixar-style animated short with vibrant lighting, expressive character acting, and cinematic composition. [Shot 1] At 00:00.000, the scene opens in a sun-dappled jungle clearing with tall ferns and dappled golden-hour light filtering through the canopy. <Subject 2>, the large grey elephant, stands calmly on all fours, its trunk curled gently around <Subject 1>, the squirrel in the brown leather stunt suit and aviator helmet. The camera tracks slowly upward as the elephant lifts <Subject 1> to eye level. <Subject 1> adjusts its goggles with a determined expression, paws gripping the trunk's tip. A low, rhythmic drumbeat begins underneath. [Shot 2] At 00:04.500, the shot cuts to a dynamic low-angle tracking shot as the elephant's trunk expands and releases in a controlled burst of air. <Subject 1> is launched forward like a cannonball, its stunt suit flapping slightly, goggles reflecting the sky. The camera follows in smooth parabolic motion, matching the squirrel’s trajectory through the air. Leaves and dust particles drift past in slow motion as <Subject 1> tucks into a streamlined pose, eyes locked on the target below. [Shot 3] At 00:09.000, the shot cuts to a wide establishing view of <Subject 3>, the circular wooden-framed catching net suspended from a thick vine against the jungle backdrop. <Subject 1> descends rapidly, arms outstretched for balance, and lands with a soft thwump exactly in the center of the mesh. The net stretches slightly under the impact before settling. <Subject 1> pops up, gives a thumbs-up to the camera, and tips its helmet as golden light flares across the frame, holding the pose until 00:15.000. overall_soundscape: Jungle ambience with distant bird calls, rustling leaves, and soft wind continues throughout. The elephant’s trunk release produces a sharp whoosh, followed by the net’s rope creak and a muffled landing thud. non_diegetic_music: A playful, orchestral Pixar-style score with light percussion, woodwinds, and a rising brass motif that peaks at launch and resolves into a warm, triumphant chord upon landing. |
Jazeker. Ik heb tevens een systemprompt voor LLM's gevonden welke ik gebruik voor het verbeteren van de MiniMax prompt. Geef op hoe lang de video gaat duren en wat er in de video voor moet komen. Je krijgt vervolgens een kant en klare prompt in het formaat als jij net gafquote:Op donderdag 6 augustus 2026 09:20 schreef raptorix het volgende:
[..]
Haha ja, dat komt omdat ik namelijk net met mijn lokale LLM bezig was de system prompt goed in te stellen, die glitches heb ik ook wel gezien, vooral met image2video. Ik vind het zelf niet heel storend moet ik zeggen!
Ik weet niet of je naar de prompt instructions hebt gekeken, maar die zijn best nauwkeurig, voor bovenstaande video gebruik ik dit:
[ code verwijderd ]
https://huggingface.co/Mi(...)TING_GUIDE_ref_en.md
Genereer je wellicht in te weinig stappen?quote:Op donderdag 6 augustus 2026 09:59 schreef ffoyle-involutus het volgende:
Als het allemaal niet zo snel gaat, gaat het best goed. Dit is I2V, input was een plaatje welke ik met Flux.2 Dev had gegenereerd.
[ afbeelding ]
Ik hou de standaard 20 aan zoals dat reeds in de workflow was geconfigureerd.quote:Op donderdag 6 augustus 2026 13:30 schreef raptorix het volgende:
[..]
Genereer je wellicht in te weinig stappen?
SPOILEROm spoilers te kunnen lezen moet je zijn ingelogd. Je moet je daarvoor eerst gratis Registreren. Ook kun je spoilers niet lezen als je een ban hebt.Staatsondermijnende linkse sneuneus en klimaat mongool
|
|
| Forum Opties | |
|---|---|
| Forumhop: | |
| Hop naar: | |