2023–2026 · Teledyski AI
MovieshMash.to: montaż prowadzony ścieżką dźwiękową
Platforma czyta plik audio: tempo, nastrój i tekst utworu. Na tej podstawie generuje ujęcia i układa montaż z cięciami w rytm. Silnik montażowy udostępniliśmy jako otwarty węzeł ComfyUI na licencji Apache 2.0.
- Technologie
- Gemini 1.5 Pro, GPT-4, rendering GPU
- Początek prac
- 2023
- Eksport
- 4K, 24, 30 albo 60 kl./s, EDL i XML
- Adress
- movieshmash.to
01Wyzwanie
Cięcie ma padać na uderzenie
Teledysk, zwiastun i krótka forma do mediów społecznościowych mają wspólną część pracy: obraz trzeba zsynchronizować z dźwiękiem. Ręcznie to odsłuch, znaczniki na osi czasu i dobór ujęć.
Przy każdym kolejnym utworze ta praca zaczyna się od początku, bo znaczniki z poprzedniego są nieaktualne.
02Rozwiązanie
Analiza utworu, ujęcia i montaż w rytm
MovieshMash.to przejmuje tę część. Po wgraniu pliku system wykrywa tempo (BPM), nastrój, tekst i budowę emocjonalną utworu, a potem generuje ujęcia i składa z nich montaż. Hasło produktu: „Turn Audio Into Cinema”.
Analizę multimodalną robią Gemini 1.5 Pro i GPT-4. Do wyboru jest ponad 14 modeli wideo, a renderingi idą na rozproszone GPU. Google Search Grounding pilnuje zgodności scen z realiami, platforma wykrywa też lipsync.
Wybór modelu zostaje przy użytkowniku, bo stylistyka obrazu to decyzja artystyczna. Ten sam utwór można złożyć w kilku konwencjach.
Oś czasu zamiast jednego przycisku
Kontrola scena po scenie: każde ujęcie można obejrzeć, podmienić albo wygenerować ponownie, także poleceniem do asystenta. Pierwszy render to materiał do obróbki.
Wyjście do zawodowego montażu
Eksport do 4K przy 24, 30 albo 60 klatkach na sekundę. Obok MP4 listy cięć EDL i XML dla Premiere Pro i DaVinci Resolve.
Plan „Self API” za 15 USD miesięcznie
Klient podaje własne klucze Gemini i Replicate i płaci dostawcom tylko za to, co wygeneruje. Abonament pokrywa samą platformę.
03Otwarty kod
Silnik montażowy jest otwarty
Analiza dźwięku i rozstawienie cięć działają też osobno, jako otwarty węzeł ComfyUI Vibe Music Engine. Repozytorium github.com/lazniak/videoclipgenerator jest publiczne od 12 lutego 2025 roku, na licencji Apache 2.0.
Węzeł przepuszcza ścieżkę przez modele Whisper od OpenAI i zwraca napisy z dokładnością do słowa, listę cięć EDL, detekcję uderzeń i estymację tempa. Można go uruchomić u siebie, bez naszej platformy.
Platforma dokłada generowanie obrazu, kolejkę GPU i interfejs. Obie wersje oddają listę cięć w tym samym formacie EDL.
04Historia
Od Vidgen.io do MovieshMash.to
Prace zaczęły się na początku 2023 roku. Prowadzą je Paul Lazniak i Grzegorz Łaźniak. Pierwsze prototypy stały na Deforum pod domeną Vidgen.io.
Rozbiły się o dwie przeszkody: migotanie obrazu między klatkami i płytkie rozumienie dźwięku. System rozpoznawał plik, ale nie to, co się w nim dzieje.
W 2024 roku przebudowaliśmy architekturę i na utworach lirycznych opracowaliśmy technikę i2v master shoot. Lata 2025–2026 to modele multimodalne Gemini i wersja produktowa, do 2026 roku pod nazwą Vidumidu.
To ten sam projekt co dzisiejszy MovieshMash.to. Zmieniała się nazwa i architektura, nie zamiar.
Materiały z realizacji
Masz materiał do zsynchronizowania z dźwiękiem?
Opisz, z czym pracujesz. Rozdzielimy to na część, którą platforma obsłuży od razu, i tę, którą wygodniej złożyć na miejscu z otwartego węzła.
Boka workshop med Paul
Trettio minuter eller en full workshop, välj själv. Boka tid direkt i kalendern, bekräftelsen kommer omedelbart.
