Přejít k obsahu

2023–2026 · Teledyski AI

MovieshMash.to: montaż prowadzony ścieżką dźwiękową

Platforma czyta plik audio: tempo, nastrój i tekst utworu. Na tej podstawie generuje ujęcia i układa montaż z cięciami w rytm. Silnik montażowy udostępniliśmy jako otwarty węzeł ComfyUI na licencji Apache 2.0.

Technologie
Gemini 1.5 Pro, GPT-4, rendering GPU
Początek prac
2023
Eksport
4K, 24, 30 albo 60 kl./s, EDL i XML
Adresa
movieshmash.to

01Wyzwanie

Cięcie ma padać na uderzenie

Teledysk, zwiastun i krótka forma do mediów społecznościowych mają wspólną część pracy: obraz trzeba zsynchronizować z dźwiękiem. Ręcznie to odsłuch, znaczniki na osi czasu i dobór ujęć.

Przy każdym kolejnym utworze ta praca zaczyna się od początku, bo znaczniki z poprzedniego są nieaktualne.

02Rozwiązanie

Analiza utworu, ujęcia i montaż w rytm

MovieshMash.to przejmuje tę część. Po wgraniu pliku system wykrywa tempo (BPM), nastrój, tekst i budowę emocjonalną utworu, a potem generuje ujęcia i składa z nich montaż. Hasło produktu: „Turn Audio Into Cinema”.

Analizę multimodalną robią Gemini 1.5 Pro i GPT-4. Do wyboru jest ponad 14 modeli wideo, a renderingi idą na rozproszone GPU. Google Search Grounding pilnuje zgodności scen z realiami, platforma wykrywa też lipsync.

Wybór modelu zostaje przy użytkowniku, bo stylistyka obrazu to decyzja artystyczna. Ten sam utwór można złożyć w kilku konwencjach.

  • Oś czasu zamiast jednego przycisku

    Kontrola scena po scenie: każde ujęcie można obejrzeć, podmienić albo wygenerować ponownie, także poleceniem do asystenta. Pierwszy render to materiał do obróbki.

  • Wyjście do zawodowego montażu

    Eksport do 4K przy 24, 30 albo 60 klatkach na sekundę. Obok MP4 listy cięć EDL i XML dla Premiere Pro i DaVinci Resolve.

  • Plan „Self API” za 15 USD miesięcznie

    Klient podaje własne klucze Gemini i Replicate i płaci dostawcom tylko za to, co wygeneruje. Abonament pokrywa samą platformę.

03Otwarty kod

Silnik montażowy jest otwarty

Analiza dźwięku i rozstawienie cięć działają też osobno, jako otwarty węzeł ComfyUI Vibe Music Engine. Repozytorium github.com/lazniak/videoclipgenerator jest publiczne od 12 lutego 2025 roku, na licencji Apache 2.0.

Węzeł przepuszcza ścieżkę przez modele Whisper od OpenAI i zwraca napisy z dokładnością do słowa, listę cięć EDL, detekcję uderzeń i estymację tempa. Można go uruchomić u siebie, bez naszej platformy.

Platforma dokłada generowanie obrazu, kolejkę GPU i interfejs. Obie wersje oddają listę cięć w tym samym formacie EDL.

04Historia

Od Vidgen.io do MovieshMash.to

Prace zaczęły się na początku 2023 roku. Prowadzą je Paul Lazniak i Grzegorz Łaźniak. Pierwsze prototypy stały na Deforum pod domeną Vidgen.io.

Rozbiły się o dwie przeszkody: migotanie obrazu między klatkami i płytkie rozumienie dźwięku. System rozpoznawał plik, ale nie to, co się w nim dzieje.

W 2024 roku przebudowaliśmy architekturę i na utworach lirycznych opracowaliśmy technikę i2v master shoot. Lata 2025–2026 to modele multimodalne Gemini i wersja produktowa, do 2026 roku pod nazwą Vidumidu.

To ten sam projekt co dzisiejszy MovieshMash.to. Zmieniała się nazwa i architektura, nie zamiar.

Materiały z realizacji

Masz materiał do zsynchronizowania z dźwiękiem?

Opisz, z czym pracujesz. Rozdzielimy to na część, którą platforma obsłuży od razu, i tę, którą wygodniej złożyć na miejscu z otwartego węzła.

Domluvit workshop s Paulem

Třicet minut nebo celý workshop, volba je na vás. Termín rezervujete v kalendáři, potvrzení přijde okamžitě.