從腳本到成品:Pixelle-Video 背後的 AI 影像生成管線

目錄
共 9 個章節
從腳本到成品:Pixelle-Video 背後的 AI 影像生成管線
在短影音與自媒體的浪潮下,如何把一段文字腳本快速轉成畫面完整、聲音到位、可以直接發佈的影片,已經是內容創作者與企業行銷的日常課題。Pixelle-Video 是由阿里巴巴國際數字商業集團旗下的 AI 團隊 AIDC-AI 開源的全自動短影音引擎,工具建立在 ComfyUI 架構之上,採 Apache 2.0 授權。要注意的是,這個專案在 GitHub 上原本掛在 AIDC-AI 組織底下,該組織在 2026 年更名為 ATH-MaaS,舊網址會自動轉址,所以你在瀏覽器上看到 ATH-MaaS 是正常的。它的設計理念是模組化、自由組合、彈性部署,官方把整條管線拆成幾個環節:文案生成、AI 配圖與配影片、語音合成、背景音樂,最後一鍵合成影片。這篇文章逐一拆解每個環節的運作方式、支援的模型與工具,以及模組化設計如何讓使用者自由替換底層模型。
本文原刊於 2026 年 5 月,2026 年 9 月重新查核更新:修正專案歸屬、模型版本,並把各模組的實際運作方式對齊官方文件。

(1) 整體管線:腳本 → 圖像 → 語音 → 配樂 → 合成
Pixelle-Video 的管線遵循由上而下的訊息流:使用者只要提供一個主題或一份現成文案,系統便會自動完成以下步驟。
- 文案生成:呼叫你設定的 LLM,把一句主題展開成完整的分鏡腳本。
- 配圖與配影片:依腳本的場景描述產生對應的圖像或動態片段,來源可以是本地或雲端的 ComfyUI 工作流,也可以直連模型 API。
- 語音合成:把腳本文字轉成語音,官方工作流清單包含 Edge-TTS、IndexTTS 等,也可以自行放入 ComfyUI 的 TTS 工作流。
- 背景音樂:可選擇不插音樂、使用內建曲目,或把自備的音樂檔放進
bgm/資料夾。 - 影片合成:把畫面、語音與 BGM 依選定的模板合成,輸出 MP4。
官方文件把整條流程描述成「文案生成 → 配圖規劃 → 逐幀處理 → 影片合成」,每個環節都能換模型、換引擎、換視覺風格。實作上,各環節是透過 ComfyUI 工作流(workflows/selfhost 與 workflows/runninghub 兩套)或直連 API 串起來的,替換其中一段不會動到其他段,這就是它「模組化」在技術上的實際意思。
(2) LLM 腳本生成:支援 GPT、通義千問、DeepSeek 與 Ollama
腳本是整支影片的靈魂。官方的快速選擇預設包含通義千問、GPT、DeepSeek,另有完全離線的 Ollama,也可以手動填 Base URL 與模型名稱接自家服務:
- OpenAI GPT 系列:語言理解與創意寫作表現穩定。型號更迭要留意,GPT-4、GPT-4o、GPT-3.5 Turbo 這批舊型號已由 OpenAI 公告於 2026 年 10 月 23 日自 API 關閉,官方建議的接手型號是 GPT-5.6 系列(Sol、Terra、Luna),最新一代旗艦則是 2026 年 9 月發表的 GPT-6 Astra。
- 阿里巴巴通義千問(Qwen):針對中文語境最佳化,也是官方推薦的性價比選項,適合需要大量產出腳本的工作。
- 深度求索 DeepSeek:現行 API 型號為
deepseek-flash,對應 2026 年 9 月發布的 DeepSeek-V4.1-Flash,支援長文本與結構化敘事,V3 世代已屬舊版。 - Ollama(本地部署):完全離線的 LLM 服務,適合對資料隱私要求嚴格、不希望內容離開公司網域的企業情境。
實際操作上,使用者在設定頁填三欄就好:API Key、Base URL、模型名稱。系統會把 LLM 回傳的腳本整理成結構化格式,讓後續的配圖模組直接取用場景關鍵詞;官方在 2025 年 12 月的更新中優化了這段結構化資料的處理邏輯。
(3) AI 圖像生成:以 ComfyUI 為核心,本地或雲端皆可
圖像是影片的視覺主體,這個環節以 ComfyUI 為核心。ComfyUI 以節點式工作流聞名,可以自由拼接 Diffusion 模型、ControlNet、LoRA、VAE 等元件,形成高度自訂的生成管線;Pixelle-Video 的預設圖像工作流是 image_flux.json,走的是 FLUX 模型,官方同時支援 WAN 2.1 這類影片模型與 Nano Banana。畫面素材的來源有三種:
- 本地 ComfyUI(selfhost 工作流):在自己有 NVIDIA 顯卡的機器上跑,官方建議至少 6 GB 顯存,資料不外流、不產生 API 費用。要跑圖生影片或數位人這類較重的工作流,實務上建議 12 GB 以上。
- RunningHub 雲端工作流:把運算丟到雲端,官方支援到 48 GB 顯存的機器規格,適合沒有強力顯卡的筆電或桌機。
- 直連模型 API:不走 ComfyUI,直接呼叫供應商的圖像或影片模型。官方支援 OpenAI/GPT Image、DashScope/通義萬象、Volcengine ARK/Seedream/Seedance、Kling 等,這條路要在設定頁填入對應的金鑰,並可個別設定是否走本地代理。
圖像尺寸預設 1024×1024,可依需要調整;提示詞前綴(Prompt Prefix)用來控制整體風格,內容要用英文寫。要留意不同模型對尺寸與提示詞各有自己的限制,換工作流時先確認一次比較保險。
(4) 語音合成:Edge-TTS、IndexTTS 等多種引擎支援
聲音是影片的情感載體,Pixelle-Video 的語音合成同樣走工作流:系統會掃描 workflows/ 目錄下的 TTS 工作流讓你挑選,也可以自己放一份進去。官方點名的方案包括:
- Microsoft Edge-TTS:安裝最單純、支援多語言與多音色,但官方明確說明它不支援聲音克隆。
- IndexTTS:由嗶哩嗶哩(B 站)團隊開源的工業級零樣本語音合成系統,只要一段參考音訊就能克隆音色,最新版本 IndexTTS-2.5 支援中文、英文、日語、西班牙語與阿拉伯語,並具備細粒度的情感控制,是目前實務上最常搭配聲音克隆的工作流。
如果你需要專屬音色,官方有一套聲音克隆的流程:在語音設定裡上傳參考音訊(官方建議 10 至 30 秒、乾淨無背景噪音的 MP3/WAV/FLAC 檔),選一個支援聲音克隆的 TTS 工作流,先按「預覽語音」試聽,滿意再生成影片。官方也提醒,參考音訊的品質直接影響克隆效果;選擇 Edge-TTS 這條路的話,則完全不支援克隆。
(5) 背景音樂(BGM):內建曲目與自備檔案
Pixelle-Video 的 BGM 走的是簡單務實的路線,官方提供三種選擇:不插音樂、使用內建曲目(例如 default.mp3)、或把自備的音樂檔放進專案的 bgm/ 資料夾,再從介面上選取並試聽。音樂長度與影片時長的對齊、淡入淡出這些處理,交給合成階段的工作流負責,你不必自己拉時間軸。
這裡有一件容易被忽略的事:官方沒有提供授權曲庫,內建曲目與自備音樂的商用權利必須由使用者自行確認。要把影片用在商業用途時,建議改用有明確授權的來源,或選擇可商用授權的 AI 生成音樂,並保留授權證明,避免上架後被平台或權利人主張侵權。
(6) 數位人(Digital Human)與動作遷移(Motion Transfer)
這兩個模組是官方在 2026 年 1 月新增的擴充能力,也是 Pixelle-Video 從「配圖影片」跨到「有人物出演」的關鍵:
- 數位人口播(官方稱數字人口播,2026-01-14 新增):搭配多語言 TTS 音色,做出人物對著鏡頭說話的口播影片。上傳人物圖片與腳本,由工作流完成嘴型與表情的對齊。
- 圖生影片(官方稱圖生視頻,2026-01-14 新增):把靜態圖轉成動態片段,適合需要畫面動起來的場景。
- 動作遷移(2026-01-26 新增):上傳一段參考影片與一張圖片,讓圖片中的人物做出參考影片裡的動作。
要說清楚的是,這些模組都是以 ComfyUI 工作流的形式提供的擴充能力,實際使用的模型、推論速度與硬體需求,取決於你選的工作流與機器規格。官方並沒有公布各模組的內部模型架構或延遲數字,網路上流傳的規格數字建議直接以官方文件與自己實跑一次的結果為準。
(7) 模組化設計的好處:自由替換底層模型
模組化是 Pixelle-Video 的核心設計哲學,實際的好處有這幾項:
- 技術獨立性:每個環節有明確的輸入與輸出,換底層模型不會波及上下游。新的圖像模型出來,換一份工作流就能接上。
- 資源彈性:重的環節放本地 GPU 或雲端 RunningHub,輕的環節在一般機器上跑,成本可以按需求調配。
- 自訂與品牌化:腳本模板、視覺風格模板、提示詞前綴都能自己改,影片版面則可用 HTML 模板自訂(
templates/底下分靜態、圖片、影片三類)。 - 替換與降級:某個供應商或工作流失效時,換一份工作流就能繼續跑,不必整條管線重來。
- 快速迭代:要比較不同 LLM 的腳本品質,換設定頁的模型名稱就能實測,不需要改程式。
部署方式官方提供三條路:Windows 一鍵整合包(解壓後雙擊 start.bat,介面開在 http://localhost:8501)、從原始碼安裝(uv run streamlit run web/app.py,適合 macOS、Linux 與需要自訂的人),以及 repo 內附的 Dockerfile 與 docker-compose.yml(適合放進既有的容器環境)。三條路的 Web 介面一致,功能相同,先挑一條跑通再談客製。
結語:從創意到成品的完整閉環
Pixelle-Video 用一套模組化的管線,把「文字輸入到影片產出」的自動化流程組了起來:文案、配圖與配影片、語音、配樂、合成,每個環節都能替換;需要人物出演時,再掛上數位人口播與動作遷移。它不需要你懂剪輯,但把控制權留在你手上。
如果你想延伸理解這類自動化系統的設計思路,可以參考我們對 DeerFlow 2.0 架構全拆解的整理,而 深入解析 seomachine 架構則說明 AI Agent 如何在內容產線中自主決策與處理異常。這兩篇談的不是 Pixelle-Video 本身,而是同一類管線在調度與容錯上的取捨。
回頭看這篇最初寫下的展望名單,現在都已經落地:GPT-5.5 在 2026 年 4 月推出,LLaVA-OneVision-2 於同月開源,Google 的音樂生成模型 Lyria 3 在 2 月進入 Gemini,9 月再推出 Lyria 3.5;OpenAI 則在 2026 年 9 月發表新一代旗艦 GPT-6 Astra。模型迭代已經是常態,這也是這類開源管線的價值所在:底層模型換代時,你要換的是工作流,而不是整條產線。替代方案有限公司的角色是協助企業把這類工具接進既有的行銷與營運流程,需要討論情境歡迎找我們。







