文字、圖片與影片參考
先看你手上的輸入素材:Seedance 2.5、Seedance 3.0、Gemini Omni、SeeVid 與 Alav AI 都能從文字搭配圖片或影片參考生成內容;Seedance 2.5 也接受音訊。若要把既有歌曲做成場景內整合歌詞的影片,Freebeat AI 的用途更直接。這類工具的重點是合成新畫面,不是把影片轉成文字,也不是只替現成素材剪接、重製或燒錄字幕。
384 個工具 · 2026年10月6日 更新
把文字腳本、提示詞、圖片或片段交給生成工具,做出短片、分鏡場景、歌詞影片或社群內容;你可在這裡依參考素材、聲音、畫質、片長與發布方式,挑選適合的文字轉影片工作流程。
先看你手上的輸入素材:Seedance 2.5、Seedance 3.0、Gemini Omni、SeeVid 與 Alav AI 都能從文字搭配圖片或影片參考生成內容;Seedance 2.5 也接受音訊。若要把既有歌曲做成場景內整合歌詞的影片,Freebeat AI 的用途更直接。這類工具的重點是合成新畫面,不是把影片轉成文字,也不是只替現成素材剪接、重製或燒錄字幕。
片長與畫質會直接影響選擇。Seedance 3.0 可生成最長 30 秒的場景,且清單中同時標示 4K 輸出;Seedance 2.5 與 Any Video Converter AI Video Generator 則標示最高 1080p,Rennoise AI 提供 4K 增強。需要多段內容時,應確認工具是產生單一短片、可延伸場景,還是能組成多鏡頭作品,並預留分段生成與後續整理的步驟。
若作品需要完整聲音,請比較音訊能力而非只看畫面。Seedance 3.0 能加入同步人聲、環境音與音效,Seedance 2.5 支援聲音與場景延伸;Freebeat AI 會保留原始配樂,並把歌詞字樣整合進畫面。一般字幕、旁白或音畫同步的需求,仍要確認頁面標示的實際輸出方式;不要把「有文字」誤認成每款工具都會自動產生字幕或配音。
需要角色、產品或視覺風格前後一致時,可優先查看參考控制與場景編排。Seedance 2.5 提供參考控制與場景延伸,SeeVid 支援多鏡頭場景,Gemini Omni 可用文字、圖片或片段建立一致的影片,再以對話方式修改場景。Rennoise AI 則把產品視覺、影片、音訊與鏡頭規劃放在行銷製作情境中。這些功能適合分鏡、產品展示與系列內容,但仍應先用短片測試人物、物件和鏡頭是否符合腳本。
若目標是 TikTok、Reels 或 Shorts,可看工作流程是否涵蓋腳本到發布:FacelessReels App 能從主題、腳本、提示詞或圖片製作不露臉短片,並準備、下載、發布或排程內容;AIReel 提供 20 多個模型與 1,000 多個範本;Loova AI、Alav AI 則把生成與編輯放在瀏覽器工作區。選型時還要逐一確認價格方案、配額、API、商用輸出與下載格式;目前清單只明確標出 AIReel 為 Free、SeeVid 有商用輸出,不能自行推定其他產品的方案。
利用文字、照片、參考素材和病毒式模板建立可直接分享的影片,並可調整格式、時長、解析度和音訊。
從文字和圖片創作具有自然動態、逼真互動和富有表現力攝影的電影感影片。
以文字或圖片建立5~30秒影片,支援選用結束影格、聲音、可調整解析度、預覽與下載。
從腳本建立配有旁白的卡通影片,鎖定角色外觀,支援多種風格、商業使用權,以及直式或橫式格式。
從文字、圖片、音訊或影片建立影片,然後透過對話調整場景、角色、攝影機運動和聲音。
從文字、圖片、參考素材與關鍵幀創作電影感廣告和故事影片,同時保持角色與產品的辨識度。
從文字或參考圖片生成電影感影片,支援由提示詞導向的攝影機運動、一致的場景與原生音訊。
透過描述動作、鏡頭運動和氛圍,讓靜態照片栩栩如生,為創意專案製作短影片。
在同一個瀏覽器工作區中,從文字或參考圖片建立 3–30 秒影片,並選擇長寬比、解析度與模型。
從文字提示或靜態圖片建立 1080p 影片,支援多鏡頭敘事,以及可選的時長和畫面比例。
透過文字、圖片、片段與音訊生成影片,並具備同步聲音、多鏡頭場景與目標編輯。
透過參考控制、場景延展、音效,以及最高 1080p 輸出,從文字、圖片、片段與音訊建立電影感影片。
從文字與多模態參考建立最長 30 秒的影片,並同步聲音、環境音與音效。
將現有歌曲轉換成一部歌詞電影,將文字融入場景,可選擇參考人物,並保留原始配樂。
為活動建立一致的產品視覺、影片與音訊,並提供 4K 增強與引導式分鏡規劃。
從文字或圖片生成 1080p 影片,具備自然動作、多種視覺風格,且片段可在幾分鐘內完成。
在單一瀏覽器工作空間中,透過文字、圖片或影片建立與編輯影片、圖片、廣告與會說話的照片。
從文字或參考圖片創建影片和圖片,具備動態、聲音、多鏡頭場景以及可商業使用的輸出。
免費 AI 圖片與影片創作工具,擁有 20+ 種模型、智慧路由、提示詞輔助、AI 影片與圖片工具,以及 1,000+ 個模板。
透過文字、圖片、影片和音訊參考生成電影感影片,單一場景最長 30 秒,並支援 4K 輸出。
從文字、圖片或片段建立一致的影片,然後透過對話式編輯精修場景,無需重新開始。
從主題、腳本、提示或圖片建立短影音,然後準備、下載、發佈或排程無臉社群內容。
從提示詞、圖片或參考資料建立影片,然後在同一個工作區中編輯場景、生成圖片並調整輸出設定。
使用文字提示、可選模型,以及為社群、廣告和產品頁量身打造的匯出尺寸,將照片動畫化為 HD 影片片段。
直接在瀏覽器中將文字、圖片與文件轉換為可分享、具旁白的影片,並可調整畫面比例。
從文字、圖片或參考片段製作最高 2K 影片,並具備原生立體聲音訊與最長 15 秒的時長。
在同一個工作區中創作影片、圖片、旁白與音樂,並提供預先的信用點數報價與失敗生成的自動退款。
透過文字、圖片與參考,結合同步音訊、3D 預覽與區域層級重繪編輯,建立完整的 30 秒影片。
從文字與圖片建立 HD 影片,同時掌控動作、比較模型輸出,並直接在瀏覽器中編輯素材。
從文字提示、圖片、參考視覺或起訖影格創建影片,然後自訂風格、時長與品質。
從文字提示或圖片快速生成短影片,並支援起訖影格控制與最高 1080p 下載。
透過結合音軌、提示詞、風格、角色參考與生成的視覺效果,將你的音樂轉換成節拍同步影片。
建立可排程的無臉影片集,具備腳本、旁白、插畫視覺、字幕、音樂,以及跨社群管道的自動發佈。
透過文字或圖片建立可商業使用的圖片與影片,並提供編輯、去除浮水印與每月免費點數。
結合最多九張圖片、三段影片、音訊與文字,透過精準素材參考建立 4–15 秒影片。
從圖片與提示詞建立短影片,可調整時長、流暢度、鏡頭移動、風格與解析度設定。
從提示詞與最多 9 張參考圖片生成 720p 或 1080p 影片,並附同步音訊與 webhook 傳送。
透過一個 REST API,從提示詞、圖片或現有片段建立最長 20 秒、含同步音訊的 1080p 影片。
透過一個 API,根據提示詞與參考媒體生成具同步立體聲音訊的原生 2K 影片片段。
透過單一 API,從文字、圖片、影片與音訊生成最長 15 秒的原生 4K 影片,並附同步聲音。
透過一個 REST API,利用同步音訊與最多 50 個多模態參考,生成最長 30 秒的電影感影片片段。
從文字提示或照片創建短影片,然後直接在瀏覽器中下載、保存並重複使用剪輯。
從一個主題建立可直接發布的無臉短影片,包含腳本、配音、字幕、視覺素材、音樂與剪輯。
在引導運動、鏡頭方向、參考與場景連貫性的同時,從提示詞或圖片創作影片。
透過文字提示、參考圖片與聲音範本建立舒緩的 ASMR 影片,適用於睡眠、健康、產品與社群內容。
從提示或圖片建立原生 2K、4–15 秒的影片,並配有同步立體聲音效與六種長寬比。
結合文字、圖片、影片和音訊,並同步立體聲音效,創作最長 15 秒、連貫一致的原生 2K 影片。
從提示詞和最多 50 個多模態參考素材生成 30 秒 AI 影片片段,然後微調局部細節。
將提示詞、圖片和參考片段轉換為具有電影感且一致的影片,具備導演式攝影機運動與失敗渲染自動退款功能。