
一張海報給 AI,5 張會動的 IG 輪播:AI 輪播實測紀錄
我丟了一張 735×1040 的舊海報給 Claude Code,它做出 5 張 1080×1350 的動態輪播 MP4,最後還在自己的電腦生成音樂、讓動畫對齊節拍。這篇把整個過程拆開:提示詞怎麼寫、實際做了哪幾步、哪裡踩坑,文中附兩段可以直接複製的提示詞。
欸跟你說個反直覺的。
你花很久修的那張靜態海報, 在一直往下滑的動態消息裡,很容易就被滑過去。
不是你做得不好, 是靜態圖在滑動的畫面裡,天生比較吃虧。
那就讓它動。
但你可能跟我一樣,不會做動態圖形。不會 After Effects,也不想為了一張圖學三個月。
所以這次我做了一個實驗:丟一張海報給 Claude Code,看它能不能自己做出 IG 動態輪播。
先講結果。
輸入: 一張 735×1040 的舊海報(Audrey Hepburn 的 Vogue 風格海報)。 輸出: 5 支 1080×1350 的 MP4,30fps,還附 5 張定格 PNG。第一版是無聲、每支 5.6 秒;後來我又加上音樂、讓動畫對齊節拍,重排成每支 4.8 秒(做法在文末)。
下面是完整紀錄:提示詞怎麼寫、它實際做了什麼、哪裡翻車、你要怎麼複製。
這個案例做出了什麼
輪播一共 5 張,各有一個「動作」:
| 張 | 內容 | 動態 |
|---|---|---|
| 1 | 封面,還原原海報 | 照片慢慢拉近,VOGUE 五個字母依序落下,名字和引言逐行升起 |
| 2 | 眼睛特寫(拱形窗) | 拱窗展開、鏡頭推近 |
| 3 | 耳環到項鍊 | 鏡頭從耳環橫移到項鍊 |
| 4 | 文字動畫 | 「IMPOSSIBLE」掉進一個撇號,空隙打開,變成粉紅色的「I'M POSSIBLE」 |
| 5 | 結尾「Stay possible.」 | 粉紅雙色調肖像 + 行動呼籲 |
成品:5 支實際輸出的影片
下面是加上音樂、節奏對拍之後的最終版,每支 4.8 秒,點開播放時記得開聲音。網頁上放的是壓縮版(每支約 0.3~0.7MB),原始輸出每支約 10~16MB。
注意一件事:我給它的只有一張圖,加上「IG」兩個字。
其他全是它自己判斷的:IG 輪播要用 4:5 的 1080×1350、要拆成幾張、每張負責什麼。
但這不代表你可以只丟一張圖就走。我後面會講,「它自己判斷」的部分,有些做得很好,有些要你補一句才會更準。
先搞懂:Claude Code 為什麼做得到
很多人以為「做動態圖」要用剪輯軟體。
Claude Code 走的是另一條路:把動畫當成程式來寫。
它做的事情是這樣:
- 用網頁(HTML + CSS)把每一張輪播「排」出來
- 所有動畫都綁在一個時間變數上
- 用無頭瀏覽器,一格一格截圖
- 用 ffmpeg 把截圖合成 MP4
這個做法有個很大的好處:每一格畫面都是算出來的,不是錄出來的。
所以不會卡頓、不會掉幀,同一份程式每次輸出都一樣。想改字、改顏色、改順序,改一行再輸出一次就好。
你的電腦要有的東西(這次實際用到的):
- Claude Code(桌面版或終端機都行)
- Google Chrome(拿來截圖)
- ffmpeg(拿來合成影片)
- Node.js 和 Python(Claude Code 會自己叫用,缺套件它會自己裝)
實際做了哪四步
這是這次 Claude Code 真正跑過的流程。
步驟 1:先「看」圖,不是直接動手
我給的路徑是桌面上的一個 JPG。
它第一件事是把圖讀進來,辨認出海報的結構:人像、直排的 VOGUE 刊頭、右下角的名字和一句引言、粉紅色的主色。
然後它確認了兩件事:
- 圖只有 735×1040,要放大成 1080 寬,會偏軟
- 海報上的字是直接印在照片上的,要讓文字動起來,就得先把它們拿掉
第二點是整個案例最關鍵的地方。
步驟 2:把圖上的字抹掉,做出「乾淨底圖」
要讓 VOGUE 一個字母一個字母落下,原圖上的 VOGUE 就必須先消失。
它的做法:
- 這張照片本來是黑白的,所以任何有顏色的像素,就是粉紅色的字
- 只在文字所在的區域,把「有顏色的像素」標成遮罩,往外多擴 5 個像素吃掉邊緣
- 用影像修補(inpainting)把遮罩填回去
- 修補完的區域再轉成灰階,避免留下粉紅色的暈
第一次的結果不夠乾淨,VOGUE 的邊緣還留著粉紅殘影。它改成「用色彩飽和度判斷」並放大遮罩範圍,第二次就乾淨了。
我自己的看法是:這一步是整個流程裡最容易被忽略的。 如果直接把整張圖丟進去縮放,文字會跟著照片一起晃,沒辦法單獨做動畫。
接著它把乾淨底圖放大到 2160 寬,再做一次銳化,給後面的特寫鏡頭用。
步驟 3:用「一個時間變數」排動畫
這是它的核心設計:整份網頁只有一個時間值 t(秒)。
- 文字升起、淡入、落下,都是 CSS 動畫,延遲時間用
t算出來 - 鏡頭的推近、橫移,用 JS 在每一格算出位置
- 第 4 張的「IMPOSSIBLE 變 I'M POSSIBLE」,也是依
t逐格調整撇號和空隙的寬度
為什麼要這樣設計?
因為你可以隨時跳到任何一秒。想看 t=1.9 秒那一格長什麼樣?直接跳過去截一張圖。
這也是後面能「先看定格、再輸出影片」的原因。
步驟 4:先看定格,確認了才輸出影片
這步我很堅持,也建議你一定要加進提示詞。
它先把 5 張的最後一格各截一張圖,拼成一排給我看。
這一輪就抓到兩個問題:
- 第 2 張有一個圓圈跑到額頭上,位置不對 → 直接移除
- 第 4 張文字偏上、下半部很空 → 把整組字往下移並縮小
改完,它才開始輸出。
輸出時每張 5.6 秒、每秒 30 格,每張 168 格,5 張共 840 格,逐格截圖後,用 ffmpeg 合成 H.264 的 MP4。
每支 MP4 大小約 12~19MB,IG 可以直接上傳。
這個案例的最佳提示詞(直接複製)
我整理了一份,是把這次實際做對的事情濃縮成的。
把方括號裡的東西換成你自己的:
我要把這張圖做成 IG 動態輪播。
圖片路徑:[你的圖片絕對路徑]
【輸出規格】
- 5 張,每張 1080×1350(IG 4:5)
- 每張輸出 MP4(30fps、約 5~6 秒、H.264、yuv420p、可直接上傳 IG)
- 另外每張輸出一張最後一格的 PNG
- 全部放在 [你要的資料夾]/output,不要覆蓋其他檔案
【風格】
- 沿用原圖的配色與字體氣質,不要自己換風格
- 主色:[例如粉紅 #b05d86];字體:[例如 Playfair Display 粗斜體]
- 每張只做一個明確的動作,不要全部都在動
【每張內容】
1. 封面:[做什麼動作]
2. [第二張內容與動作]
3. [第三張內容與動作]
4. [第四張:文字動畫]
5. 結尾:[行動呼籲,帳號我先用 @yourhandle 佔位]
【做法要求】
- 如果原圖的文字是印在照片上,先把它抹掉、做出乾淨底圖,再用程式重做文字動畫
- 所有動畫都綁在單一時間變數上,要能跳到任意秒數輸出單格
- 圖片太小要放大時,先告訴我畫質會受什麼影響,不要假裝沒問題
【流程】
- 先只輸出 5 張「最後一格」的定格圖拼成一排給我看,等我說可以才輸出影片
- 輸出完告訴我:檔案在哪、每個檔案大小、哪些地方是你不確定的
- 不確定的地方(版權、字體、畫質)要直接講,不要藏起來這份提示詞裡,我最在意的是這三個地方:
1. 「先看定格,等我說可以才輸出影片」 影片輸出要花好幾分鐘。方向錯了才發現,等於白跑。
2. 「只做一個明確的動作」 我的經驗是,每一張都塞滿特效,反而沒有重點。一張一個動作,眼睛才知道看哪。
3. 「不確定的地方直接講」 這次案例它就主動講了兩件事:圖太小特寫會偏軟,以及 VOGUE 是商標。如果你沒有要求,它不一定會講。
這次踩到的坑
我不想只講順的部分。
坑 1:原圖太小,特寫一定會軟。 735×1040 放大到 1080 寬還行,但眼睛和耳環的特寫要放大到 2 倍以上,邊緣就糊。它用「放大+銳化+加顆粒感」去遮,但這是遮,不是變清楚。想要清楚,請從一開始就用高解析度的原圖。
坑 2:抹字不是 100% 乾淨。 黑洋裝的區域是修補最不穩的地方,右下角留了一點模糊的殘痕。它在封面和第 5 張的底部看得到。這種殘痕,你得自己用眼睛看,AI 不一定會主動說。
坑 3:這是 Vogue 的商標,照片也有版權。 這次是練習,所以保留了原海報的刊頭。但公開發 IG 的話,有被檢舉下架的風險。要發的話,把刊頭換成你自己的品牌名,圖也換成你有授權的。
坑 4:我沒有實際上傳到 IG 測試。 我確認的是檔案規格(1080×1350、H.264、30fps),也看過定格圖。但「IG 會不會壓縮到畫質變差」,我這次沒有驗證。
怎麼換成你自己的圖
三個步驟:
- 選一張你自己的圖。 至少 1080 寬,越大越好。有人像、有一句話、有明確的主色,最容易做。
- 把上面的提示詞貼進 Claude Code,改掉方括號裡的內容。
- 看定格圖,說哪裡要改。 一次只改一兩個地方,例如「第 3 張的鏡頭停在項鍊太久」「第 4 張字再大一點」。
改的次數通常不會多,因為所有東西都是程式算出來的,改一個數字就好。
這招為什麼對你的自媒體有用
回到我一開始講的。
靜態圖會被滑過去,你能做的是:讓每一次發文,都有更多停下來的理由。
但還有一個更重要的點:
這次做出來的,不只是 5 支影片。 是一份可以重複用的「動態輪播模板」。
下次換一張圖、換一句話,同一套程式再跑一次,又是一組新的。
這就是我在 aimedia 一直在講的事: 不是每次從零開始做,而是把做法存下來,讓它會自己長大。
Gift Hook:加上音樂,而且動畫貼著拍子走
無聲的輪播已經能發了。但加上音樂,停留的理由又多一個。
重點不是「貼一首歌上去」,而是讓畫面的動作踩在拍點上。字母落下、鏡頭切換,剛好都落在鼓點,看起來才像剪過的。
我是這樣做的,而且全程不用訂閱任何音樂服務。
音樂從哪來:ACE-Step,在自己的電腦生成
ACE-Step 1.5 是開源的 AI 作曲模型,可以在本機跑,輸入文字描述就生成整首歌。它支援 Apple Silicon 的 Mac。
我的環境是 M4 Pro、24GB 記憶體。安裝是這三步,我請 Claude Code 全部代勞:
brew install uv
git clone https://github.com/ACE-Step/ACE-Step-1.5.git
cd ACE-Step-1.5 && uv sync第一次生成會自動下載模型。含環境,專案資料夾共約 11GB(模型 9.4GB、環境 1.2GB,另外安裝時的快取還會多佔約 2GB,可以事後清掉),第一首從開始到生成完成花了大約 17 分鐘,其中下載模型約 10 分鐘,之後再生成就快多了。裝之前先看一下你的硬碟空間。
第一個坑:爵士版的拍子會飄
我第一次生成的是 1960 年代爵士風,想配這張復古海報。
但程式分析它的節拍,發現速度不固定,拍點時快時慢。人類爵士樂手的律動很迷人,卻沒辦法讓動畫精準踩拍。
解法:一次生成 3 首,用程式挑拍子最穩的
我改成節拍明確的電子風格(極簡 deep house、四拍強節奏),指定 100 BPM,一次生成 3 首,再用程式比對每首的拍點是否規律:
| 候選 | 實測速度 | 拍點誤差 |
|---|---|---|
| 第 1 首 | 100.00 BPM | 約 2 毫秒 |
| 第 2 首 | 100.78 BPM | 約 27 毫秒 |
| 第 3 首 | 100.00 BPM | 約 15 毫秒 |
第 1 首幾乎是一條直線,就選它。
這一步的概念是:你不用聽三首再憑感覺選,先讓程式把不合格的篩掉,你的耳朵留給最後一關。
怎麼對拍
- 每張固定 8 拍。100 BPM 的一拍是 0.6 秒,一張就是 4.8 秒,5 張剛好 24 秒,音樂從頭到尾連續,滑到下一張時接得上。
- 所有動畫事件改成「第幾拍」。例如 VOGUE 的五個字母落在第 0、0.5、1、1.5、2 拍;第 4 張的撇號在第 4 拍落地,同一拍「IMPOSSIBLE」分開、變成粉紅色。
- 每個拍點讓畫面輕微脈動,偶數拍稍強。
- 用 ffmpeg 把音樂切成 5 段,每一段都從拍點開始,混進對應的影片,結尾淡出 1.5 秒。
做完我用程式檢查:把影片裡的聲音抽出來,比對動畫關鍵時刻和音訊節拍的差距,大約是 8 到 14 毫秒,小於一格畫面(33 毫秒)。
要老實講:這個檢查不嚴格,因為這首歌的節拍點很密,最近的鼓點本來就不會太遠。音樂好不好聽、踩得順不順,最後還是要你用耳朵和眼睛確認。
提示詞 1:把無聲輪播加上音樂並對拍(直接複製)
我已經有 5 張無聲的動態輪播(用網頁動畫做的,所有動畫由單一時間變數驅動)。
請幫我加上音樂,並讓動畫對齊節拍。
【音樂】
- 用本機的 ACE-Step 1.5 生成純演奏背景音樂(還沒安裝的話,先告訴我會下載多大、佔多少硬碟,我同意再裝)
- 風格:[例如 極簡 deep house、四拍強節奏、溫暖和弦,適合時尚編輯風]
- 速度:[例如 100 BPM];長度:比 5 張總長多 8 秒以上
- 一次生成 3 首。用程式分析每首的節拍穩定度,挑誤差最小的,並把分析數字給我看
【對拍】
- 每張長度設成整數拍(例如 8 拍),5 張接起來音樂要連續
- 所有動畫事件(文字進場、轉場、關鍵動作)改成用「第幾拍」計時
- 重要動作對在重拍上,每個拍點讓畫面輕微脈動
【輸出】
- 另存新資料夾,不要覆蓋無聲版
- 輸出後用程式比對「音訊節拍」和「動畫事件」的時間差,回報數字,並說明這個檢查的限制
- 我還沒聽過成品,不要說「聽起來很棒」這類你沒辦法驗證的話提示詞 2:生成音樂時的描述(給 ACE-Step)
風格:chic minimal deep house, steady four-on-the-floor kick drum, crisp hi-hats,
warm Rhodes chords, elegant fashion runway mood, tight quantized electronic groove
歌詞:[Instrumental]
速度:100 BPM
長度:32 秒幾個小技巧:
- 歌詞欄寫 `[Instrumental]`,才會是純演奏,不會冒出人聲。
- 想要踩拍準,描述裡要寫 tight、quantized、steady kick,也就是用節奏明確的風格。
- 一次多生成幾首,讓程式幫你篩。
常見問題
Q1:我完全不會寫程式,可以做嗎? 可以。這次整個過程,我只做了三件事:給圖、看定格圖、說哪裡要改。程式是 Claude Code 寫的。但你要會看畫面、說清楚哪裡不對,這部分 AI 替你做不了。
Q2:一定要用 Claude Code 嗎? 這次的做法需要 AI 能「讀圖、寫程式、在你的電腦上執行、讀回結果」。Claude Code 剛好可以。只會聊天、不能在你電腦上跑程式的工具,做不出這種逐格輸出的流程。
Q3:輸出的 MP4 可以直接上傳 IG 嗎? 規格上可以:1080×1350、H.264、yuv420p、30fps。但我這次沒有實際上傳,所以 IG 壓縮後的畫質我不能保證。上傳前建議先用私人帳號或限時動態測一次。
Q4:我可以直接用別人的海報做嗎? 不建議公開發。這次案例的海報含有商標和有版權的照片,所以只能當練習。公開用之前,請換成你自己的圖和品牌名。
Q5:想要更清楚的特寫,怎麼辦? 用更高解析度的原圖。這次的限制就出在原圖只有 735×1040。放大和銳化只能降低「看起來糊」的程度,沒辦法補回沒有的細節。
Q6:本機生成的音樂可以商用嗎? ACE-Step 的程式碼是 MIT 授權,允許商用。但專案自己也提醒:要確認生成作品的原創性、標明有 AI 參與,改編受保護的風格要先取得授權。MIT 只管程式碼,生成的歌會不會碰到別人的版權,仍然要你自己判斷。
Q7:我的電腦跑得動 ACE-Step 嗎? 官方說明支援 Windows、Linux(需要顯卡),以及 Apple Silicon 的 Mac。顯存或記憶體越大,能用的模型越大;6GB 以下只能跑精簡版。我是在 M4 Pro、24GB 的 Mac 上跑,其他機型我沒有測。

