← 全部內容

設計師的逆襲!

只要一張底圖加 Prompt 描述希望使用者怎麼跟圖片互動,即可製作網站跟應用程式,完全不需要一行程式碼,連叫 AI 寫都不需要。

全球 AI 影片生成領域領頭羊之一的 Runway(常稱 RunwayML)新創公司發布全新模型 Solaris,目標全面改變以視覺為導向的應用程式的開發方式。

直接看範例影片,應用程式接受使用者上傳的照片,將其處理後放到畫面中間,使用者經過拖曳左側商品到自己身上,馬上展現穿上該商品的樣子。這不就是一個紙娃娃系統嗎?如果你也這樣想,那你對了一半,它的確是一個紙娃抓系統,但是這個系統的底層完全不靠程式碼渲染,取而代之的是一個可以互動的串流影片,Runway 稱此技術之介面世界模型(Interface World Models)。

由於 Solaris 尚未開放大眾使用(目前僅可透過網站申請,網址我放在連結),因此以下為我推測使用 Solaris 時的開發範例影片中應用程式的方式:

  1. 上傳一張背景圖,也就是影片中左邊有商品、人站在中間,右邊有紙娃娃穿戴商品清單與購物車的圖片。此圖片是第一影格,作為整個體驗的視覺錨點,確保生成內容不脫離現實。
  2. 用自然語言撰寫應用程式 Prompt 說明這個場景的運作機制,像是將衣服拖拽至人物身上可進行試穿、試穿中的衣服需要顯示於右側穿戴商品清單等。
  3. 用自然語言撰寫系統 Prompt,說明需要應用程式需要先開啟相機,並且接收使用者的照片作為圖片中的人物(這一段我認為還是會需要傳統方式才能實現,但理論上製作者應該不用看到一行程式碼才對)。

接下來使用者開啟應用程式上傳照片後,在畫面上的點擊座標、拖曳軌跡等滑鼠行為會被擷取,由 LLM 解讀為繪圖提示詞,再讓 Solaris 即時繪製出下一個影格。

總結來說用 Solaris 製作出來的應用程式推測是一個「即時生成的互動式影片串流」,它依照使用者的輸入,以極快速度連續生成下一個影格,讓畫面看起來像是流暢回應使用者的操作,達成應用程式的效果。

聰明的讀者可能已經發現這個產品有一個巨大的問題,用 Solaris 製作的應用程式運行成本會比用傳統方式製作的高出數萬甚至數百萬倍,因為其本質上是透過 AI 即時運算產生下一個應用程式的畫面。所以這套模型比較適合拿來開發具備極高商業回報的應用(例如高單價客製化電商、互動模擬教學等)。

最後,說真的這個技術完全顛覆我身為工程師的想像,真的很想馬上拿到手玩玩看啊。

以上關於技術運用的猜想若有錯誤,懇請高手指正分享 🙏