EPISODE · Aug 26, 2026 · 4 MIN
Skild AI 發布 S1,單一示範影片即可免微調完成陌生長時程機器人任務
from EasyVibeCoding Podcast · host Skild AI
Skild AI 發布 S1,單一示範影片即可免微調完成陌生長時程機器人任務。 核心主張 Skild AI 將 S1 定位為新一代 robotics foundation model,讓機器人像語言模型學習一樣,從一段 video prompt 理解任務,直接輸出動作完成操作。這些任務可以完全不在預訓練資料中,也不必改動模型權重;S1 能在不同環境與機器人形態上執行。Skild AI 表示,S1 已能組合預訓練時學會的 skills,或在現場建立新的 skills,完成煮咖啡、移植盆栽、煎鬆餅與組裝套件等任務。 以紙本學術論文開場並帶出 in-context learning 概念與其後模型演進曲線、接著透過多角度視角展示以影片 prompt 讓機器人執行植物盆栽操作的影片 陌生任務與長時程操作 S1 的重點不只是模仿短動作,而是處理從未看過、且需要連續數十個操作步驟的 long-horizon tasks。影片展示了雙臂機器人自主執行煎鬆餅、手沖咖啡與盆栽移植;其中植物移植的實驗從晚上 8:54 開始準備,從示範到自主執行只花 11 分鐘。Skild AI 特別指出,團隊曾以完整預訓練資料搜尋,確認資料中沒有翻鬆餅的例子,因此 S1 翻鬆餅的能力被視為從單一 video prompt 推論出的 out-of-distribution 行為。 雙臂機器人操作平底鍋煎鬆餅、手沖咖啡與盆栽移植等長時間任務的實時畫面 不是逐格重播 Skild AI 表示,S1 不會盲目重現示範影片,而是展現超越示範內容的常識與調整能力: 面對物件位置、物件種類或光線改變,仍可能完成任務。 操作失誤時會重試並修正,即使示範者沒有示範恢復流程。 示範者提早把蛋打落時,S1 可能改用更受控的動作。 示範用澆水壺替植物澆水、現場卻只有水杯時,S1 會改用水杯;玻璃杯已接近裝滿果汁時,也只會補到足量。 一名男士站在擺放著盆栽、花盆與澆水工具的工作桌前,右手拿著噴瓶工作,背景為室內工作環境並可見機械手臂裝置。 與傳統 VLA 的差異 Skild AI 將 S1 與 conventional language-prompted VLAs 比較:已知任務上,S1 可達到相近表現;陌生任務上,隨預訓練規模增加,Skild AI 稱 S1 的表現呈指數級優於現有 VLA。貼文另稱,若要讓目前的 VLA 達到 S1 只靠一個示範就能達到的準確度,可能需要先收集 50–100 小時資料,再進行 fine-tuning。 S1 的單一示範影片、無後訓練條件,與現有 VLA 模型後訓練資料需求的對比折線圖 研究結果與限制脈絡 技術文章中的受控研究使用相同資料、運算資源與架構(prompt embedding 除外),將資料規模從 1,000 小時擴大至 100,000 小時。在已知任務上,1,000 小時資料時,語言條件模型成功率為 53%,ICL 模型為 43%;在 100,000 小時的陌生任務測試中,兩者分別為 9% 與 66%;評估 rollout 發生失敗時會由人工介入恢復,以確保所有步驟都能被評分。Skild AI 也承認,低品質或含雜訊的資料可能造成傷害,資料品質控管支出約為資料蒐集支出的三倍。這篇文章是系列首篇,後續文章才會深入說明 S1 的訓練方式。 比較 Known Tasks 與 Unknown Tasks 的評估圖表與 pre-training 規模對成功率的影響 部署計畫 Skild AI 表示,S1 已於 2026 年 8 月 26 日開始與少數 industrial partners 部署,未來幾個月會逐步擴大至更多客戶。公司也提到,去年推出的 Locoformer 已展示機器人在 mobility 任務中透過 in-context learning 適應斷腿、車輪鎖死等干擾;S1 則把這項能力擴展到 general manipulation。Skild AI 將 S1 視為通往「以實體世界為基礎的通用智慧」的新方向,但目前公開內容主要聚焦能力展示與 ICL 分析,完整訓練細節仍待後續說明。技術文章:Introducing S1: In-Context Learning for Robotics S1 機器人模型的展示畫面與效能評估折線圖 以單一示範影片教導機器人使用鍋鏟翻煎餅的影片畫面 S1 模型的各情境準確率折線圖與機器人操作演示 黑色機械手臂正在操作並夾住一株植物的莖部,畫面上方印有白色文字「Introducing S1」,左下角帶有一個白色標誌。 三聯畫分別展示人員示範、VR/感測設備與機械臂操作;右側工作桌可見平底鍋、碗盤、雞蛋與白色馬克杯。S1 機器人模型的展示畫面與效能評估折線圖 影片中的 Prompt 與操作:操作步驟: 1. (00:00)示範將綠色球體放入透明收納盒中 2. (00:01)機器人機械臂操作平底鍋翻煎鬆餅 3. (00:14)機器人機械臂夾取植物進行盆栽移植 4. (00:25)機器人執行超過 10 分鐘的長距離任務展示 5. (00:36)展示論文《Language Models are Few-Shot Learners》與 GPT 模型演進圖表 6. (01:47)機器人製作鬆餅的過程 7. (02:12)機器人製作咖啡的過程 8. (02:25)機器人進行盆栽移植任務 9. (03:41)機器人翻煎鬆餅 10. (03:58)評估圖表:已知任務 (Known Tasks) 的成功率比較 11. (04:08)評估圖表:未知任務 (Unknown Tasks) 在不同預訓練時數下的成功率 12. 評估圖表:S1 與現有 VLA 模型在後訓練示範次數與準確率的比較 13. 雙臂機器人展示綁上紅色緞帶的包裝盒任務原文:https://easyvibecoding.app/curated/3137-skild-ai-s1-learns-robot-tasks-from-demonstration-video
Embed this episode
Ready to play
Skild AI 發布 S1,單一示範影片即可免微調完成陌生長時程機器人任務
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.