PODCAST · technology
EasyVibeCoding Podcast
by EasyVibeCoding
輕鬆Vibe Coding — Anthropic 官方文章翻譯、Claude API 與 Prompt Engineering 實作心得、X 技術社群精選的中文音訊版。
-
213
Dario Amodei 重申 Anthropic 支持放慢 frontier AI、保留 open-weights 發展空間
Dario Amodei 重申 Anthropic 支持放慢 frontier AI、保留 open-weights 發展空間。 這場對話從一則被 Sholto Douglas 指為「完全錯誤」的說法開始,延伸至開放模型、AI 產業的公共敘事、就業衝擊,以及 AGI 可能重塑企業與經濟的長期問題。 罕見的公開回應 2026 年 8 月 15 日,Sholto Douglas 表示,他認同 Gavin Baker 的許多觀點,但認為有人為了迎合特定敘事而散播不實說法。這套敘事一方面宣稱 Anthropic 沒有競爭護城河,另一方面又說 Anthropic 可能強大到成為世界上唯一剩下的公司;Sholto Douglas 認為兩者互相矛盾。他特別指出,自己最擔心的事情之一正是經濟權力過度集中,政府不應讓任何公司取得如此大的影響力,社會需要競爭與資本主義。 他同時反駁「AI 市場已被少數公司壟斷」的看法,稱目前 AI 可能是全球競爭最激烈的市場:幾乎每一家最大的企業都專注於打造更聰明、價格更低的 model。若這條路順利,AI 可能把各種事物的成本壓低到接近能源成本,但這也會威脅既有產業與個人的護城河。Sholto Douglas 認為,AGI 出現後,資本主義乃至「公司」本身的定義都可能變得非常不同,並引用 Dwarkesh Patel 的分析作為延伸閱讀:What fully automated firms will look like。 Gavin Baker 的反駁 Gavin Baker 回應,矽谷已有多位嚴肅人士聽過類似說法,之所以容易相信,是因為它符合 Dario Amodei 在公開文章中的風險論述。Dario Amodei 曾指出 AI 可能對人類造成多重危險,也可能導致經濟權力高度集中,因此需要審慎監管;Gavin Baker 表示,他相信這些論證是出於善意,也同意風險本身值得重視。 但 Gavin Baker 認為,面對 AI 可能危險的前提,社會大致有兩條路:透過監管把 AI 集中在少數公司與政治人物手中,或是讓 AI 廣泛分散。他引用 Mark Zuckerberg 的觀點,認為「AI 危險到只有極端集中權力才安全」本身就有問題;歷史並未證明,只要讓絕對權力落在足夠開明的人手中,就能得到安全而正面的結果。Gavin Baker 因此主張盡可能增加 AI 的多樣性,讓人類有更高機率找到價值觀相近的 AI,而不是押注單一權力中心。 他進一步稱,Dario Amodei 的監管倡議目前已失去說服力。Gavin Baker 將近期一個未發布的 OpenAI 先進 model 入侵 Hugging Face、最後由 open-source model 協助處理的事件,視為嚴格短期監管難以推進的例子;他也表示,除 Anthropic 外,幾乎所有主要公司都簽署了 Jensen Huang 的公開信。不過,Gavin Baker 認為 Dario Amodei 持續強調 AI 危險,反而幫助了美國反資料中心倡議團體,未來這些團體可能剪輯他的談話投放廣告。他擔心,這會降低 AI 最終協助治癒多數疾病、延長人類壽命並帶來富足未來的機率。 Sholto Douglas 的風險區分 Sholto Douglas 隨後承認,AI 產業確實沒有描繪出足以讓人們願意爭取的正面未來,而且這個失敗正在降低實現該未來的機率;但他認為不同風險不能用同一套政策處理。 在 cyber 領域,他認為整體上是防禦方占優勢。如果未來兩年由金融機構與關鍵基礎設施供應商積極進行 white-hat 自我攻擊測試,社會就可能有能力衡量開放 coding model 帶來的新增風險。短期內,美國政府或許可以選擇承受較高的 cyber 攻擊風險,以避免限制自由,但前提是政府必須先自行測試並掌握風險。 生物領域則偏向攻擊方占優勢,這種不對稱可能要到 2030 年代中後期才有機會改善。社會也許會認為「口袋裡有世界級病毒學家」所帶來的風險值得承受,但政府應建立專責機構,測試 AI 是否比觀看 YouTube 更能提升個人製造危害的能力,也應實際評估一個人拿著 20 萬美元與一間車庫,最糟能做到什麼程度,再隨每個新能力等級做決定。 就業方面,Sholto Douglas 不完全同意 Dario Amodei 對速度的判斷。他認為,即使 model 在 2028 年達到能自動化 95% 電腦工作所需的能力,compute 短缺、系統部署複雜度、政策限制與服務需求,都可能讓人類繼續工作到 2030 年代。但社會仍應預先準備不同失業率情境的應變方案,例如限制獲利公司的裁員速度每年不得超過 5%,並採用 METR 式評測追蹤各職業類別的自動化進度。 對於「現在是否應立即處理就業問題」的質疑,Sholto Douglas 表示目前就業市場仍強,因此不會立刻採取措施;但政府應先準備好備案,讓民眾知道不同情境都有應對計畫。例如,資料輸入與客服中心工作可能逐步消失,同時電工需求卻需要成長為 25%,這種勞動力轉移就應提前納入規劃。 Dario Amodei 重新界定監管 Dario Amodei 在 8 月 16 日罕見加入社群討論,先否定「監管等於集中、開放等於分散」這個二分法。他認為,矽谷常把 監管、監管俘虜(regulatory capture)與權力集中直接畫上等號,但公平且客觀的制度流程也可能發揮分散權力的作用。就像正式法院制度有時顯得菁英化,卻通常比群眾私刑更能保護弱勢者;好的制度能把權力放在規則與理念上,而不是特定人物手中。 他表示,Anthropic 一直嘗試提出會放慢 frontier AI 公司、卻讓較小競爭者受益的政策。Anthropic 支持的 California SB53,以及對 SB1047 持保留態度的立場,都豁免營收或 model 訓練成本低於門檻的公司;SB53 的門檻是 5 億美元。Anthropic 也支持在 CAISI 與白宮倡議更嚴格測試 frontier model,而不是 off-frontier model,並支持「Pacing the Frontier」構想:放慢最強 model 的發展速度,同時不限制追趕中的公司與 open-weights model。 Dario Amodei 的核心判斷是,AI 本身就具有結構性集中權力的傾向,原因主要來自 scaling laws 的極端效果,而非監管本身。open-weights 能部分改善問題,卻不足以解決集中,因為權力仍會轉移到擁有最多 compute 與晶片的公司,主要是 frontier lab 與部分硬體供應商。他主張設計「道路規則」,同時處理資安、生物與 AI 對齊風險,限制 frontier AI 公司的制度性權力,並保留 open-weights model 的發展空間。 Dario Amodei 也不同意監管倡議已經失敗。他表示,外界報導中的川普政府方向——在 frontier model 部署前做測試,並在 open-weights model 接近 frontier 時測試——正是他支持的方向,雖然細節仍需確認。他也支持 Demis Hassabis 提出的類似 FINRA 的監管機構,並指出產業在六個月前仍多半要求聯邦優先、排除州級監管,當時幾乎沒有聯邦方案。 風險與希望的公共敘事 Dario Amodei 否認自己的訊息過度負面。他表示,自己各寫過一篇主要討論風險與機會的文章,之所以社群上常見負面片段,是因為訪談中談風險的短片更容易被剪輯與傳播。他撰寫《Machines of Loving Grace》,正是因為 AI 產業沒有充分描繪技術改善世界的鼓舞性願景;文章大部分篇幅都在說明 AI 如何可能改變健康與生物學,甚至在約 5–10 年內治癒多數人類疾病。 他提到,自己的父親在直接抗病毒藥物 sofosbuvir 出現前幾年因 C 型肝炎去世;這種藥物能治癒 95% 的患者,也可能挽救父親。Dario Amodei 也在《Policy on the AI Exponential》中提出簡化 FDA 流程的方法,避免 AI 加速開發的大量藥物被監管程序拖慢。 不過,他認為大眾對 AI 的負面觀感,根本原因不是某一位 AI 領導者談太多風險,而是長期累積的信任危機。一般人不信任公司、政府與科技產業,總懷疑它們又在準備某種傷害自己的新方式。因此,靠華麗行銷宣稱 AI 會治癒癌症,不足以重建信任;真正有效的方法是「實際治癒癌症」。在成果出現以前,他不願作出空洞承諾,但仍會誠實談論真實風險。 Gavin Baker 認為,Dario Amodei 的文章雖然品質很高,但考慮到人類心理,風險與機會各占一半仍可能過度偏向風險。他同意產業最應做的事,是實際治癒癌症,而不是只改善訊息包裝。 強大 AI 的風險背景 Dario Amodei 在 2026 年 1 月發布的〈The Adolescenc…
-
212
SpaceXAI 分享用 Grok Bot 組建企業 GTM 團隊的完整做法
SpaceXAI 分享用 Grok Bot 組建企業 GTM 團隊的完整做法。 以下是我在 SpaceXAI 用 Grok Bot 做企業 GTM 的方式。 最初在公司內部試用這項產品時,Grok Bot 很快就在整間公司普及開來。我也建立了一份內部 Notion 文件,分享自己使用 Grok Bot 的方式,供團隊參考。如果其他正在設定 @bot 的 GTM 團隊也能從中受益,我想把這份內容分享給外界。 對我來說,Grok Bot 的感覺不太一樣,因為它不只是思考夥伴,我還能放心讓它端到端地自行完成實際工作。它每週都更了解我的工作方式,也變得更加敏銳。 開始使用的提示 請確認 @bot 已連結到你每天會用到的工具,例如 Salesforce、Gmail、Calendar、Sheets、Drive、Slack、Notion、用 Granola 記錄會議、用 Figma 製作投影片、X、LinkedIn、資料倉儲等等。 六個第三方服務整合選項的列表介面,採兩欄三列排布,各項目包含圖示、服務名稱、簡短說明與帶有綠色勾勾的「Added」已新增狀態,項目包含 Gmail、Google Calendar、Google Drive、Granola、Notion 以及 Slack。 展開畫面重點畫面呈現六個整合服務的列表,每個項目皆包含圖示、名稱、描述以及「✓ Added」狀態標籤。各項目的具體內容如下: 左側第一列: - 圖示:紅、黃、綠、藍交織的 M 字樣 Gmail 標誌 - 名稱:Gmail - 描述:Connect to Gmail ... - 狀態:✓ Added 左側第二列: - 圖示:綠色三角形組合的 Google Drive 標誌 - 名稱:Google Drive - 描述:Connect to Google... - 狀態:✓ Added 左側第三列: - 圖示:黑底白色外框的 N 字樣 Notion 標誌 - 名稱:Notion - 描述:Notion Skills + Not... - 狀態:✓ Added 右側第一列: - 圖示:藍底白字的 31 數字 Google Calendar 標誌 - 名稱:Google Calendar - 描述:Connect to Google... - 狀態:✓ Added 右側第二列: - 圖示:綠底黑色螺旋圖案的 Granola 標誌 - 名稱:Granola - 描述:Your meetings in y... - 狀態:✓ Added 右側第三列: - 圖示:四色拼湊的 Slack 標誌 - 名稱:Slack - 描述:Slack MCP server. ... - 狀態:✓ Added Bot 有自己的電腦,全天候 24/7 執行,因此即使你的筆電關機,也能完成工作。 你的 bots 具備記憶,會記住你的偏好,也會學習你的寫作風格。你可以要求 bot 掃描 Gmail 和 Slack,了解你平常的寫法。 我最喜歡使用 bot 的方式之一,是透過行動應用程式搭配語音輸入。這樣即使不在電腦前,也能交辦任務給 bot。當我無法使用筆電時,要製作投影片或從工具中擷取資訊就方便很多。 執行你自己的 bot 團隊 GTM Team 的通訊或任務清單介面,列出 Cursor 10x engineer、Data Analysis、PG、slides、Forecast 與 1:1s 等六個項目及其對應的更新狀態與時間戳記。 展開畫面重點GTM Team Cursor 10x engineer 11:39 AM Pulling up a customer facing answer on setting up... Data Analysis Pulled usage information across your book, do ... PG 11:36 AM Done, emails are drafted in gmail slides Slides are updated from your Granola meeting ... Forecast 8/5 All 17 Next Steps are updated in Salesforce with t... 1:1s 8/5 Updated the doc with MEDDPICC drafts under ev... Chief of Staff 我的 Chief of Staff 負責會議準備、收件匣,以及通話後的草稿,並協調團隊中的其他成員。你可以告訴 Chief of Staff 啟動其他 agents,並將 bots 依區段整理。我習慣把 Chief of Staff 釘選起來,因為這是我最常使用的 bot。 來自名為 Olive - Chief of Staff 且大頭貼為黃金獵犬的對話通知,內容顯示「Inbox is quiet. Nothing that needs you this morning.」與時間 8:47 AM。 展開畫面重點畫面上顯示通訊對話介面: 左側為圓形頭像,內有一隻伸出舌頭的金色犬隻,下方文字標籤為「Olive - Chief of...」。 右側為對話訊息泡泡框,頂端顯示圓形頭像縮圖、名稱「Olive - Chief of Staff ...」、釘選圖示與時間「8:47 AM」,內文為「Inbox is quiet. Nothing that needs you this morning.」。 右下方邊緣可見另一則訊息的一部分:「Night. Nothing c」。 介面疊加了對話列表與多層級的操作選單,左側顯示多筆不同主題的對話紀錄與時間戳記,中間跳出的選單包含 Pin、Move to、Mark as Unread、Edit Profile、Duplicate、Copy conversation ID 等選項,右側子選單則列出 GTM Team、Customers、Personal、Unassigned 與 New section 的分類資料夾。 展開畫面重點畫面左側為對話清單: Cursor 10x engineer (11:39 AM) Pulling up a customer facing answer on setting up... Data Analysis Pulled usage information across... PG Done, emails are drafted in gma slides Slides are updated from your Gr Forecast 中間為對話項目所展開的右鍵選單: Pin Move to > Mark as Unread Edit Profile Duplicate Copy conversation ID 右側為 Move to 的子選單: ✓ GTM Team Customers Personal Unassigned New section 每日會議準備 告訴 bot 建立一個 routine,每天準備你的會議,並從工具中擷取資訊(Salesforce、Gmail、Slack、Granola、Gong;如果是新的會議,也可以上網研究)。我偏好簡短、方便快速掃讀的輸出,這樣通勤上班時就能用手機閱讀。你也可以讓 bot 在每天的通話前製作客製化簡報(它會呼叫我的 slides bot)。 Routines 掃描收件匣並自動建立回覆草稿: `text Scan my work inbox for messages since the last run that plausibly need a reply: customer and prospect threads, renewal or pricing questions, intros, direct questions to me. Skip newsletters, automated notifications, receipts, calendar RSVPs, and internal noise. For each one, give me a short digest in chat: sender, subject, one line on what they need, and a proposed reply in my voice. Do not auto-send. If nothing needs a reply, send no mess…
-
211
Codex 為 GPT-5.6 Sol 開放 100 萬 token context window,ChatGPT 帳號即可啟用
Codex 為 GPT-5.6 Sol 開放 100 萬 token context window,ChatGPT 帳號即可啟用。 這項設定可讓 Codex 在自動摘要較早內容前,保留更多程式碼、工具輸出與對話歷史。 功能變更 Tibo 於 2026-08-17 表示,GPT-5.6 Sol 具備文件所列的 1,050,000-token context window。這項能力過去僅適用於 API keys,現在已切換開關,支援透過 ChatGPT 帳號使用。較大的 context window 需要模型本身支援,並不代表所有模型都能套用相同設定。 設定檔方式 若要把設定寫入預設值,請開啟 ~/.codex/config.toml,並在任何 [section] 標頭之前,於頂層新增或更新以下內容: `toml model = "gpt-5.6-sol" modelcontextwindow = 1000000 modelautocompacttokenlimit = 900000 ` 設定步驟如下: model 選取 GPT-5.6 Sol。 modelcontextwindow 將 Codex 的 context 預算設為 1,000,000 token。 modelautocompacttokenlimit 讓系統約在 900,000 token 時開始自動壓縮歷史,保留部分緩衝空間。 儲存檔案後,重新啟動 Codex client,並開始新的 session。 單次 CLI 測試 如果不想改動預設值,可只對單次 CLI session 套用設定: `bash codex -m gpt-5.6-sol \ -c modelcontextwindow=1000000 \ -c modelautocompacttokenlimit=900000 ` 限制與提醒 這不是單純把 context window 調得越大越好。Tibo 說明,Codex 團隊已針對效能與成本將預設 context 長度調到最佳,甚至形容已接近「完美」;因此,1M-token 設定雖能處理更長的工作脈絡,仍應由使用者依專案需求自行取捨,不能視為普遍優於預設值的配置。原文:https://easyvibecoding.app/curated/2988-codex-gpt-5-6-sol-opens-million-token-context-window
-
210
NVIDIA Robotics 推出 Newton 1.5,支援平行模擬與選擇性重設以加速機器人訓練
NVIDIA Robotics 推出 Newton 1.5,支援平行模擬與選擇性重設以加速機器人訓練。此次更新聚焦於平行模擬、接觸物理、GPU 控制與資料格式匯入,協助開發者提升訓練流程的效率與穩定性。核心更新支援更多平行模擬,並降低記憶體使用量。 新增選擇性重設,避免每次模擬都從頭初始化。 改善接觸物理的一致性,讓機器人與物體互動時的模擬結果更穩定。 提供實驗性的批次 GPU 控制,可一次處理多個控制工作。 簡化 USD 與 MJCF 的匯入流程,讓既有機器人資產更容易接入訓練環境。視覺展示白色機械手臂夾起裝有多彩球體的透明塑膠袋的動態渲染畫面輔助影片以 3D 渲染畫面呈現白色機械手臂夾起透明塑膠袋的過程,袋中裝有紅、黃、藍、綠等多彩球體。這段畫面可視為機器人操作與物體接觸情境的展示,但影片未提供額外的效能數據,也不能據此推定正式規格或評測結果。取得方式NVIDIA Robotics 邀請開發者從 Newton 的 GitHub 程式庫開始使用:Newton GitHub 程式庫。原文將 Newton 1.5 定位為更適合規模化訓練的版本,但未公布具體的速度提升幅度或記憶體節省數字。原文:https://easyvibecoding.app/curated/2986-nvidia-robotics-newton-1-5-parallel-simulation-selective
-
209
Anthropic 發布第二份 Risk Report,評估四類災難性風險與防護準備程度
Anthropic 發布第二份 Risk Report,評估四類災難性風險與防護準備程度。 發布背景 Anthropic 表示,定期公開 Risk Report 是 Responsible Scaling Policy 的一部分;本期報告於 2026 年 8 月發布,對應政策版本 3.4。公司計畫每 3~6 個月更新一次,並透過報告全文持續揭露風險評估。 評估範圍 報告不只檢視單一模型,而是評估 Anthropic 整體活動,包含僅供內部使用的模型;同時把模型能力、資訊安全控制、部署防護與其他風險緩解措施放在一起分析。內容聚焦四類災難性風險:高風險情境中的失準、關鍵領域的自動化研究與開發、非新型化學/生物武器製造,以及新型化學/生物武器製造,後兩者合併討論。 報告方法 各風險章節會說明威脅模型、相關模型的能力與行為、現有防護措施,以及整體風險判定;其中區分 Anthropic 系統相較其他 AI 開發者所增加的「邊際」風險,以及全產業採用類似模型與做法時的「絕對」風險。報告也交代後續監測與緩解計畫,並整理前一期報告後的安全進展與值得注意的安全流程失敗。原文:https://easyvibecoding.app/curated/2974-anthropic-releases-second-risk-report-assesses-catastrophic
-
208
Tencent AI 分享 TencentDB Agent Memory,讓多種 Agent 跨 session 累積經驗並共享記憶
Tencent AI 分享 TencentDB Agent Memory,讓多種 Agent 跨 session 累積經驗並共享記憶。 核心分享 TencentDB Agent Memory 為 DeepSeek Harness、DSH、CodeBuddy、Claude Code、Codex 與 Hermes 提供長期記憶、Skill 擷取,以及 Wiki/CodeGraph 檢索;它以 OpenAI-compatible proxy 接入,標榜不需修改程式碼,也能在不同 Agent 與 IDE 間共享經驗。專案連結:TencentDB Agent Memory。 主要能力 Chat Memory 保存偏好、事實、決策與互動歷史。 Memory Hub 平台的介面畫面,左側顯示導覽選單與組織權限,右側切換至 Chat_Memory 的原子記憶塊頁面,並正檢視 L3 核心記憶中的 Team Operating Doctrine 與相關核心原則、Reusable SOPs 及 Decision Logic 內容。 Skill 將對話與 tool call 中驗證過的流程整理成可重用資產。 Memory Hub 平台的 Skill 技能管理介面,左側為導覽選單,右側主區域顯示 Skill 資產管理頁面中的 git-single-commit-workflow 詳情與相關設定。 Wiki 結構化整理文件,CodeGraph 索引程式碼符號、呼叫關係與影響範圍。 Memory Hub 平台的 Wiki 知識庫圖譜介面,左側為功能選單,中央以 54 個 nodes 與 119 個 edges 的互動式節點網路呈現 memory-team-api-docs 專案的知識關聯,右側提供節點內容檢視面板。 Memory Hub 讓團隊管理資產擁有者、版本、可見性、ACL 與 Agent 綁定,並以 private、team、restricted 和 agent 控制分享範圍。 Memory Hub 平台的 Code_Graph 介面,顯示 TencentCloud/TencentDB-Agent-Memory.git 專案的 131 個檔案、2,448 個圖節點與 7,445 個圖邊的同步狀態與程式碼搜尋與探索功能。 安裝方式 來源 README 提供啟動 memory-core、memory-hub 與 proxy 的流程;以下指令涉及啟動本機服務,執行前仍應人工核對來源與設定: `bash git clone https://github.com/Tencent/TencentDB-Agent-Memory.git cd TencentDB-Agent-Memory/deploy/global-images cp .env.example .env $EDITOR .env ./start-all.sh ` 實測與限制 README 顯示 PersonaMem 正確率由 48% 提升至 76%,相對改善 +59%;但 Wiki 與 CodeGraph 需非同步處理,CodeGraph 目前優先支援公開 HTTPS 程式庫,資產路由仍須手動綁定。Current release 為 v2.0.0,v2.0.1 預計加入零設定 cold start、更快的 Wiki 生成、Skill 匯出與 Codex IDE Plan mode 支援。原文:https://easyvibecoding.app/curated/2972-tencent-tencentdb-agent-memory-shares-cross-session-agent
-
207
Anthropic 將 Claude 文字加入不加價且不可見的 SynthID-Text 水印
Anthropic 將 Claude 文字加入不加價且不可見的 SynthID-Text 水印。 公告重點 Anthropic 於 2026 年 8 月 15 日發布 FAQ,說明未來 Claude model 產生的文字會帶有水印,並計畫在全球啟用,因目前尚無耐久且可靠的區域限定方式。其他主要 AI 供應商也簽署相同的《AI 生成內容透明度實務守則》;截至 2026 年 7 月,共約 190 個簽署方,相關規範要求服務商標記 AI 生成內容。詳情見 Anthropic 的官方說明 。 運作方式 水印不會在文字中加入可見內容或隱藏字元,而是利用 Claude 每次選擇下一個字詞時,那些不影響語意的隨機決策留下模式。系統會根據密鑰與前文選擇字詞;持有密鑰的一方可檢查整段文字是否符合該模式,並估算 Claude 曾參與撰寫的可能性。這套方法採用 Google DeepMind 發表於 2024 年 Nature 論文的 SynthID-Text 版本,源自 Scott Aaronson 於 2022 年提出的相關設計。 限制與影響 Anthropic 稱,內部測試未發現水印影響內容、創意或可讀性;Google DeepMind 在 Gemini 流量中測試 SynthID-Text 時,使用者的正負評分與未加水印版本也沒有統計上顯著差異。水印無法證明文字一定由 Claude 撰寫,也不能辨識其他 AI;短文本、事實性極高的內容、只做文法校對,以及必須精確的程式碼,通常可供水印作用的選擇較少。程式碼註解等可任意選詞的部分可能仍帶有水印,但對實際程式碼的影響可忽略。 使用者權益與後續 水印不包含個人、組織或對話資訊,不能追溯到特定使用者,也不改變內容的所有權、作者身分或使用者依條款享有的權利。Anthropic 將推出水印偵測 API;Claude 產生或處理 .png、.jpg、.svg 等支援檔案時,則會在中繼資料加入符合 C2PA 的加密簽署憑證。輕度編輯可能無法完全移除文字水印,但全面改寫每個字詞通常可以避開;2026 年 8 月 2 日前發布的舊 Claude model 也預計在接下來幾個月逐步加入水印。原文:https://easyvibecoding.app/curated/2971-anthropic-claude-adds-free-invisible-synthid-text-watermark
-
206
為開放發布 GLM-5.3 做準備:邁向負責任的網路防禦
為開放發布 GLM-5.3 做準備:邁向負責任的網路防禦 當 GLM-5.2 協助 Hugging Face 調查一起 AI 自主繞過自身安全防護措施的事件時,也凸顯出一項更廣泛的轉變:AI 正逐漸成為網路攻擊與網路防禦的一環。 隨著強大的網路攻擊能力變得更容易取得,穩健的防禦能力不能只掌握在少數資源充足的組織手中。開源維護者、獨立研究人員、開發者與規模較小的資安團隊,同樣需要能協助他們在漏洞遭到利用前找出並修復漏洞的工具。 一個開放的世界不能只有開放的攻擊面,也必須擁有一面開放的盾牌。 GLM-5.3 是我們目前在網路安全任務上能力最強的模型。它在漏洞發現、漏洞利用分析,以及複雜的多步驟安全任務上都有大幅提升。這些能力能協助防禦方更早找出弱點、驗證風險,並加快修復速度。 但這些能力也帶來明確的雙重用途風險。因此,我們將採取分階段發布的方式。首先,選定的資安合作夥伴會在受控環境中評估 GLM-5.3,接著才會提供更廣泛的存取權限與 API。必要的安全評估與發布準備完成後,我們將公開 GLM-5.3 的完整模型權重。 負責任的開放,並不代表把每項能力都視為無害;而是要透明地評估風險,在發布前強化安全防護,協調已驗證漏洞的揭露流程,並以符合風險程度的方式,擴大先進防禦能力的取得管道。 從漏洞發現到多步驟安全分析 在後訓練階段,我們將漏洞發現資料與經授權的安全環境納入訓練組合。我們預期這能提升模型發現與分析漏洞的能力。 隨著訓練規模擴大,這項提升不只體現在個別缺陷上。GLM-5.3 在多個分析階段中,連結漏洞條件、程式行為、驗證路徑與潛在影響的能力也變得更強。 我們透過三項基準測試評估這些能力: GLM-5.3 在 CyberGym 取得 84.5 分居首,而在 ExploitBench 與 ExploitGym 則由 Mythos 5 分別以 78.0 分與 247 分(6-hour budget)領先。 展開數據表(1)CyberGym分數GLM-5.384.5GLM-5.277.2Kimi K380.0Mythos 583.8GPT-5.6 Sol83.6展開數據表(2)ExploitBench分數GLM-5.354.4GLM-5.224.4Kimi K332.2Mythos 578.0GPT-5.6 Sol76.5展開數據表(3)ExploitGym2-hour budget6-hour budgetGLM-5.3105130GLM-5.22939Kimi K33670Mythos 5181247 CyberGym 從白箱原始碼開始,測試模型能否透過觸發錯誤來識別並驗證漏洞。GLM-5.3 的得分為 84.5%,GLM-5.2 則為 77.2%。 ExploitBench 要求模型對真實漏洞及其利用方式進行更深入的推理。GLM-5.3 達到 54.4%,超過 GLM-5.2 的 24.4%,是其兩倍以上。 ExploitGym 在標準化評估預算下,衡量已完成的漏洞利用任務。GLM-5.3 能在兩小時內完成 105 項任務、六小時內完成 130 項;GLM-5.2 則分別完成 29 項與 39 項。 這個趨勢相當一致:當任務從個別漏洞發現,逐步轉向多步驟漏洞利用時,GLM-5.3 相較於 GLM-5.2 的進步最為明顯。結果也顯示出仍需持續改進的方向,尤其是最複雜的端到端任務。 從基準測試走向真實軟體 我們也與大學及專業資安團隊合作,在經授權的環境中,使用真實世界的程式庫評估 GLM 系列模型。 在這些工作中,GLM 系列一共在 269 個專案中產出 2,436 項漏洞發現,其中 1,097 項被歸類為中度至高度嚴重性。這些發現涵蓋系統軟體、作業系統、瀏覽器引擎、開源基礎架構、網路應用程式、網路協定與智慧裝置。其中部分底層問題已經存在數十年,卻一直未被注意到。原文正文將這 1,097 項描述為「中度至高度」,圖表則標為 Critical & High;兩者口徑不一致。 在這些評估中,資安專家會界定經授權的範圍、審查模型輸出、調查潛在風險,並與相關各方協調。GLM 模型能協助研究人員重建複雜的程式邏輯、縮小大量候選路徑的範圍,並串連多個元件之間的證據。 目的不只是產出更多發現,而是協助防禦方更早識別具有實質意義的風險,縮短從發現到修復之間的時間。 發現漏洞後,必須進行負責任的揭露 漏洞並不是在被發現的那一刻就算安全處理完成。適當的流程還包括進行審查、在適合的情況下重現問題、透過正確管道回報,並與受影響的維護者協調。 我們在資安工作中發現的問題,會透過既有的漏洞揭露流程提交。只有在符合相關揭露與修復流程的情況下,我們才會公開技術細節。對於仍在協調中的問題,我們不會發布可能不必要地增加風險,或識別出受影響專案的資訊。 為了讓這項工作更加透明,我們建立了 Z.ai Security Disclosure Ledger。 追蹤的 2,436 項漏洞中含 1,097 項 Critical 及 High 級別漏洞,跨越 45 年影響且平均存活 26.6 年才被發現。 展開數據表(1)摘要數據項目數值FINDINGS TRACKED2,436PUBLICLY DISCLOSED53UNDER EMBARGO2,383CRITICAL & HIGH1,097OSS PROJECTS269YEARS OF IMPACT45最古老漏洞年份1981漏洞發現前平均存活時間26.6年展開數據表(2)SEVERITY DISTRIBUTION項目數值Critical107High990Medium1,286Low53展開數據表(3)WHEN THE FLAWS WERE INTRODUCED項目數值時間範圍1981至2026 這份帳簿會記錄漏洞發現如何在揭露流程中逐步推進。對於已公開揭露的問題,其中可能包含受影響的專案、嚴重性、可取得時的 CVE 或其他識別碼,以及該問題在程式庫中存在多久的資訊。 對於仍在協調揭露階段的漏洞,帳簿可以發布密碼編譯雜湊值。如此一來,之後便能驗證該發現,同時不會過早揭露實際操作細節。 開放模型與揭露漏洞是兩項不同的決策。讓模型更廣泛地提供給使用者,並不代表必須在維護者有適當機會調查與回應之前,先公開漏洞細節。 安全性與分階段發布 網路安全是 AI 安全中格外困難的領域。攻擊與防禦任務往往會使用相同的術語、程式碼與技術方法。 分析漏洞的請求,可能來自準備修補程式的維護者、解 CTF 題目的學生、進行經授權評估的研究人員,也可能來自鎖定真實系統的攻擊者。單靠關鍵字無法可靠區分這些情況。意圖、授權、情境、目標與潛在影響都很重要。 針對 GLM-5.3,我們採用由三個互補層次組成的縱深防禦方式。 外部分類器 在我們代管的服務中,外部分類器會識別高風險請求,並協助阻止明顯有害的活動。 推理監控器 推理監控器會在任務執行期間評估風險。它的設計目標,是偵測可能在多個步驟中逐漸浮現的有害目標,而不是只依賴初始請求的措辭。 深度安全對齊 模型本身經過訓練,能區分正當的資安工作與高風險攻擊活動,並拒絕越過這條界線的請求。 深度安全對齊對開放權重發布尤其重要。代管服務中的分類器與監控器只適用於我們的服務,不會自動隨模型進入每一個本機部署環境。模型層級的對齊,是發布檢查點中所包含的安全層。 為了開發這些系統,我們建立了差異化訓練資料,呈現經授權的資安研究與惡意活動之間的相似處與差異。我們也建構了涵蓋越獄變體、意圖偽裝,以及其他試圖規避安全審查方式的對抗性資料。 我們的評估涵蓋多種網路安全任務,包括: 資安教育與知識; 藍隊防禦; CTF 挑戰; 漏洞發現與修復; 經授權的滲透測試; 漏洞利用開發; 未經授權的入侵與其他明顯的惡意活動。 目標是在不廣泛拒絕正當防禦、教育與研究任務的前提下,降低高風險濫用。 在更廣泛發布之前,專業資安團隊將進行安全評估與紅隊測試。這些評估會同時檢驗模型是否可能遭操弄而支援有害活動,以及安全防護是否會妨礙正當的資安工作。 沒有任何安全系統能消除所有雙重用途風險。模型權重一旦公開,任何開發者都無法保證能控制每一種後續修改或使用方式。模型層級的安全防護可以提高濫用門檻,但無法提供絕對控制。 因此,我們的發布流程聚焦於能有效降低風險的階段:訓練、發布前評估、受控的合作夥伴測試、代管服務的安全防護、負責任的漏洞揭露,以及持續進行的對抗性測試。 啟動 OpenVuln 計畫 世界上許多數位基礎架構都仰賴開源軟體。許多關鍵專案由小型團隊或個人貢獻者維護,卻沒有專門的資安資源。 與此同時,AI 正讓複雜的網路任務更容易自動化。如果先進的防禦能力仍集中在少數組織手中,資源最少的專案可能會被迫保護軟體供應鏈中一些最重…
-
205
Qwen 開放 Qwen3.8-27B 權重,原生支援 262K tokens 多模態上下文
Qwen 開放 Qwen3.8-27B 權重,原生支援 262K tokens 多模態上下文。 Qwen3.8 Open Weights 的發表視覺圖,背景為太空中地球邊緣的弧線與星空,左側浮現白色科幻太空模組組成的標誌性幾何圖形,右側以白色粗體排印文字呈現標題。 發布重點 Qwen 在 2026 年 8 月 14 日表示,先前承諾的 Qwen3.8 open weights 已正式提供。核心產品 Qwen3.8-27B 是原生多模態 dense model,僅 27B 參數,官方稱其整體表現超越 Qwen3.7-Plus,並特別強化真實世界的程式開發與 office 工作流程。模型採 Apache 2.0 授權,定位是讓開發者能在本機部署、微調並建立應用程式。 Qwen3.8-27B 在整體表現上超越 Qwen3.7-Plus,並在真實程式編寫與辦公工作流程中展現優異表現。 模型能力 Qwen3.8-27B 原生支援 262,144 tokens 的 context window,搭配 YaRN 可延伸至 1M tokens。它能理解圖片與影片,並支援 thinking mode、推理深度控制與保留前次對話的 reasoning context,適合處理需要多步規劃的 Agentic 工作流程。外部模型頁面也指出,Qwen3.8-27B 加強了 coding、專業工作、研究與 long-horizon agentic tasks,並改善環境回饋處理與端到端任務完成的穩定性。 Qwen3.8-27B 整體表現超越 Qwen3.7-Plus,並在 OSWorld-Verified(84.3)、WebArena-Verified(64.8)、RecreationBench(47.1)及 SWE-MM(38.6)等多項 Agentic 工作流程與軟體工程任務中領先其他比較模型。 兩種部署方向 Qwen 將 Qwen3.8-27B 與近期釋出的 Qwen3.8-2.4T-A95B 分別定位在不同使用情境: Qwen3.8-27B 適合在本機執行輕量應用程式、視覺任務、聊天與 Agent 開發。 Qwen3.8-2.4T-A95B 是 Max-level 的大規模模型,官方同步提供 open weights,面向高效能推理與複雜工作負載。 權重可從 Hugging Face 與 ModelScope 取得。 來源:@UnslothAI(回覆)|Qwen3.8-27B 的本機部署資訊圖:列出 2-bit 至 BF16 的記憶體需求、thinking/non-thinking 建議設定,並附上與 Qwen3.7-Plus 等模型的 benchmark 比較。 本機生態系 Unsloth 隨即提供 Qwen3.8-27B 的 Dynamic GGUF、NVFP4 量化版本,並讓模型支援 Unsloth Desktop 的本機執行與微調。其資料顯示,量化後的 Qwen3.8-27B 約需 17GB RAM/VRAM;4-bit 版本通常需要 17–19GB,讓 RTX 5080、RTX 4090 或具 24GB 統一記憶體的 Mac 等裝置具備部署條件。Dynamic GGUF 也加入 Developer Role Support、MTP 快速推理,以及更能處理巢狀物件的 tool calling 解析。 來源:@AMD(回覆)|AMD 與 Qwen 合作宣傳圖,上方醒目標示「Now Available: Qwen 3.8 27B」,中央展示黑色的 AMD RADEON AI PRO R9700 顯示卡與 AMD RYZEN AI Max Series 處理器晶片,背景為藍色科技線條與透光幾何圖形,底部印有 AMD 與 Qwen 的商標及「together we advance_」標語。 效能與硬體支援 AMD 宣布 Day 0 支援,Qwen3.8-27B 可透過 llama.cpp 執行於 AMD Ryzen AI Max+ 處理器,或單張 AMD Radeon AI PRO R9700 32GB 顯示卡;初步測試在 Ryzen AI Max+ 395 上達到每秒 24.5 tokens,在 Radeon AI PRO R9700 上達到每秒 51.8 tokens。LM Studio 也提供圖形介面,讓使用者搜尋、下載並在本機測試模型;AMD 建議約 24GB VGM 或 VRAM,以較舒適地執行 Qwen3.8-27B。 實際影響 這次發布把 Qwen3.8 的使用路徑分成「本機部署 27B 模型」與「建置大型 Agent 系統」兩端。Qwen 的核心訊息不是只公布新模型,而是強調開放權重、Apache 2.0 授權與多家工具及硬體在發布當日提供支援,讓開發者能直接下載、部署並自行建立過去尚未預想的應用程式。原文:https://easyvibecoding.app/curated/2967-qwen-opensources-qwen3-8-27b-model-262k-context-local
-
204
SpaceX 完成收購 Cursor,團隊加入 SpaceXAI 改進 Grok 與相關產品
SpaceX 完成收購 Cursor,團隊加入 SpaceXAI 改進 Grok 與相關產品。 整合方向 Cursor 表示,團隊將投入讓 Grok 成為「全球最實用的 AI」,並改進 Grok Build、Grok Bot、Grok API、Cursor 等產品。這也確認本站先前策展的〈SpaceX 收購 Cursor〉已從合作進一步落實為收購。 官方立場 Cursor 對 SpaceX 的技術成果給予高度肯定,形容其打造出全球最具啟發性與令人印象深刻的技術,並表示很榮幸加入這家公司;不過,貼文未公開交易條件、組織安排或後續產品時程。原文:https://easyvibecoding.app/curated/2966-spacex-acquires-cursor-team-joins-spacexai-grok-build
-
203
Z.ai 推出 GLM-5.3:程式開發基準 Terminal-Bench 3.0 從 4.6 提升至 28.3
Z.ai 推出 GLM-5.3:程式開發基準 Terminal-Bench 3.0 從 4.6 提升至 28.3。 ZCode 與方案變動 ZCode 表示 GLM-5.3 已全面推出,Coding Plan 使用者的配額歸零重算。官方也主打 98% 以上的快取命中率、約 30% 的有效 token 使用收益,以及截至 8 月 31 日的 1.5 倍限時配額加成,搭配快取節省後,標準配額最高可達 180%。Goal mode 會持續規劃、撰寫程式碼、測試與驗證,直到完成目標;Remote Control 則能讓使用者透過 WeChat 或 Feishu 從手機監控並操控長時間執行的任務。詳情見 Z.ai 官方公告,ZCode 可從 zcode.z.ai 取得。 模型能力 GLM-5.3 沿用 GLM-5.2 的基礎模型,這次所有提升都來自 post-training。Z.ai 表示,模型在自家 Z.ai Code Bench 的表現提升 50%,並在 Terminal-Bench 3.0 與 Agents' Last Exam 取得 open-source SOTA。公開評測中,Terminal-Bench 3.0 從 4.6 提升至 28.3,DeepSWE v1.1 從 46.2 提升至 66.9,Agents' Last Exam 則從 23.8 提升至 28.5。 來源:@cline(回覆)|GLM-5.3 在 Terminal-Bench 2.1 以 88.2 分擊敗 Fable 5 與 V4-Pro 0813 取得領先。 Agentic 程式開發 Z.ai 將訓練環境擴展到更接近專業工程與研究工作的長流程任務,例如讓模型在具備運算叢集、儲存系統、內部文件、程式庫與實驗結果的環境中,診斷訓練瓶頸、實作最佳化、執行實驗,並在維持正確性的前提下交付端到端效能提升。在 Max effort 下,GLM-5.3 以約 75K output tokens 達到 34.5%,高於 GLM-5.2 的 23.4% 與 96K;High effort 則以約 50K output tokens 達到 31.4%,超過 Claude Opus 4.8 的 29.5% 與 120K,但仍落後 Claude Fable 5 的 39.5%。 資安能力與風險 post-training 納入漏洞發現資料與環境後,GLM-5.3 的資安能力延伸到多階段漏洞利用。它在 CyberGym 得分 84.5%,高於 GLM-5.2 的 77.2%;在 ExploitBench 達 54.4%,是 GLM-5.2 的兩倍以上;ExploitGym 則在兩小時內完成 105 個任務、六小時內完成 130 個,GLM-5.2 分別為 29 與 39 個。Z.ai 與中國數個資安團隊檢視真實程式庫後,模型在 269 個專案中找出 2,436 個漏洞,其中 1,097 個屬中度至高度嚴重性;最早的漏洞可追溯至 1981 年,平均存在 26.6 年才被發現。這項能力也意味著模型部署與安全評估需要更嚴格的人工作業。 GLM-5.3 在 AutomationBench、GDPVal-AA v2 與 CyberGym 取得領先,但在其餘 benchmark 與 GPT-5.6 Sol 等模型各有高低。 開放與整合 模型權重預計在發布兩週後、完成安全評估與強化後公開。Ollama 表示將在 open release 後支援 GLM-5.3;Cline 稱其已在 ClinePass 提供,首月促銷價為 4.99 美元,之後每月 9.99 美元,可透過以下指令安裝: `bash npm i -g cline ` OpenCode 則提供 GLM-5.3 的 Go 版本,支援文字輸出與 1M context,價格維持與 GLM-5.2 相同。 API 遷移 GLM-5.3 僅支援 low、high、max 三種 thinking effort,不再支援停用 thinking。既有應用程式若使用 thinking.type: "disabled",更新 model ID 前必須依序完成: 將 thinking.type: "disabled" 改為 enabled。 將 reasoning_effort 設為 low。 將 model ID 更新為 glm-5.3。 否則 API request 會失敗。原文:https://easyvibecoding.app/curated/2968-z-ai-launches-glm-5-3-terminal-bench-3-0
-
202
OpenAI 推出 Computer History:ChatGPT 與 Codex 可參考近期電腦活動
OpenAI 推出 Computer History:ChatGPT 與 Codex 可參考近期電腦活動。 推出範圍 Computer History 正在 Mac 版 ChatGPT 桌面應用程式中,向 Pro、Business 與 Enterprise 使用者全球推出;EEA、英國與瑞士預計在未來幾週開放。Business 與 Enterprise 團隊必須先由管理員啟用,使用者再到 Settings → Integrations 選擇加入。詳細說明見 Computer History 文件。 一名講者在筆記型電腦前介紹電腦歷史功能與智能代理的運作方式 功能設計 這項功能建立在 Chronicle research preview 上,OpenAI 表示新版降低了 token 使用量,並增加隱私控制。使用者可透過時間軸回顧近期工作,讓 ChatGPT 理解工作脈絡,也能從經常執行的流程建立可重複使用的 skill。畫面顯示,選單列可操作: 暫停或恢復 Computer History 查看近期活動與完整歷史 清除全部或部分歷史 排除特定應用程式與網站,例如 Slack 在設定中加入要排除的網站;Private browsing 會一律排除 來源:@OpenAI(回覆)|ChatGPT 結合 Computer History 功能產生工作進度報告的介面與操作畫面 工作流程應用 媒體畫面顯示,ChatGPT 能根據 Computer History 產生 standup update。範例涵蓋清理每週銷售追蹤表、整理 email 與支援紀錄中的客戶問題、撰寫季節性組合商品的 launch checklist,以及列出尚待完成的產品圖片與包裝成本。系統也提出「Create Morning ops scan automation」,建議每天列出自前一天起有變動的商店、網站、供應商與 launch-owner 工作流。 skill 建議 時間軸會把連續活動整理成具體工作,例如影片檢閱、Codex 海報示範錄製與圖片回饋示範準備,並提出建立「Video review follow-up skill」或「Image feedback demo recording skill」。使用者可以從歷史頁面或 ChatGPT 對話介面建立 skill,將收集 Frame.io 影片意見、開啟對應 Screen Studio 專案等流程重複使用。 來源:@thsottiaux(回覆)|某 AI 服務的對話介面截圖,頂端顯示使用者輸入的指令「Computer History Roast my computer behavior」,下方標示執行時間為 1 分 43 秒,並有一段文字說明根據從上午 9 點 18 分到晚上 10 點記錄的 8,592 筆電腦事件所產生的效能評估前言。 使用者反思 Tibo 示範以 Computer History plugin 要求 ChatGPT 評析一天的電腦使用情況,結果帶有諷刺意味:Slack 佔記錄活動的 48%,使用者按下「Clear」339 次、送出 253 則 Slack 訊息,按下 Delete 1,191 次,其中 1,065 次發生在 Slack;開啟 42 個分頁、關閉 53 個分頁,並在應用程式間切換超過 200 次。最忙碌時段是晚上 9 點,超過 1,500 個 Slack 事件,顯示這項功能除了提供個人化脈絡,也可能成為檢視工作習慣與數位過勞的工具。一名講者在筆記型電腦前介紹電腦歷史功能與智能代理的運作方式 影片中的 Prompt 與操作:Prompt(00:26): 嘿,我剛剛看的最後一個 Google Doc 是什麼?原文:Hey, what was the last Google Doc I was looking at?Prompt(00:46): 你能確定這個 Doc 有分享給稍早群組 DM 裡的 Josh 和 Priya 嗎?原文:Can you make sure the Doc was shared with Josh and Priya in the group DM from earlier?Prompt(01:07): 話說回來,你可以簡短總結一下我今天早上都把時間花在哪裡嗎原文:By the way, can you briefly summarize how I spend my time this morning操作步驟: 1. (02:01)點擊 macOS 選單列圖示展開 Computer History 下拉選單 2. (02:02)點擊選單中的 ChatGPT (Nightly) 子選單並點擊「Exclude Slack」 3. (02:03)開啟桌面 App 設定視窗切換至 Computer History 分頁 4. (02:05)點擊「+ Add website」並輸入網站網址(如 example.com、linkedin.com) 5. (02:13)捲動瀏覽歷史活動紀錄與 Suggested skill 項目 6. (02:33)點擊 Suggested skill 的「Create Video review follow-up skill」按鈕帶入聊天介面ChatGPT 結合 Computer History 功能產生工作進度報告的介面與操作畫面 影片中的 Prompt 與操作:Prompt(00:02): 根據我昨天的成果,為我草擬一份 standup 更新報告原文:Draft a standup update for me based on what I did yesterday操作步驟: 1. (00:02)輸入 prompt 並點擊送出 2. (00:21)點擊送出按鈕原文:https://easyvibecoding.app/curated/2970-openai-computer-history-chatgpt-codex-cross-app-context
-
201
Teknium 宣布 Hermes Agent Bot Mode 公開 beta:每個 profile 可成為獨立 bot
Teknium 宣布 Hermes Agent Bot Mode 公開 beta:每個 profile 可成為獨立 bot。 這項模式需先更新 Hermes,因為它依賴最新版本的 plugin API 增強。 功能定位 Bot Mode 是 sessions mode 的替代方案:每個 Agent profile 都會成為一個獨立的 bot,擁有自己的對話、名稱、描述、頭像與個性,也能接收工作並和其他 bot 互動。使用者可在 Bots 分頁管理多個 bot,建立或編輯 profile,設定模型、技能、工具組與 SOUL.md,也能複製完整設定、記憶與外觀。 主要能力 外部來源所述的 plugin 提供下列功能: 以 roster 顯示各 bot、最新訊息與時間戳。 支援幾何頭像、上傳圖片、AI 生成肖像,以及 bot 忙碌時會動的 pixel pet。 透過 Hermes cron 為各 bot 建立週期性工作,結果會回到該 bot 的聊天紀錄。 每個 bot 都有持久的 Agent Inbox,可互傳訊息;也能在對話輸入 @researcher,把工作轉交給指定 bot。 每個 bot 的設定、記憶、技能、憑證與聊天紀錄會隔離存放於 ~/.hermes/profiles//,plugin 主要提供操作介面,不需修改核心程式或執行背景 daemon。 安裝方式 這是安裝在執行 Hermes Desktop 的電腦上的 desktop plugin,不是安裝在 gateway;若 gateway 位於遠端伺服器,應在本機桌面電腦執行: `bash git clone https://github.com/NousResearch/Hermes-Bot-Mode ~/.hermes/desktop-plugins/hermes-bots ` 也可以將 plugin.js 下載至 ~/.hermes/desktop-plugins/hermes-bots/,接著在 Hermes Desktop 按下 Ctrl+K,選擇「Reload desktop plugins」,或直接重新啟動應用程式。完成後,Sessions 旁會出現 Bots 分頁,對話旁也會顯示 Routines 區塊。plugin 需求包括支援 plugin SDK 的 Hermes Desktop;profiles.* 與 image.generate gateway RPC 則需要 hermes-agent ≥ mid-2026 builds,較舊版本仍可使用基本 roster,但進階編輯與頭像生成可能不可用。 測試重點 Teknium 表示 beta 期間最需要的是使用者回饋,後續會依問題修正,再把 Bot Mode 整合進正式 Desktop App。外部來源也提醒,刪除 profile 目前不在 UI 中,需使用 hermes profile delete ;bot-to-bot 訊息是每次執行時傳遞,無法即時中斷正在進行的對話。 Hermes Desktop 桌面應用程式介面展示與 agent 之間的對話互動記錄,左側欄顯示 SESSIONS 與 BOTS 列表包含 Default、Developer 與 Mr Tester,中間主視窗顯示 Developer agent 回報與 Mr Tester 互動的詳細過程與回覆內容。 黑暗模式的新 Agent 建立介面,頂部說明其具備獨立記憶、技能與聊天功能,下方提供頭像圖示選擇器、顏色選項,以及 Name、Title、Description 欄位供使用者輸入設定,並設有「Cancel」與「Create Agent」按鈕。 New Agent 建立介面,上方顯示說明文字與頭像來源選項(Bot、Generate、Upload、Pet),下方提供搜尋欄與多個 pixel art 風格的寵物頭像選項供使用者選擇做為 Agent 的 profile picture。 Hermes Agent 的對話介面顯示使用者發送指令要求向 mr-tester 打招呼,並列出回覆內容與其 wheelhouse 協作領域。原文:https://easyvibecoding.app/curated/2964-teknium-hermes-agent-bot-mode-public-beta
-
200
Google 發布 Gemini 3.7 Flash,程式開發評測領先前代並改善 Agent 工作流程
Google 發布 Gemini 3.7 Flash,程式開發評測領先前代並改善 Agent 工作流程。 這次更新也以三個 Agent 協作、從零訓練機器人控制模型的展示,說明其 agentic performance 與 coding accuracy 的進展。 來源:@GoogleDeepMind(回覆)|Gemini 3.7 Flash 產品名稱與彩星圖示 發布背景 發文者 Koray Kavukcuoglu 表示,Flash 系列在短時間內快速迭代,從 Gemini 3.5 到 Gemini 3.7 約三個月;Google 其他官方貼文則指出,Gemini 3.7 Flash 僅在 Gemini 3.6 Flash 推出約三週後登場。Logan Kilpatrick 將這次進步歸因於演算法改良,並強調模型速度快、價格較低,已可透過 API、Google AI Studio、Google Antigravity 等管道使用。Google DeepMind 將它定位為適合程式開發、知識工作與網頁開發的「workhorse model」,也就是面向日常生產工作的主力模型。 Gemini 3.7 Flash 的產品標誌與四色星形圖示浮水印於淺藍色漸層背景上。 評測表現 相較 Gemini 3.6 Flash,Gemini 3.7 Flash 在多項程式開發與企業工作流程評測中提升,發文者列出的結果包括: DeepSWE v1.1:發文者列出的整體評測由 37.0% 升至 65.3%。 Code Arena Elo:1506 成長至 1588。 AutomationBench:13.4% 成長至 30.4%。 Gemini 3.7 Flash 在多項程式碼與 agent 工作流程測試中相較 3.6 Flash 均有大幅提升,並在跨領域 benchmark 中與 GPT-5.6 Terra 及 Claude Sonnet 5 各有高低。 Google 的產品文章提供了更細的對照數據。針對產出可直接用於生產環境的程式碼,FrontierCode 1.1 Main 從 34.4% 提升至 43.6%,Google 產品文章的文字口徑則顯示,DeepSWE v1.1 從 49.0% 提升至 65.3%。同篇不同附圖分別以 48.6% 或 48.0% 標示前代基準,反映來源版次或對照組不同,不宜混為同一組數據。在 Arena.ai 的 WebDev Arena 中,Elo 分數由 1538 提升至 1588;GDP.pdf 文件理解評測則由 22.0% 提升至 34.0%。這些結果涵蓋除錯、問題修復、複雜文件處理與真實世界企業流程,而不只是單次程式碼生成。 來源:@OfficialLoganK(回覆)|Gemini 3.7 Flash 在 DeepSWE V1.1 長期軟體工程基準測試獲得 65.3% 的成績,顯著超越 Gemini 3.6 Flash 的 48.6%,在各模型中僅次於 GPT-5.6 Terra 的 69.6%。 程式開發與網頁生成 Gemini 3.7 Flash 被描述為更擅長處理除錯與 issue resolution,也提高首次產出程式碼的正確率。網頁開發方面,模型能用較少的 prompt 產生功能更完整的版面與應用程式;進行 UI 生成時,還能依照螢幕截圖、圖片或完整 design system,維持較高的設計遵循度與視覺一致性。 來源:@OfficialLoganK(回覆)|Gemini 3.7 Flash 在 FrontierCode 1.1 Main 的正式程式碼品質評測中以 43.6% 的準確率領先 Claude Sonnet 5、GPT-5.6 Terra 與前代 Gemini 3.6 Flash。 官方展示包含多種端到端產出:從文字 prompt 即時建立可遊玩的 3D 遊戲,並搭配 Nano Banana 動態生成角色、物品與材質;也展示以 Gemini 3.7 Flash 協調 sub-agents,再由 Gemini Omni 產生具互動視差效果的 landing page。此外,模型能把靜態 PDF 年報轉成包含即時圖表與彙整洞察的互動式資料故事。 來源:@OfficialLoganK(回覆)|Gemini 3.7 Flash 在 Code Arena 網頁開發(Web development)基準測試中以 Elo 1588 領先 Claude Sonnet 5、Gemini 3.6 Flash、Muse Spark 1.2 及 GPT-5.6 Terra。 Agent 協作展示 發文者特別分享了一項機器人實驗:以三個 Agent 組成團隊,讓 Gemini 3.7 Flash 在 MuJoCo 物理模擬環境中,從零開始自主訓練四足機器人的控制模型。媒體畫面顯示,這套展示採用「3-Agent Conditional Branching Graph」,由 Coordinator、Evaluator 與 Tuner 分工,反覆執行訓練、觀察與調整。 Gemini 3.7 Flash 訓練機器人模型的展示畫面 Coordinator 管理 Evolutionary Strategies(ES)的族群基準,並監控前進距離與保持直立等條件。 Evaluator 讀取記憶體中的 video_frames 陣列與數值遙測資料,分析連續畫面的運動流與腿部離地高度,再輸出結構化 JSON 診斷。 Tuner 依據診斷結果調整 rewardfunction.py 中的 computereward,以及 Kp、Kd、sigma、ACTION_SCALE 等超參數,將建議回傳給 Coordinator。 來源:@OfficialLoganK(回覆)|Gemini 3.7 Flash 在 AutomationBench 企業工作流程自動化測試中以 30.4% 領先各模型。 展示畫面所列的機器人設定包括 0.4m × 0.2m × 0.1m、0.8kg 的軀幹、四條各有髖關節與膝關節的腿、8 個 hinge joints,以及最高 2.0 Nm 的馬達扭矩。控制迴圈為 50 Hz,dt = 0.01s,每個 step 使用 2 個 substeps。這些屬於展示中出現的實驗設定,不應直接視為 Gemini 3.7 Flash 的通用產品規格。 來源:@GoogleDeepMind(回覆)|Gemini 3.7 Flash 在 DeepSWE V1.1 評測取得 65.3% 的成績,較前代 Gemini 3.6 Flash 的 48.6% 大幅提升,並超越 Claude Sonnet 5 與 Muse Spark 1.2。 持續診斷與障礙測試 展示中的 Orchestrator Agent 會重複執行 ES 最佳化,直到機器人停止學習,再把影片交給 Multi-Modal Evaluator Agent 判斷問題,最後由 Tuner Agent 提出神經政策更新。媒體內容設定的最終驗證條件,是在完整 15.0 秒的 evaluation episode 中,champion policy 必須達到 distanceTraveled >= 15.0m 與 timeUpright >= 10.0s;訓練期間則可由 Coordinator 與 Tuner 動態選擇 rollout horizon,例如先使用 3.0 至 5.0 秒的探索區間,再逐步延長。 來源:@GoogleDeepMind(回覆)|Gemini 3.7 Flash 在 FrontierCode 1.1 Main 的正式程式碼品質測試中以 43.6% 的成績領先 Claude Sonnet 5、GPT-5.6 Terra 與 Gemini 3.6 Flash。 在不重新訓練、也不使用 privileged vision 的情況下,展示進一步測試了可推動木箱、固定階梯與多物件碎片場。畫面中的 Phase 2 報告指出,Gen 90 政策能與可移動障礙物互動,但面對固定垂直障礙時,單靠平面行走策略仍有限制。Gemini 3.7 Flash 的 Evaluator 建議提高擺腿離地高度,或加入以自身視角取得的地形高度感測,例如 egocentric raycast elevation grids;後續 Phase 3 則轉向高離地的 leaping gait,目標是讓機器人像青蛙一樣跳過全部物件,並持續迭代到視覺評估確實呈現跳躍動作。 來源:@GoogleDeepMind(回覆)|Gemini 3.7 Flash 在 Code Arena 的 Web development 基準測試中以 1588 分領先 Claude Sonnet 5、Gemini 3.6 Flash 等模型。 開發體驗 Googl…
-
199
OpenAI 預覽 Ultrafast mode,GPT-5.6 Sol 速度最高達 14 倍、每秒生成 750 個 token
OpenAI 預覽 Ultrafast mode,GPT-5.6 Sol 速度最高達 14 倍、每秒生成 750 個 token。 發布重點 OpenAI 於 2026 年 8 月 14 日分享 Ultrafast mode 的預覽,這是一種執行 GPT-5.6 Sol 的新服務級別,首波先在 OpenAI API 提供給少數客戶。Ultrafast 由 Cerebras 提供運算支援,目標是在不犧牲模型智慧程度的前提下,把回應速度帶進對時間極為敏感的企業工作流程;隨著可用容量增加,OpenAI 才會逐步擴大更多企業的存取權限。 速度與定位 OpenAI 表示,Ultrafast 讓 GPT-5.6 Sol 相較 Standard processing 最快成長為 14 倍,輸出速度最高可達每秒 750 個 token。這項預覽並非面向所有使用者的全面開放,而是先與一批企業客戶合作,觀察高速 frontier intelligence 在真實生產環境中最能創造哪些價值。企業若需要最高速度的模型服務,可透過Ultrafast 通知申請表登記,等待容量擴充。 鎖定場景 OpenAI 將 Ultrafast 放在「每一秒都可能影響結果」的產品與工作流程中,初步涵蓋: 即時語音與客戶支援:在對話不中斷的情況下,跨多個系統尋找答案並處理複雜問題。 商務與電商:使用者仍在考慮購買時,即時回答產品問題、查詢庫存、個人化推薦並處理結帳問題。 程式開發與設計:讓開發者更即時地與模型協作,減少等待回應造成的工作中斷。 金融研究與安全回應:在市場條件持續變動時分析訊號、評估交易與辨識可疑活動。 事故回應與可靠性:快速閱讀應用程式 log、近期程式碼變更與工程師報告,協助找出可能原因並準備修復方案。 研究與實驗:把原本需要隔夜執行、隔天查看結果的流程,縮短成工作時間內可反覆測試、調整與重跑的互動式 loop。 早期使用方式 OpenAI 內部團隊也用 Ultrafast 測試事故回應與研究工作。在系統告警觸發後,工程師可快速整理 log、trace 與對話內容,提出下一步檢查並協助準備或驗證修復;不過判斷與部署責任仍由工程師承擔。研究人員則能快速搜尋知識來源、呼叫資料工具、整理多個來源的資訊,讓實驗迭代從隔夜節奏轉向同一工作日內完成多輪嘗試。 影片中的補充觀察 貼文附帶的倉儲自動化模擬畫面,並非 OpenAI 公告中的正式效能規格;畫面顯示 5.6 Sol Ultrafast 與 5.6 Sol Standard 都在 1,536 平方公尺、12 個儲位、4 台搬運機器人的配置下執行任務。視覺上,Ultrafast 的機器人更快穿梭於貨架與輸送帶之間,較早顯示完成 30/30 任務;Standard 則在約 00:35 的畫面才顯示任務完成。這只能作為 demo 中的速度對比,不能直接解讀為官方公布的倉儲效能 benchmark。 5.6 Sol Ultrafast 與 5.6 Sol Standard 在倉儲自動化模擬中的效能與搬運速度對比 合作與後續 OpenAI 引述 Jane Street 的 John Crepezzi 表示,Cerebras 帶來的速度提升令人印象深刻,讓開發者能以更集中、更高生產力的方式使用模型。OpenAI 將根據首批客戶在程式開發、商務、金融研究、支援等互動式應用中的回饋,判斷速度成長為一個數量級後最具價值的工作流程,並據此規劃 Ultrafast 的後續部署。原文:https://easyvibecoding.app/curated/2962-openai-previews-ultrafast-gpt-5-6-sol-inference-14x
-
198
MiniMax 推出開放權重 MiniMax-Music3,生成最長五分鐘完整歌曲
MiniMax 推出開放權重 MiniMax-Music3,生成最長五分鐘完整歌曲。 MiniMax Music 3 的發表橫幅,背景為帶有羽毛紋理的紫色漸層,中央以白色字樣標示主標題與「Next-Generation Open-Weights Production-Ready & Versatile Music Model」副標題。 模型定位 MiniMax 透過 Hugging Face、GitHub 與 魔搭 分享模型。它可根據歌詞與音樂描述,生成最長五分鐘、32 kHz、16-bit 立體聲 WAV 完整歌曲,維持主題、節奏、人聲識別與編曲發展。 紫色背景宣傳海報,中央醒目顯示白色大字「MiniMax Music 3」,下方標註「Next-Generation Open-Weights Production-Ready & Versatile Music Model」產品定位說明。 控制方式 歌詞可加入 [Intro]、[Verse]、[Chorus]、[Bridge] 等段落標籤;音樂描述則指定曲風、情緒、人聲、樂器與製作風格。官方建議使用包含 Global Metadata、Vocal Details、Arrangement 的 Structured Caption,細化歌曲各段落的變化。 混合語言模型架構圖,上方顯示 Flow-Matching 與 Flow VAE Decoder 的 Synthesis 區塊,中間包含 Global LLM、Local LLM 與 Hidden state 和 Stop Token,下方則為 Structured Caption 與 Lyrics 的 Input Conditions 區塊。 技術架構 模型以 8B Global LLM 處理長距離結構,0.6B Local LLM 還原每個 frame 的聲學細節,再融合 hidden states,經過 Flow Matching(2.4B)與 Flow-VAE Decoder(123M)合成音訊。訓練 tokenizer 使用八層 RVQ,第一層有 16,384 個語意 codebook entries,其餘七層各有 1,024 個聲學 entries。 部署與操作 官方文件提供以下流程: 下載模型: `bash hf download MiniMaxAI/MiniMax-Music3 --local-dir /path/to/minimax_ttm ` 啟動 SGLang-Omni: `bash sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000 ` 呼叫 API 生成音訊: `bash curl http://127.0.0.1:8000/v1/audio/speech \ -H 'Content-Type: application/json' \ -d '{ "model": "MiniMaxAI/MiniMax-Music3", "input": "[Verse]\nMorning light filtering through the pine\n[Chorus]\nSoftly the world begins to breathe", "instructions": "A warm acoustic pop song with intimate female vocals, fingerpicked guitar, soft piano, and a gradual emotional build into a wide final chorus.", "response_format": "wav", "seed": 7, "maxnewtokens": 750, "stream": false }' \ --output minimax_music3.wav ` Prompt 強化與限制 music-caption-rewriter skill 可將簡短描述擴展成 Structured Caption,安裝指令為: `bash npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter ` 目前推論需要兩張 CUDA GPU,僅支援非串流生成;文字 prompt 上限為 5,000 tokens、音訊上限為 9,000 acoustic frames,段落標籤與描述只提供生成控制,無法保證完全符合指定速度、調性、歌詞或結構。原文:https://easyvibecoding.app/curated/2958-minimax-launches-open-weight-music-model-five-minute-songs
-
197
DeepSeek 推出 DeepSeek-V4-Pro;Arena.ai 以每百萬 token 輸入 0.435 美元、輸出 0.87 美元評估其 Agent 開發性價比
DeepSeek 推出 DeepSeek-V4-Pro;Arena.ai 以每百萬 token 輸入 0.435 美元、輸出 0.87 美元評估其 Agent 開發性價比。 產品更新 DeepSeek 表示,DeepSeek-V4-Pro 帶來多項面向生產環境的 Agent 升級,並讓使用者依任務複雜度調整 reasoning effort: low 適合簡單任務。 high 適合日常 Agent 工作流程。 max 適合複雜任務。 V4-Pro 與 V4-Flash 都支援這項設定。DeepSeek-V4-Pro 已在 app 與 web 版提供,使用者可透過「Expert Mode」啟用;API 也已開放,模型名稱維持不變,設定方式則需參考 API 文件。產品同時原生支援 OpenAI Responses API,並針對 Codex 提供一鍵設定。 API 定價 隨著 V4 系列推出,DeepSeek 將 API 定價改為區分尖峰與離峰時段。離峰價格比尖峰低 50%,官方認為這能讓使用者更彈性地安排工作負載。新價格將於 2026 年 8 月 16 日 16:00 UTC 起生效;原始公告未列出各模型的新單價,因此實際費率仍須以 API 文件為準。 DeepSeek-V4 系列 API 推出全新計費標準,引入尖峰與離峰差異化費率,其中離峰時段價格比尖峰時段降低 50%。 第三方評測 Vals AI 表示,DeepSeek V4 Pro 0813 在 Vals Index 上提升 11 分,成為排名第 2 的開放權重模型;每項任務成本約為 0.14 美元,價格約是 Kimi K3 的 1/17,而 Kimi K3 是唯一排名高於它的開放權重模型。 來源:@ValsAI(回覆)|DeepSeek V4 Pro 0813 在 Vals Index 以 66.25% 的準確率位居開放權重模型第二,每項測試成本僅 0.14 美元,成本約為唯一領先它的 Kimi K3 的 1/17。 Arena.ai 的 Code Arena: WebDev 初步結果則顯示: DeepSeek-V4-Pro(Max)得分 1607,整體約第 8 名,開放模型中排名第 2。 它落後 GPT-5.6 Sol(xHigh)的 1622 分,並低於 Kimi K3(Max)的 1674 分。 在 Text Arena 中,它以 1465 分約排名開放模型第 5,與 GLM-5.1 的 1467 分、GPT-5.6 Terra(xHigh)與 Grok 4.6(High)的 1464 分相當。 來源:@arena(回覆)|DeepSeek-V4-Pro (Max) 在 Text Arena 開放模型排行榜中獲得 1,465 分(AutoEval)位居第 5,與 GLM-5.1(1,467 分)等模型表現持平。 Arena.ai 特別提醒,以上是早期 AutoEval 分數,由使用 Arena 人類偏好資料訓練的 Reward Model 自動投票,並非即時真人票選;隨著更多真人票數加入,排名仍可能收斂或變動。 來源:@arena(回覆)|DeepSeek-V4-Pro (Max) 在 Code Arena: WebDev 中以 1607 分(AutoEval)排名整體約第 8 名(開放模型第 2 名),僅次於 GPT-5.6 Sol (xHigh) 的 1622 分。 價格效益 Arena.ai 指出,DeepSeek-V4-Pro(Max)目前在 Code Arena: WebDev 以每百萬 token 輸入 0.435 美元、輸出 0.87 美元的價格,擊敗部分更高價模型,包括輸入/輸出價格為 5/25 美元的 Opus 4.8,以及 1.4/4.4 美元的 GLM-5.2。Arena.ai 認為,這款即將推出的開放權重模型可能改變 WebDev 評測中的效能與價格邊界。 來源:@arena(回覆)|DeepSeek-V4-Pro (Max) 與其他模型在 Code Arena 的價格與 Arena Score 效率前緣比較。 Agent 程式開發 Cline 表示,DeepSeek 悄然釋出 V4-Pro 0813;相較 4 月的 Preview 模型,它在 Terminal Bench 提升 15.8%,並以約為 Fable 5 的 1/57 成本達到相近表現。Cline 列出的模型規模為 1.6T 個參數、49B 個 active parameters,以及 1M context。Cline 進一步稱它是目前市場上價格效能最佳的模型,但這仍屬 Cline 的評價,不能視為涵蓋所有任務與評測的普遍結論。 DeepSeek-V4-Pro-0813 與 GLM-5.2、Kimi-K3、Opus-4.8 及 Fable 5 等模型在多項基準測試的表現各有高低,其中 DeepSeek-V4-Pro-0813 在 Cybergym 與 AutomationBench (Public) 取得最高分。 來源:@cline(回覆)|V4-Pro 0813 在 Terminal-Bench 2.1 以 87.9 分居次,表現逼近 Fable 5(88.0 分),且價格僅為每百萬 token 輸入/輸出 $0.435 / $0.87。 ClinePass 方案 DeepSeek-V4-Pro 現已可透過 ClinePass 使用。Cline 將 ClinePass 定位為以約五分之一價格提供開放權重模型的訂閱服務,並稱在目前價格下幾乎可不限量使用;首月促銷價為 4.99 美元,之後每月 9.99 美元。Cline 提供的安裝指令如下,執行前仍應由使用者自行核對套件來源與權限: `bash npm i -g cline ` 方案頁面:ClinePass。 深色網格背景與紫色漸層光暈上的白色文字與圖示,中央偏左為帶有兩道垂直長條的機器人頭像造型 logo,右側為白色粗體文字 cline.bot。原文:https://easyvibecoding.app/curated/2959-deepseek-launches-deepseek-v4-pro-open-weights-agent
-
196
Agent Plugins 是 Agent Skills 的未來
Agent Plugins 是 Agent Skills 的未來 Agent Plugins 是一項開放、與供應商無關的標準,用來將 Agent Skills 以及它們所依賴的 MCP 伺服器封裝到同一個可攜式資料夾中,任何相容的客戶端都能載入。Google 將以 Core Maintainer 身分加入 Technical Steering Committee。發布文章涵蓋了公告內容,而規格則提供詳細資訊。以下是我們讓實際的 skill 採用這套標準後得到的心得。 Agent Skills 讓 Agent 能按需取得專業能力。它是一個由模型只在工作相符時才載入的指示資料夾,因此當你修正 CSS 錯誤時,context window 不會同時攜帶部署操作手冊。我們在 google/skills 程式庫,以及隨 Agents CLI 一起提供的七個 skill 中,都大量採用了這種方式。 Skills 始終沒有解決的是發佈與分發。 作者:@lavinigam,Google Cloud Developer Relations Engineer 展開畫面重點畫面標題為「Plugins are part of an ecosystem」,下方副標題為「Four independent layers」。左側標註「four independent layers」並以大括號涵蓋四個橫向長條區塊,每個區塊分為左側的動作標籤與右側的內容描述: Find it:Agentic Resource Discovery(底部帶有黃色裝飾線) Describe it:AI Catalog(底部帶有灰色裝飾線) Package it:Agent Plugins(藍色長條背景,搭配白色文字) Run it:MCP + Agent Skills(底部帶有綠色裝飾線) 最下方說明文字為「Adopting one never obligates you to the next」。 需要工具的 skill 會由兩個成品組成。指示放在 SKILL.md,工具則放在 MCP 伺服器中,但沒有任何東西能將兩者綁在一起。因此,綁定關係只能寫在 README 裡:把這個複製到這裡,再把那段 JSON 加到另一處,而且每個客戶端都要使用不同的片段。每個客戶端最後都自行發明 bundle 格式來解決這件事,於是作者只能先選一種格式,接著為下一種格式重新撰寫。 Agent Plugins 將這個封裝格式標準化。裡面的元件原本就具備可攜性。 當你的 skill 變成 plugin 後,會有以下變化;而且你其實已經完成了大部分工作: 你唯一缺少的那個檔案。你的資料夾結構本來就已經正確。 工具會和你的專業能力一起移動。mcp.json,以及能在移動後繼續運作的路徑。 元件會各自獨立失效。失效的伺服器不會拖垮你的 skill。 不需要分支,就能支援客戶端專屬行為。使用 extension namespace。 一個資料夾,所有客戶端都能使用。我們實際發布的內容,以及它真正能在哪裡執行。 你唯一缺少的那個檔案 如果你寫過 ADK skill,可以看看它目前的所在位置:skills//SKILL.md,底下再放 scripts/ / references/ / assets/。Agent Plugins 要求使用 skills//SKILL.md,並將該資料夾內部的內容交由 Agent Skills 規格處理。這是相同的樹狀結構。 以下是我們早已寫好的 skill,封裝時完全不需要修改: ` --- name: summarize-report description: Summarize a quarterly revenue report into an executive brief. Use when the user asks to summarize, condense, or brief a financial report. --- Summarize a revenue report Steps Fetch the report with the reports MCP server's fetch_report tool. Load references/house-style.md and follow its tone rules. Produce three sections: Headline, Numbers That Moved, Risks. Keep the brief under 300 words. Rules Never estimate a figure the report does not state. Quote every percentage with its comparison period. If a quarter is missing, say so rather than interpolating. ` 請注意 Steps 第 1 行的前提:MCP 伺服器必須正在執行。封裝要解決的正是這項相依性。 遷移只需要在根目錄新增一個檔案: `json { "$schema": "https://agent-plugins.org/schemas/1.0.0/plugin.schema.json", "name": "acme.reports" } ` 這兩個欄位都是必要欄位,而這就是最小需求。名稱長度必須介於 1 到 64 個字元之間,只能包含小寫英數字元、連字號和句點,且必須以英數字元開頭和結尾,也不能包含 -- 或 ...。因此 acme.reports 沒問題,但 My-Plugin、-start 和 has--double 都不符合規定。 準備好要發布,而不是只做測試時,manifest 也可以加入中繼資料。這個結構描述採封閉設計:只允許十個頂層欄位,不能有其他欄位(完整欄位參考)。 `json { "$schema": "https://agent-plugins.org/schemas/1.0.0/plugin.schema.json", "name": "acme.reports", "version": "1.2.0", "description": "Revenue reporting skills and the MCP server they call.", "author": { "name": "Acme Data", "url": "https://acme.example" }, "homepage": "https://acme.example/reports-plugin", "repository": "https://github.com/acme/reports-plugin", "license": "Apache-2.0", "keywords": ["reports", "finance", "bigquery"] } ` 這是十個欄位中的九個。最後一個是 extensions,用於放置客戶端專屬資料,稍後會再介紹。author 也可以選擇性加入 email。 version 應該使用 SemVer,license 則應該使用 SPDX;不過,如果字串格式不正確,客戶端不會因此拒絕你。JSON 型別錯誤則是另一回事:即使是選用欄位,該是字串的地方放了數字,也會造成致命錯誤。只有兩種結構描述違規不會造成致命錯誤:未知的頂層欄位,以及不是物件的 extensions 值。這兩者都會被回報並忽略,plugin 仍然可以載入。其他所有錯誤都是致命錯誤,客戶端會拒絕整個套件。 有一項規則常讓正在遷移大型 skill 程式庫的人踩雷。探索只會深入一層:客戶端會讀取 skills/ 的直接子資料夾,不會遞迴搜尋(探索規則)。如果你過去將 skill 分組放在分類資料夾中,那些 skill 在封裝後就會直接消失,而且不會有錯誤說明原因。 展開畫面重點畫面頂部標題:「You have already built most of one」 副標題:「A skill folder plus one manifest is a plugin」 左側方框內容:「Your skill folder」下方標示「skills/ + SKILL.md」,方框下方有綠色橫條。 中間有加號(+),接著是方框標示「plugin.json」,下方有黃色橫條。 右側有等號(=),接著是方框標示「An Agent Plugin」,下方有藍色橫條。 底部文字:「The migration is a single file.」…
-
195
Cursor Builds 讓 Cloud agents 啟動快三倍,失敗建置可回退
Cursor Builds 讓 Cloud agents 啟動快三倍,失敗建置可回退。 這項更新讓使用者更容易把複雜、耗時的工作交給 Agent 從頭執行到完成,同時降低環境故障中斷工作的風險。 產品重點 Builds 是 Cursor 在背景持續準備的可直接使用開發環境,無須額外付費。Cloud agents 啟動時不必重新開機、複製程式庫、安裝相依套件或執行安裝指令,而是直接進入已完成準備的環境,因此啟動時間可從數分鐘降至數秒。Cursor 表示,內部環境的啟動速度成長為十倍,取得第一個 token 的速度則達原本三倍。 Cloud agents 的速度與除錯功能展示畫面 可靠性設計 Cursor 也強調,Builds 不只是加速機制。若新的 commit、相依套件更新、Docker 建置或安裝指令造成環境失敗,該版本不會成為啟用環境;新的與既有的 session 會繼續使用最後一個成功的 build,團隊則能在背景除錯。影片示範中,畫面顯示某次 build 因 egress policy 變更而失敗,使用者可選擇手動修復或由 Agent 協助除錯,避免錯誤版本影響正在執行的工作。 anysphere/everysphere 專案在 Cloud Agents 介面下的 Environments 設定頁面,中央主區域顯示建置失敗的錯誤訊息與相關詳細資訊列表。 客戶採用 Cursor 表示,Faire、Headway 與 Descript 都看到 Agent 啟動時間從幾分鐘降至幾秒,並逐漸願意讓 Cloud agents 自主執行端到端任務。Faire 的 Senior Engineer Blair McAlpine 表示,團隊每週執行超過 2,000 次自動化 Agent 執行作業;導入 Builds 後,每次作業都能快速進入已確認正常的環境,最大且最複雜的程式庫也能在幾秒內啟動,失敗的 build 不會拖垮整個 Agent fleet。 可觀測性與管理 Cloud Agents dashboard 現在可查看每個環境的 Builds 分頁、類型、狀態、開始時間與版本資訊,也能檢視 build 詳細資料、記錄檔及其擷取的 commit SHA。系統還會把每次 Agent 執行與實際使用的 build 對應起來,並提供 git 狀態門檻,避免 Agent 從過度落後於預設 branch 的環境開始工作;Agent 也能透過內建的 Cursor Cloud MCP 檢查與管理 Builds。 Cursor 介面疊加了兩個帶有綠色虛線框的詳細說明視窗,左側視窗顯示後端測試的執行結果與 PASS 狀態,右側視窗則列出已開啟的 AWS EKS 主控台網址與相關檢查項目的勾選清單。 啟用方式與前提 既有環境可在 Cloud Agents dashboard 開啟環境後進入 Builds 分頁,選取「Enable Builds」;也可先選「Run setup agent」測試遷移並檢視建議的設定變更。由於 Builds 使用檔案系統快照,安裝指令應涵蓋可預先準備的相依套件;私有 registry 所需的 credential 應改用 team 或 environment secrets,使用者 secrets 會等 Agent 啟動時才加入。必須在 session 開始時取得最新狀態的服務,例如 Docker 容器或長時間執行的程序,仍應放在 start command 中。Cursor 表示,自 2026 年 8 月 17 日起,所有新舊環境都會預設使用 Builds,且不增加費用。Cloud agents 的速度與除錯功能展示畫面 影片中的 Prompt 與操作:操作步驟: 1. (00:13)點擊「Debug with Agent」按鈕原文:https://easyvibecoding.app/curated/2957-cursor-cloud-agents-builds-triple-speed-failed-build
-
194
DeepSeek AI 開放 DeepSeek Harness v0.1 Developer Preview,以 MIT 授權打造全插件式 Agent 執行環境
DeepSeek AI 開放 DeepSeek Harness v0.1 Developer Preview,以 MIT 授權打造全插件式 Agent 執行環境。 架構主張 DeepSeek Harness 的核心理念是「Everything is a plugin」:模型、工具、技能、工作階段、沙箱、檔案系統、迴圈、協調與 UI 全部以 plugin 實作。這些元件可以混搭、替換或延伸,讓開發者依需求組合 Agent 的執行環境。專案由 Cordis meta-framework 支援,該框架著重於讓不同元件能在時空維度上組合。 使用方式 官方提供以 npm 執行及從原始碼建置兩種方式。使用 npm 前須先安裝 Node.js,接著執行: `sh npx @deepseek-ai/dsh web ` 這會啟動 Web UI,預設在 http://127.0.0.1:3080 提供服務。 若要從程式庫建置,依序執行: `sh git clone https://github.com/deepseek-ai/deepseek-harness.git cd deepseek-harness pnpm install pnpm run build pnpm dsh web ` 預覽限制 README 明確警告,目前仍處於 developer preview,開發速度很快,未來會出現相容性破壞變更,因此不宜假設現有介面或 plugin 行為已經穩定。開發者可從 DeepSeek Harness GitHub 程式庫 取得程式碼,並透過 GitHub Discussions 回報問題或提供意見。原文:https://easyvibecoding.app/curated/2950-deepseek-launches-harness-developer-preview-plugin-agent
-
193
Claude in Chrome 推出跨裝置 Claude Cowork 工作階段,保留對話、skills 與 connectors
Claude in Chrome 推出跨裝置 Claude Cowork 工作階段,保留對話、skills 與 connectors。 功能與供應範圍 Claude 表示,Chrome 側欄現在執行的就是與桌面、網頁及行動版應用程式相同的 Claude Cowork session;session 綁定使用者帳戶,而不是單一裝置,因此可以在瀏覽器分頁開始工作,稍後再於其他裝置接續。功能目前提供給 Max 與 Team 方案,Pro 將在未來幾週陸續取得;引用的安全指南則補充,Enterprise 方案需由管理員在雲端啟用 Cowork 後,側欄才會使用 Cowork session。相關入口為 Claude in Chrome。 橘色背景的手繪風圖標,中央為兩個重疊的白色視窗,前方的視窗內有一個黑色勾勒的滑鼠游標。 實際操作示範 輔助影片顯示,使用者可從 Chrome 工具列開啟 Claude 側欄,輸入「Run my month-end close on these tabs. Pull each invoice and get it into the monthly report.」,讓 Claude 檢視多個分頁中的發票與對帳單,整理月結資料,再將結果填入 Google 試算表。畫面中的示範結果顯示 7 月總額為 $10,017.80,並標出 Print Co 123 的 $526.91 欠款、Utilities 費用成長 42%、Courier charges 上升,以及 Software Company $1,788 年度續約等待核對事項;側欄也顯示已傳送 July invoice log file。影片畫面曾出現「Opus 5 High」模型選單,這僅是 demo 畫面觀察,不能視為此次公告的正式模型規格。 Claude Cowork 在 Google Chrome 側欄執行月結作業的介面與操作畫面 安全風險 Claude 同時提醒,瀏覽器 Agent 會讀取網頁內容,因此可能遭遇藏在網站、email 或文件中的 prompt injection。惡意內容可能偽裝成待辦事項或正常指示,誘使 Claude 讀取銀行對帳單、傳送資料或執行其他非預期操作。Claude in Chrome 會用內容分類器檢查輸入內容,並在每次操作執行前評估風險;高風險行動可能被阻擋或暫停等待使用者核准,但官方明確表示攻擊成功機率並非零,仍可能發生資料外洩。系統會阻擋成人內容與已知盜版網站,進入金融網站前則會先徵求使用者同意。 ABC Property Management LLC 的月結單網頁畫面,左側顯示 2026 年 7 月 1 日發行、編號 APM-070126 的 Monthly Statement 與各項費用明細,右側則是 Claude 的對話側欄,正準備執行月結關帳工作流程。 資料暴露與防護 Claude 會擷取目前分頁的螢幕截圖,以理解網頁內容;畫面中可見的個人資料、機密文件與他人私密資訊,都可能成為對話的一部分。Claude in Chrome 不提供給受 HIPAA 規範的組織使用。官方也建議使用沒有敏感帳戶存取權的獨立瀏覽器設定檔,避免在金融、醫療、政府、法律文件或含有公司機密的網站開啟側欄,也不要用於股票交易、輸入敏感資料、繞過 CAPTCHA 或蒐集臉部影像。側欄 session 會儲存在歷史紀錄並可跨裝置重新開啟,因此使用者也應避免讓不想保存的內容出現在作用中的分頁。 網頁瀏覽器分頁中開啟 Google 日曆與右側對話介面,畫面中央彈出行程詳細資訊視窗,右側對話框顯示 Claude 正在執行行事曆審查指令。 使用建議與責任 Cowork 側欄預設採「Automatically approve」模式,由 Claude 自行檢查行動,只有需要核准時才暫停;若希望逐項檢查,可改用「Manually approve」。官方建議先從可信網站與簡單的研究、填表工作開始,對新網站或敏感任務逐一審查 Claude 的操作;若它突然談論無關主題、前往未預期網站或索取敏感資訊,應立即停止工作並透過對話中的回饋功能回報。Team 與 Enterprise 管理員則可使用允許清單、封鎖清單,以及組織層級的啟用/停用控制。即使 Anthropic 表示目前配置在結合已知有效攻擊手法的內部測試中,已將攻擊成功率降至低於 0.08%,瀏覽器中的所有發布訊息、購買、資料存取與修改,最終仍由使用者負責。 在瀏覽器視窗中並排顯示 Zillow 房地產搜尋網頁與右側的 Claude 對話側欄,左側地圖標示出西雅圖地區的房屋物件與價格標記,右側對話框顯示使用者尋找西雅圖 3 房低於 800k 美元房屋的指令以及正在執行的狀態。Claude Cowork 在 Google Chrome 側欄執行月結作業的介面與操作畫面 影片中的 Prompt 與操作:Prompt(00:11): 在這些分頁上執行我的月底關帳。抓取每一張發票,並將其放入月報中。原文:Run my month-end close on these tabs. Pull each invoice and get it into the monthly report.操作步驟: 1. (00:05)點擊瀏覽器右上角花朵圖示開啟 Claude 側欄 2. (00:11)在 Claude 側欄輸入框輸入指令並點擊送出按鈕 3. (00:30)側欄自動產生並在 Google 試算表中寫入 Invoice Log原文:https://easyvibecoding.app/curated/2949-claude-chrome-extends-cowork-cross-device-workflow-prompt
-
192
Qwen 團隊開放 Qwen3.8-2.4T-A95B 權重,支援 Agent 自主完成長流程開發與研究工作
Qwen 團隊開放 Qwen3.8-2.4T-A95B 權重,支援 Agent 自主完成長流程開發與研究工作。 這款模型總參數達 2.4T、每個 token 約啟用 95B,並提供可調整的 reasoning、平行 tool calls 與最長 1M context。 模型能力 ModelScope 將 Qwen3.8-Max 定位為 Qwen 迄今最大規模的 open-weight 模型,並列出多項自主工作成果: 在無人值守狀態下連續開發超過 10 天,從零打造可自我演進的 harness。 重現一篇研究論文後,執行 125 小時的 autonomous loop,並取得優於該論文結果的表現。 將晶片設計流程從 RTL 推進到 layout,宣稱將 die area 降低 81%。 來源:@SiliconFlowAI(回覆)|Qwen 3.8 Max 在 PaperBench(93.0)、ERQA(77.8)、PerceptionBench(63.5)、LVBench(81.8)與 OSWorld-Verified(86.1)等多項 Agent 評測中取得領先,而在 SWE-Pro 與 MobileWorld 則由 Fable5 取得最高分。 Qwen3.8-2.4T-A95B 的評測結果也集中在 Agent 實際工作負載:TerminalBench 2.1 為 86.6、PaperBench 為 93.0、CoWorkBench 為 74.8,OSWorld-Verified 則為 86.1。這些數字反映其目標不只是回答問題,而是處理 coding、研究與多步驟操作。 Qwen 3.8 Max 在 PaperBench (93.0)、OSWorld-Verified (86.1) 與 ERQA (77.8) 等多項基準測試取得領先,但在 SWE-Pro (67.7) 與 MobileWorld (77.8) 等項目落後於 Fable5。 架構設計 Hugging Face 模型文件指出,Qwen3.8-2.4T-A95B 採用混合 attention 的 Mixture-of-Experts(MoE)架構,共 92 層,其中 69 層使用 linear attention、23 層使用 full attention;模型配置 512 個 routed experts,每個 token 啟用 10 個,另有一個 shared expert。原生 context window 為 262K,可延伸至 1M,輸出長度最高 128K。 來源:@ClementDelangue(回覆)|Hugging Face 網站介面上 Qwen3.8-2.4T-A95B 模型頁面的標題與標籤區塊,顯示模型名稱、like 數與追蹤數,下方排列有 Text Generation、Transformers、Safetensors 等標籤。 這種設計是為了處理 Agent 工作流程持續累積的系統指示、工具輸出、檢索文件、程式碼、事件紀錄與推理軌跡。full attention 讓模型完整比較 token 關係,linear attention 則以受限的 recurrent state 取代持續增長的 KV cache,藉此控制長 context 下的計算量與記憶體需求。內建的 reasoning 控制提供 low、high、xhigh 三種層級,開發者可依任務在推理品質與吞吐量之間取捨。 部署與供應 Qwen3.8-2.4T-A95B 已同步在 Fireworks 與 SiliconFlow 提供服務,可從 Fireworks 開始建置。SiliconFlow 公布的價格為每 1M tokens:輸入 2 美元、輸出 6 美元、快取輸入 0.25 美元;模型頁面可從 SiliconFlow 試用。模型權重則可從 ModelScope 或 Hugging Face 取得。 來源:@FireworksAIHQ(回覆)|Fireworks 與 Qwen 的雙方品牌識別標誌並列,左側為紫色 Fireworks 字樣與圖示,右側為藍色 Qwen 字樣與圖示,中間有一道垂直分隔線,背景為白底帶有淡紫色漸層。 來源:@SiliconFlowAI(回覆)|SiliconFlow 宣布 Day-0 支援 Qwen3.8-2.4T-A95B,並開放模型上線使用,淡紫色漸層背景中央醒目顯示藍紫色的大標題與網站網址。 硬體效能 NVIDIA 表示,Qwen3.8-2.4T-A95B 在 NVIDIA GB300 NVL72、FP8 精度下,不需額外模型調校即可達到每張 GPU 超過 4K tokens/秒、每位使用者超過 350 tokens/秒。GB300 NVL72 將 72 張 NVIDIA Blackwell Ultra GPU 整合在同一平台,並透過 130 TB/s 的 NVIDIA NVLink 網域支援專家模型所需的高速互連;NVIDIA 也預期後續採用 NVFP4 精度後,效能仍可提升。 來源:@NVIDIAAP(回覆)|Qwen3.8-2.4T-A95B 在 NVIDIA GB300 NVL72 上展示吞吐量與每使用者 TPS(互動性)的權衡關係,最高吞吐量達到每 GPU 4,200 TPS。原文:https://easyvibecoding.app/curated/2943-modelscope-qwen3-8-max-weights-autonomous-agent-coding
-
191
shadcnlabs 推出 pdfcn:免費開源、可直接複製客製化的 React PDF 元件與樣板
shadcnlabs 推出 pdfcn:免費開源、可直接複製客製化的 React PDF 元件與樣板。 核心定位 Aniket Pawar 於 2026 年 8 月 13 日介紹 pdfcn,並邀請使用者前往官方網站試用,以及在GitHub 專案上給予 ⭐。pdfcn 建立在 Takumi 與 Forme 之上,支援 shadcn/ui 的 registry 格式與 CLI 工作流程,主打零設定與單一指令安裝;貼文指出目前提供 10 種以上主題、元件與 blocks,且全部免費、開放原始碼。 {s}/pdfcn 的產品標題畫面,深色背景中央帶有一透明長方形浮水印與大寫的 PDF 字樣,左上方印有白色的 {s}/pdfcn 產品名稱與「Beautiful PDFs, made simple.」副標題,右下角則標註「BY SHADCN-LABS.COM」。 功能與架構 pdfcn 將 PDF 生成功能拆成可組合的 React 元件,使用者可以選擇 Takumi 或 Forme 作為渲染基礎,再自行掌握產出的程式碼。文件提供即時預覽、共用主題與可調整的 props,適合建立發票、表單、報表、圖表與資料表等文件。官方文件也展示 Alert、Badge、Card、Data Table、Form、Graph、Heading、Keep Together、Page Header、QR Code、Signature、Table、Watermark 等元件,以及 Invoice 和 Report 類 blocks。 畫面展示 影片中的文件首頁以「Beautiful PDFs, made simple.」為主標,展示 Corporate Invoice、Financial report、Minimal invoice 與 keep-together 等樣板;Financial report 預覽包含圖表與風險摘要區塊,Minimal invoice 則可切換至 Code 檢視程式碼。畫面顯示的安裝方式包括: React 專案的 PDF 元件庫首頁及各項樣板與元件預覽介面 `bash npx dlx shadcn@latest add @pdfcn/takumi/heading npx dlx shadcn@latest registry add @pdfcn ` 這些指令屬於來源展示的操作方式,實際使用前仍應先核對官方文件與專案內容。 開源協作 專案採用 MIT 授權,README 邀請社群依序參與貢獻: Fork repository 建立功能 branch:git checkout -b feature/amazing-feature 建立 commit:git commit -m 'Add some amazing feature' 推送 branch:git push origin feature/amazing-feature 開啟 Pull RequestReact 專案的 PDF 元件庫首頁及各項樣板與元件預覽介面 影片中的 Prompt 與操作:操作步驟: 1. (00:07)點擊安裝指令並查看 Registry 對話方塊 2. (00:13)點擊右側 Components 列表檢視元件說明 3. (00:44)切換至 Code 檢視程式碼 4. (00:50)點擊 Get Started 進入文件頁面 5. (01:14)點擊側欄 Components 檢視元件清單 6. (02:16)點擊側欄 Blocks 檢視樣板清單原文:https://easyvibecoding.app/curated/2948-shadcnlabs-launches-pdfcn-open-source-react-pdf-components
-
190
Codex 活躍使用者突破 1,500 萬,Tibo 宣布約一小時內提供驚喜 reset
Codex 活躍使用者突破 1,500 萬,Tibo 宣布約一小時內提供驚喜 reset。 事件進展 Tibo(@thsottiaux)在 2026 年 8 月 13 日表示,這其實是幾天前的舊消息,但 Codex 已突破 1,500 萬活躍使用者;他提醒大家準備迎接 reset,並寫下「go /fast」。 承諾與後續 他在 8 月 12 日回顧,原先承諾 Codex 每增加 100 萬活躍使用者就 reset 一次,直到 1,000 萬為止。不過使用者數很快超過該門檻,團隊自突破 1,000 萬後便保持沉默,Tibo 因此預告隔天會帶來驚喜。原文:https://easyvibecoding.app/curated/2946-tibo-codex-active-users-surpass-15-million-reset-update
-
189
Microsoft AI 的 MAI-Thinking-1 進入公開預覽,256k token 長上下文支援企業推理與開發工作流程
Microsoft AI 的 MAI-Thinking-1 進入公開預覽,256k token 長上下文支援企業推理與開發工作流程。 Microsoft Developer 說明,這款模型面向複雜推理、程式開發工作流程與企業部署,並可透過 Microsoft Foundry 試用。 MAI-Thinking-1 模型的雲端服務推出公告,上方為多彩水彩風格的思考氣泡圖示 核心理念 Microsoft AI 將 MAI-Thinking-1 定位為中型推理模型,開發重點包括: 能力應由模型自行學會,而不是從其他模型繼承,因此未採用第三方模型蒸餾。 使用乾淨、可追溯且符合企業需求的資料,提升品質、來源可查性與控制力。 從模型設計、Microsoft 自有加速器到強化學習框架,建立自有訓練基礎設施。 官方將這套持續改善模型、資料、獎勵、環境與運算資源的流程稱為「Hill-Climbing Machine」,並表示這是邁向 Humanist Superintelligence 的一部分,目標是服務人與組織,而非取代人類。 模型表現 MAI-Thinking-1 採用稀疏 Mixture of Experts 架構,具備 35B-active、約 ~1T-total 參數,推論所需資源低於更大型模型。官方表示,它在 SWE-Bench Pro 上與 Claude Opus 4.6 表現相當;AIME 2025 得分 97.0%,AIME 2026 得分 94.5%。在與 Surge 合作、涵蓋 1,276 項單輪與多輪任務的盲測中,使用者偏好 MAI-Thinking-1 勝過 Sonnet 4.6。 企業能力 模型支援 256k token 的長 context window,約可容納 600 頁文件,也支援 function calling、開發者指示,以及廣泛使用的 Chat Completions API。Microsoft Foundry 同時提供整合式評估、可觀測性、安全性、部署、資安與法遵能力,主打品質、來源控管與成本效率。官方完整說明見 Introducing MAI-Thinking-1。原文:https://easyvibecoding.app/curated/2942-microsoft-ai-mai-thinking-1-reasoning-model-public-preview
-
188
Grok 4.6 – 一份實戰指南
Grok 4.6 – 一份實戰指南 Grok 4.6 上線了!我花了幾週時間,把它當成日常工作中的主要工具,處理一般的程式開發與知識工作,也特別用它做了幾個專案,想看看它在哪些地方能撐得住。 它各方面都做得不錯。最讓我印象深刻的,不是某一項能力有多大的躍進,而是它溝通的方式,以及它的速度。 高資訊密度的溝通 它很適合一起協作,並肩工作起來相當順手。摘要裡有大量真正有用的資訊,而不是把工作要求重新複述一遍;執行期間的簡短更新,也足以讓我知道現在是否需要介入。 在進行小幅變更時,它會保持安靜;等到開始處理大量檔案時,才會開始描述進度。要把這種分寸拿捏好,比你想像中需要更多調整。不過它偶爾還是會告訴我一些其實不需要知道的事情,這部分我們還在持續改善。 令人愉快的速度 4.5 其實也很快。4.6 不只快,還明顯更聰明,而這兩者結合起來,讓我更傾向採用同步的工作方式。與其一開始塞入大量 context,然後等待結果,我現在會先交代一個小任務,看看結果,再繼續往下做。只要開口要求,同一個 session 也能接著進入較長期的任務。 我會根據當月最好的模型擅長什麼,在同步與非同步之間切換。非同步工作能在我離開電腦時完成更多事情,但我會失去脈絡,最後只能在沒有前情的情況下,直接檢查一大份 diff。4.6 讓我重新偏向同步工作;如果我在意結果,這正是我比較希望採用的方式。 我也用 Remotion 為這兩個專案製作了一支 launch video!那幾週大多是一般的日常工作。它替我瀏覽網站,包括透過點擊 provider 的主控台來建立 API key。它也替正在執行的應用程式進行功能與視覺 QA。它把我的收件匣整理到只剩下幾個真正需要回覆的討論串,這種感覺永遠都很好。它還幫我草擬 Cursor SDK Bridge 和 /rename-chat 的 launch 貼文。 簡短提示詞,嚴格驗證 那幾週裡,我花了一部分時間比較不同的 prompting 風格。長提示詞與短提示詞之間的差異,以及像「work very hard」這類特定措辭是否會改變結果。我發現,措辭幾乎完全沒有影響。 長度確實有影響,但方式和我原本想的不一樣。長提示詞能換來更高的具體性,所以如果你確切知道自己想要什麼,就把它寫下來。短提示詞則會把更多決策交給模型自行判斷。過去,這種取捨會讓人傾向把所有事情都寫清楚。但 4.6 的判斷品味已經夠好了,通常只要一個短提示詞,再加上清楚的偏好,就能得到不錯的結果。 我給它一份詳細的 feedback widget 規格,包含工作階段擷取、伺服器端處理器和雲端 Agent 派送;它完整地端到端處理了整個專案,而且結構很合理。除非你要求它拆分元件,否則它確實會在不同元件中重複相同內容。手上有長規格時,長規格依然完全有效。 我做的其中一個專案是試算表應用程式,並且各自把同一個任務交給兩個模型兩次。第一次執行時,我提供了一份兩頁的規格,涵蓋我能想到的每個工具列項目、鍵盤快速鍵與公式。第二次則只給了三句話。 `text Build a polished Sheets/Excel-style app in Next.js and an AI chat that can analyze the sheet. Use the Cursor SDK for all AI features. Preload a realistic sample workbook so it looks good immediately. ` 兩個應用程式最後幾乎一模一樣。真正改變結果的,是多加了一句話: `text Verify the function and design after implementation, and keep on iterating and verifying until it's production ready. ` 那幾週裡,我找到最具槓桿效果的事情,就是這一行!加上這句後,模型會開啟應用程式,點擊實際的使用者操作路徑,確認巢狀公式是否正確計算,並修正它發現的問題。如果沒有穩定的瀏覽器操作能力,這些都無法運作,也就不可能形成這個迴圈。 當輸出比較難以檢查時,同樣的原則也成立。在 3D 場景上說「改善材質」完全沒有進展;但改成「擷取目前畫面、列出其中有哪些問題,然後只修正那些問題」,就立刻有效。 從這裡開始的每一次比較,都會在彼此隔離的 workspace 中,使用相同的提示詞交給兩個模型執行,因此後面的內容不是我對上個月結果的記憶。 Grok 4.5 介面中整合 Gridforge 試算表與右側 Gridforge AI 側欄的對照圖 展開畫面重點左側視窗標題顯示「Grok 4.5」,下方為 Gridforge 試算表介面,包含工作表名稱「Northwind Analytics – FY2026」、上方工具列(包含 AI 按鈕)、試算表儲存格內容(顯示 ARR 為 $5,136,000.00、MRR 為 $428,000.00 等財務指標)、左下角分頁標籤(Overview, Revenue, Funnel, Cohorts 等),以及右側的「Gridforge AI」側欄(標示「Cursor SDK - workbook-aware」),側欄內提供「Analyze workbook」、「Suggest formulas」、「Create chart idea」、「Presentation outline」等按鈕,以及輸入框文字「Ask about ARR, funnel conversion, cohorts, or request formula/chart/presentation help. Answers use the Cursor SDK when configured and cite workbook cells.」與底部輸入框。右側視窗標題顯示「Grok 4.6」,畫面為空白白色區域。 你也不需要告訴它要努力工作,或持續推進直到完成。它自己就會繼續執行一段不短的時間。更重要的是,你要說清楚「完成」代表什麼,否則它會替你決定。 進一步挑戰 我從小玩了多到不太合理的《世紀帝國 II》,累積了幾千個小時。所以我第一個想嘗試的專案,就是重現這款遊戲。我要求它製作一款瀏覽器策略遊戲,包含經濟系統、建造、戰鬥、戰爭迷霧、目標,以及一個新玩家不看說明也能讀懂的 HUD。 Grok 4.5 與 Grok 4.6 介面與遊戲畫面比較 展開畫面重點左側畫面標題為 Grok 4.5,上方顯示資源數值:木材 250、糧食 220、石材 120、人口 4/10,右上角顯示「HOMESTEAD AGE」。左側欄位為 OBJECTIVES(目標),包含: Gather wood near the Hall (已勾選) Build a Cottage for population (已勾選) Raise a Watch Barracks (已勾選) Train Spear-Guards (已勾選) Destroy the Raider Camp across the ford 下方中央為遊戲地圖,右下角為小地圖與操作提示(WASD / Drag pan、Scroll zoom、LMB select、RMB command、B build)。 右側畫面標題為 Grok 4.6,右上角播放控制列顯示暫停、播放倍速、時間 00:09 與 fps。上方顯示資源數值:木材 130、糧食 160、石材 80、礦石 60、人口 6/10。右側欄位為 OBJECTIVES(目標),包含: Stock the stores (Harvest 150 timber and 100 grain [lifetime gathered]) Raise the village (Complete 2 Cottages and a Yard.) Arm the vale (Field 6 Wardens or Slingers and research Bronze Edges.) Break the host (Raze the Cinder Outpost beyond the river.) 中央為等距視角遊戲畫面,帶有文字提示「Left-click a laborer or drag a box around your people.」。下方欄位左側為小地圖與「Vale map - click to pan」,中央為「NO SELECTION」與「Focus Hearthhall」按鈕,右側為「COMMANDS」(Select people or a hall to issue orders.)。底部顯示快捷鍵提示(LMB select、drag box、RMB command、WAS…
-
187
SpaceXAI 推出 Grok 4.6:每百萬輸入 token 2 美元、輸出 token 6 美元,提升長期 Agent 任務能力
SpaceXAI 推出 Grok 4.6:每百萬輸入 token 2 美元、輸出 token 6 美元,提升長期 Agent 任務能力。 可用管道 Grok 4.6 已於 2026 年 8 月 12 日推出,使用者可在 Grok Build、Cursor、Grok Bot 與 API 中使用,另已透過 OpenRouter、Vercel、Cloudflare 等合作夥伴提供。Cognition 也宣布將模型加入 Devin Desktop 與 Devin CLI。Cursor 與 Grok Build 在首週提供兩倍的包含用量;此外,官方提供速度更快、價格為兩倍的 fast variant。 主要能力 Grok 4.6 延續 Grok 4.5 的 500k token context window,並將重點放在需要多步驟持續工作的情境,包括研究主題、分析資訊、跨程式庫作業,以及把概念轉成可運作的應用程式或工作成果。官方表示,模型在較長的工作軌跡中會做更多自我測試與驗證,先檢查成果再繼續下一步。 面對寬泛的產品構想,Grok 4.6 能研究陌生領域、規劃應用程式結構、實作核心互動,並根據多輪回饋持續修正。 在視覺與互動專案上,它能先建立應用程式的結構與視覺語言,再透過 loop 逐步迭代。 Artificial Analysis 指出,Grok 4.6 在知識工作、終端機操作與客戶服務等 Agent 任務上表現強勁。 Devin 表示,Grok 4.6 特別擅長在修改程式碼前詳盡探索程式庫與分析根因,也能遵循 repo 慣例並嚴格測試。 評測結果 Artificial Analysis Intelligence Index 是由九項 benchmark 組成的綜合指標,Grok 4.6 得分 61,與 GPT-5.6 Sol 持平,落後 Claude Opus 5 的 63 分與 Claude Fable 5 的 62 分,略高於 Kimi K3。Grok 4.6 比一個多月前推出的 Grok 4.5 高 5 分;與 Grok 4.3 相比則高 23 分。 Grok 4.6 在 Artificial Analysis 智慧指數達到 61 分,與 GPT-5.6 Sol 持平;其他 Agent 與程式開發基準則各有高低。 在更具體的 Agent 評測中,Grok 4.6 的 GDPval-AA v2 Elo 為 1753,僅落後 Claude Opus 5,且與 Claude Fable 5 和 Qwen3.8 Max 的信賴區間重疊;𝜏³-Banking 得分 50.7%,接近 Qwen3.8 Max 的 51.3%;Terminal-Bench v2.1 得分 88.4%,與領先模型同一水準。Artificial Analysis 的私有長期 Agent 知識工作 benchmark AA-Briefcase 中,Grok 4.6 得到 Elo 1577,落後 Claude Opus 5 系列,但在評分規準、簡報呈現與分析品質上都維持穩定表現。 來源:@ArtificialAnlys(回覆)|Grok 4.6 (high) 相較於 Grok 4.5 獲得顯著提升,在 GDPval-AA v2、τ³-Banking 及 Terminal-Bench v2.1 各項基準測試中均位居頂尖前列並超越 GPT-5.6 Sol。 成本與效率 Grok 4.6 的標準價格維持在每 100 萬 input token 2 美元、output token 6 美元,與 Grok 4.5 相同。這比 Claude Opus 5 的 5/25 美元與 GPT-5.6 Sol 的 5/30 美元低 60% 以上;每項任務成本約 0.84 美元,與 Kimi K3 相同,但 Intelligence Index 略高,因此落在「智慧程度與單項任務成本」的 Pareto frontier。快取命中價格為每 100 萬 token 0.5 美元,高於 Grok 4.5 的 0.3 美元。 來源:@ArtificialAnlys(回覆)|Grok 4.6 在 Artificial Analysis Intelligence Index 獲得 61 分,達到與 GPT-5.6 Sol 相當的前沿水準,同時具備更低的每項任務成本。 在 AA-Briefcase 中,Grok 4.6 平均約以 53 個 turn、5 億個 input token 完成任務;Claude Opus 5(max)則約需 103 個 turn、20 億個 input token,顯示 Grok 4.6 在完成長期工作時具有較高的 turn 效率。 來源:@ArtificialAnlys(回覆)|Grok 4.6 (high) 在 AA-Briefcase Elo 取得 1577 分,較前代 Grok 4.5 (high) 的 1313 分大幅提升,超越 GPT-5.6 Sol 與 Kimi K3,僅次於 Claude Opus 5 (max)。 外部排行 Arena.ai 的 Code Arena: WebDev 排行顯示,Grok 4.6(High)以 1618 分排名第 7,明顯高於 Grok 4.5 的第 13 名與 1553 分;它與 GPT-5.6 Sol(xHigh)的 1622 分、Claude Fable 5 的 1627 分僅差 4 至 9 分,落在第 5 至第 7 名的密集區間。Arena.ai 也提醒,隨著更多投票加入、信賴區間收窄,排名仍可能變得更清楚。 來源:@arena(回覆)|Code Arena WebDev 排行榜,列出 Grok 4.6 排名第 7 的評比結果長條圖 訓練與安全 根據 SpaceXAI 的發布說明,Grok 4.6 採用比 Grok 4.5 更長的補充訓練,加入模型產生且經整理的推理與進階技術概念資料、高品質工程資料,以及改良的 optimizer 與訓練配方。團隊也使用 Grok 4.5 重新產生不同推理投入程度、Agent harness 與 STEM、軟體工程、知識工作領域的 SFT 軌跡,再以模型檢查排除問題軌跡;後續則以知識工作、一般程式開發、核心最佳化、Web 開發與電腦輔助設計等環境進行 Agentic RL 訓練。 來源:@cognition(回覆)|Grok 4.6 在 FrontierCode 1.1 Extended 取得 61.3 分,相較 Grok 4.5 大幅提升並超越 GPT-5.6 Sol,僅次於 Claude Opus 5 與 Claude Fable 5 SpaceXAI 表示,Grok 4.6 的安全防護已配合能力提升重新校準,並完成迄今範圍最廣的上市前能力與防護測試,也做了上市後及第三方測試;但這些仍屬發布方對訓練與安全性的說明,實際效果仍需持續觀察。 Grok 4.6 的深灰色背景標題畫面,中央以白字顯示版本名稱「Grok 4.6」,背景帶有細緻的顆粒質感與右側泛光的流動曲線光影。 來源:@ArtificialAnlys(回覆)|Grok 4.6 在 Artificial Analysis Intelligence Index 取得 61 分,較前代 Grok 4.5 提升 5 分並追平 GPT-5.6 Sol。原文:https://easyvibecoding.app/curated/2940-spacexai-grok-4-6-launches-agent-task-upgrade
-
186
OpenAI 推出 ChatGPT Linux 桌面應用程式預覽版,整合 ChatGPT、ChatGPT Work 與 Codex
OpenAI 推出 ChatGPT Linux 桌面應用程式預覽版,整合 ChatGPT、ChatGPT Work 與 Codex。 使用者可在支援的 Linux 系統中,於同一個桌面工作環境使用 ChatGPT、ChatGPT Work 與 Codex,並延續既有的專案、程式開發流程與瀏覽器工作流程。 支援範圍 目前預覽版適用於以下 Linux 發行版的桌面變體: Ubuntu 24.04 LTS 與 26.04 LTS Debian 13 Fedora 43 與 44 OpenAI 表示,安裝套件提供 .deb 與 .rpm 格式,並支援 x64 與 ARM64。官方貼文同時將使用者導向 Codex 相關頁面;OpenAI Developers 也說明,Codex 將整合進 Linux 版 ChatGPT 桌面應用程式,讓專案、開發流程與支援的瀏覽器工具集中在同一處。 桌面工作流程 影片展示了 ChatGPT 桌面版在 Linux 上的操作介面,畫面可見 Projects、Plugins、Codex、Pull requests 與 Sites 等入口。示範中,使用者以自然語言要求建立 hello_chatgpt.cpp,系統隨後產生一個可輸出「Hello, ChatGPT!」的 C++ 程式,並在介面中顯示檔案變更、Review 與 Undo 等操作。 ChatGPT 桌面版在 Linux 系統上的應用介面與工作流程展示 影片畫面顯示的程式碼如下: `cpp #include int main() { std::cout << "Hello, ChatGPT!\n"; return 0; } ` 畫面中另出現「5.6 Sol Medium」模型標示,但這只屬於影片中的介面觀察,原始貼文沒有將其說明為此次 Linux 預覽版的正式模型規格。 跨工具互動 影片進一步示範 ChatGPT 如何把完成程式的結果延伸到其他工作。使用者要求傳送 Slack 訊息給自己時,畫面顯示系統讀取 Slack outgoing-messaging skill、載入工具並辨識 Slack 身分,接著以私人訊息傳送「Small win」通知,內容提到已建立 hello_chatgpt.cpp、成功編譯,並確認程式能輸出預期結果。這是影片中的示範流程,不代表原始公告承諾所有帳號都具備相同整合權限。 文件與瀏覽器整合 接著,使用者要求建立 Google 文件記錄程式。影片顯示 Google Docs workflow 產生文件,內容涵蓋程式用途、原始碼、編譯與執行指令、預期輸出,以及驗證結果;文件也套用了標題與原生格式。之後,ChatGPT 透過 Chrome control workflow 將該文件開啟到使用者慣用的 Chrome 瀏覽器。整體示範的重點,是把程式建立、外部服務互動、文件整理與瀏覽器操作串成連續的 Agent 工作流程,但目前官方公告僅確認 Linux 桌面版與 Codex 預覽,未逐項保證影片中的每個 plugin 或外部服務整合均已全面開放。ChatGPT 桌面版在 Linux 系統上的應用介面與工作流程展示 影片中的 Prompt 與操作:Prompt(00:03): 寫一個 hello_chatgpt.cpp原文:Write a hello_chatgpt.cppPrompt(00:10): 傳送一則關於這個成就的 Slack 訊息給自己!原文:Send a slack message to myself about this achievement!Prompt(00:18): 建立一個 Google Doc 來記錄這段程式碼。原文:Create a Google Doc to document this code.Prompt(00:30): 同時在 Chrome 中開啟該文件原文:Also open the doc in Chrome操作步驟: 1. (00:03)點擊輸入框並輸入「Write a hello_chatgpt.cpp」後送出 2. (00:10)點擊輸入框並輸入「Send a slack message to myself about this achievement!」後送出 3. (00:18)點擊輸入框並輸入「Create a Google Doc to document this code.」後送出 4. (00:30)點擊輸入框並輸入「Also open the doc in Chrome」後送出原文:https://easyvibecoding.app/curated/2938-openai-launches-chatgpt-linux-desktop-preview
-
185
Grok Bot 推出 beta,能登入工作工具代辦任務並跨裝置回報進度
Grok Bot 推出 beta,能登入工作工具代辦任務並跨裝置回報進度。 使用者可以交辦任務後關閉電腦,再從其他地方查看進度或成果。 可執行工作 Grok Bot 的定位不是只提供問答,而是直接替使用者處理日常工作。Grok Bot 表示,已有使用者用它完成以下工作: 以語音方式與供應商協商。 管理線上商店的客戶支援。 持續更新 CRM,讓客戶資料維持最新狀態。 這種運作方式讓 bot 能登入各種工作工具,依照使用者平常的操作方式完成流程,再回傳結果;Krista Letz 也形容,自己在 Cursor 使用時,可以把工作交給配備電腦操作能力的 agents,互動感更接近團隊同事。 示範中的工作流 影片畫面展示 Grok Bot 如何處理跨工具任務。介面中出現 Meet Grok Bot,並以「每天分流數千封 email」描述其工作情境;另一段畫面則顯示使用者輸入 Watch me respond to email,接著點選 Teach a task 與 Learn from demonstration。Grok Bot 隨後回覆「Got it — watching the demo and turning it into a skill.」,顯示它能觀察示範流程,將操作整理成可重複使用的 skill。 使用者在筆電螢幕的 Grok Bot 介面操作教學與雲端工作執行 影片也示範了 Slack、Salesforce、LinkedIn、Figma 與 Notion 等工作場景,包括 Salesforce 的 Goal Tracking & Leaderboard v4 儀表板、LinkedIn 上的 SpaceXAI 檔案,以及 Figma 中 Krista's Bot「Olive」的介紹。畫面另出現 Website Maker 和 Copywriter 互相交接工作的對話:前者先建立 Brian's Lemonade 的初版,後者再表示頁面外框已準備完成。這些內容屬於影片中的操作與畫面觀察,不等同於官方完整功能清單。 跨裝置與 bot 協作 影片顯示 Grok Bot 可在筆電與手機上使用,並包含行動 App 介面、Slack 通知,以及 Notion 右側的 AI 對話窗。bot 清單中可見 Website Maker、Copywriter、Josh、Stan、Sarah、Ethan、Lauren、Dorothy、Katy、Michael 與 Andrew 等名稱,反映產品試圖把不同工作拆成多個可委派角色。畫面也出現 Morning Ping、Auto UI for one off 和 How to use e-mail 等捷徑。 一款名為 Chief of Staff 的工作協作介面,以三欄式桌面應用程式與右側手機畫面的佈局呈現,左側欄位列出多個具名 Agent 與對話列表,中央顯示與 Chief of Staff 的對話記錄,包含文字對話、檔案與 Slack 頻道連結,右側則展示對話對象的螢幕畫面與排程例行任務。 供應範圍與限制 Grok Bot 目前仍在 beta,2026 年 8 月 12 日起提供給桌面版與 iOS 上的 SuperGrok Heavy、Cursor Ultra、Cursor Teams Premium 訂閱者,產品頁面為 x.ai/bot 。Elon Musk 表示,團隊會先修正早期 beta 的基本問題,並在該週稍晚發布 Grok 4.6,之後才會擴大 beta。影片還顯示一段 Click "Log in with Okta SSO" on the newest Slack tab... 的操作指引;這涉及登入與第三方工具權限,應視為示範中的來源指令,實際執行前需人工核對,不宜直接照做。 早期回饋 Ben Lang 稱 Grok Bot 將是 2026 年的 AI 產品,並表示自己連續數週在工作與私人用途上使用,認為設定容易、適合作為日常工具;他特別驚訝於產品在內部快速擴散,稱自己從未見過類似情況。不過這些評價屬個人立場,不能取代 beta 階段的可靠性、安全性與實際效能驗證。使用者在筆電螢幕的 Grok Bot 介面操作教學與雲端工作執行 影片中的 Prompt 與操作:Prompt(00:49): 可以請你前往我的 LinkedIn 嗎原文:Can you please navigate to my LinkedIn操作步驟: 1. (00:06)點擊應用程式選單列的 Grok Bot 2. (00:30)點擊右上角 `Teach a task` 3. (00:32)點擊 `Learn from demonstration` 按鈕原文:https://easyvibecoding.app/curated/2928-spacexai-grok-bot-login-tools-complete-tasks
-
184
NVIDIA 攜手六大金融機構動員逾 5,000 億美元,為 AI factory 引入長期融資
NVIDIA 攜手六大金融機構動員逾 5,000 億美元,為 AI factory 引入長期融資。 核心轉變 NVIDIA 認為 AI 已從研究階段進入生產階段,運算不再只是成本,而是能直接支撐營收的生產資產。其論點是,AI factory 把能源與資料轉化為有價值的智慧,客戶涵蓋前沿 AI 實驗室、AI cloud、企業與國家,因此具備可持續的需求基礎。 資產特性 NVIDIA 強調,compute 並非單一晶片,而是包含 accelerated computing、網路、系統軟體、AI framework 與全球開發者生態系的完整平台。NVIDIA DSX AI factories 可執行語言、視覺、語音、生物、physical AI 與機器人等多種模型、模態和演算法;同一座 AI factory 也能服務多個客戶與工作負載,需求改變時還能轉交其他客戶、cloud 或營運商使用。 全球主要 cloud、系統製造商與企業都採用 NVIDIA 架構,形成廣泛的潛在使用者與接手市場,有助於維持設備的剩餘價值。 CUDA 持續改善既有基礎建設的效能、效率與總持有成本,讓硬體在使用期間能以更低成本產出更多 intelligence。 2020 年推出的 NVIDIA A100,到了六年後仍用於 AI 訓練、微調、推論與高效能運算;部分客戶持續承諾多年期部署,使其經濟壽命接近十年。 市場價格 NVIDIA 引用租賃市場數字,指出運算資產的經濟性仍具韌性:H100 一年期租賃價格從 2025 年 10 月每 GPU-hour 約 1.70 美元,上升至 2026 年 3 月約 2.35 美元;跨供應商隨選服務的中位數價格,則從 2025 年 10 月約 2.00 美元,上升至 2026 年 6 月的 2.70 美元。Blackwell 的 B200 cloud 租金約為每 GPU-hour 5.30 至 7.05 美元。NVIDIA 因此主張,AI factory 的價值不會在安裝時固定,而會因軟體升級、長期使用與重新部署而延續。 融資平台 這些合作將協助符合條件的 AI lab、企業與 AI cloud 取得大規模基礎建設。超過 5,000 億美元是各平台預計長期動員的第三方資本總額,不是 NVIDIA 的營收、單一基金,也不是對單一客戶的承諾。Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 與 KKR 將各自評估客戶、需求、使用率、現金流與剩餘價值;NVIDIA 提供 AI factory 平台,金融機構則提供長期資本與融資專業。 風險與疑問 NVIDIA 直接回應外界對「循環融資」的疑慮,表示需求來自前沿 AI lab、AI-native 新創、企業、cloud provider 與建置 AI 服務的國家,且每個專案都會由資本提供者獨立審核。不過,NVIDIA 在部分個案可能提供最高達該機會 25% 的剩餘價值支持,並強調這是逐案評估、以剩餘價值為基礎的有限機制,用來補充而非取代獨立承保;這仍代表 NVIDIA 將承擔一定風險。 投資回報 NVIDIA 將回報來源歸因於 AI 的實際效用:企業使用 AI 撰寫軟體、發現藥物、設計產品、服務客戶、自動化營運並建立新服務。其描述的正向循環是,更多 compute 帶來更好的 AI,更好的 AI 促成更多使用,使用增加產生更多營收,營收再推動更多 compute。NVIDIA 將 AI factory 定位為「智慧時代」的基礎建設,但這項願景能否被市場容量、客戶現金流與實際使用率支持,仍取決於各融資機構後續的獨立評估。原文:https://easyvibecoding.app/curated/2926-nvidia-financial-institutions-ai-factory-long-term-financing
-
183
OpenAI 推出 GPT-5.6-Cyber,進階資安請求完成率達 95.0%
OpenAI 推出 GPT-5.6-Cyber,進階資安請求完成率達 95.0%。 核心發布 Tibo 指出,資安威脅正在快速變化,OpenAI 因此推出新的 Daybreak Blue 與 Daybreak Red 存取層級,並提供 GPT-5.6-Cyber。對不確定如何開始的團隊,他建議聯絡合作夥伴,利用最新的資安模型尋找問題、快速修補、進行 pentesting 等工作。這些能力限定於經授權的資安用途,目標是在攻擊者大規模部署攻擊型 AI 前,先把前沿智慧交給可信任的防禦者。 來源:@OpenAI(回覆)|影片開場標題畫面顯示 OpenAI Daybreak 與資安防禦視窗縮小的主題文字 兩種存取層級 Daybreak Blue 是多數防禦團隊的建議起點,提供包含 GPT-5.6 Sol 在內的前沿模型,並針對廣泛的防禦工作調整防護機制,支援: 漏洞發現與管理 安全程式碼審查 惡意軟體分析 事件偵測與回應 修補程式驗證 資安評估 Daybreak Red 則面向具備經驗的防禦者,提供專門訓練的資安模型,包括 GPT-5.6-Cyber,用於經授權的漏洞研究、漏洞利用驗證與安全測試,特別是較複雜的資安挑戰。 來源:@gdb(回覆)|Codex Security 的防禦與紅隊演練模型介紹頁面,頂部標題為 Models for defense and red teaming,下方並排展示 Daybreak Blue 與 Daybreak Red 兩款針對防禦與紅隊測試設計的 AI 模型,並各自附帶文字說明。 GPT-5.6-Cyber 定位 引用來源說明,GPT-5.6-Cyber 建立在 GPT-5.6 Sol 上,針對尋找 zero-day 漏洞、建立 exploit chain 等專門任務訓練,並降低部分高風險、具雙重用途資安工作的拒答率。OpenAI 的內部 Advanced Cybersecurity Completion Rate 評測顯示,GPT-5.6-Cyber 能完成 95.0% 的進階資安請求;GPT-5.6 Sol 為 1.5%,透過 Daybreak Blue 使用時為 2.0%,GPT-5.5-Cyber 則為 57.3%。 來源:@OpenAI(回覆)|GPT-5.6-Cyber (Daybreak Red) 在高級網路安全任務完成率以約 95% 顯著領先其餘模型配置 實際研究成果 OpenAI 表示,GPT-5.6-Cyber 已用於真實漏洞研究,包括 Chrome 使用的 V8 JavaScript 引擎。研究人員發現兩個先前未知、可串聯造成記憶體破壞並逃逸 V8 heap sandbox 的漏洞,經驗證後透過協調式漏洞揭露通知 Google,最後其中一項被修補並編為 CVE-2026-15903。OpenAI 也提到,模型曾協助發現熱門行動作業系統至少五個漏洞、熱門資料庫三個重大漏洞,以及熱門作業系統核心超過 400 個可能導致權限提升的漏洞。GPT-5.6-Cyber 的早期合作夥伴包括 SpecterOps、SentinelOne 與 Palo Alto Networks。 來源:@OpenAI(回覆)|CVE-2026-15903 Discovered by GPT-5.6 Cyber 漏洞分析架構圖,以三個主要區塊展示 JIT Compiler Bug、V8 Heap Sandbox 以及 JSPI Stack Escape 的技術細節與利用流程,版面包含多個流程圖解與狀態標示。 能力仍有差異 評測結果並非全面勝出。GPT-5.6-Cyber 在 ExploitGym 優於 GPT-5.6 Sol 與 GPT-5.5-Cyber,也在 zero-day 發現與技術報告評測中,以 Daybreak Red 的表現優於 GPT-5.6 Sol;但在 Vulnerability Discovery and Report Writing 評測中,GPT-5.6-Cyber 反而不如 GPT-5.6 Sol,OpenAI 認為原因可能是它有時產生較短、細節較少的漏洞報告。在 ExploitBench 的標準 300 turns 設定中,GPT-5.6 Sol 以較高的 token 效率表現最佳;增加到 600 turns 後,兩者差距縮小。OpenAI 另表示,兩個模型的資安能力都達到 Preparedness Framework 的 High 門檻,但尚未達到 Critical。 存取限制與安全措施 Daybreak Blue 與 Daybreak Red 僅開放給執行經授權工作的個人與組織,並要求身分驗證、帳戶安全、行為監控、核准用途限制與法律聲明。OpenAI 也將從 2026 年 9 月 1 日起,要求 Daybreak 個人帳戶採用硬體安全金鑰,並鼓勵使用 Codex 的客戶從 full-access mode 改用 auto-review mode,由系統在需要提高權限前檢查工具呼叫,必要時阻擋具破壞風險的請求。官方建議將工作放在隔離的沙盒中、避免接觸敏感的正式環境或開放網路,並為 Agent 行動配置監控、人員覆核與明確的權限範圍。更多資訊可參考 OpenAI 的資安方案說明 與 Daybreak 擴大計畫。原文:https://easyvibecoding.app/curated/2900-openai-launches-gpt-5-6-cyber-advanced-security-requests-95
-
182
Manus 宣布恢復獨立營運,受影響使用者須於 8 月 23 日前備份資料
Manus 宣布恢復獨立營運,受影響使用者須於 8 月 23 日前備份資料。 這項措施源自 Manus 與 Meta 的分離,不是資料外洩或資安事件。 深灰色背景上置中顯示白色 Manus 品牌標誌,左側為一隻手指微彎並帶有放射線條的圖標,右側為 serif 字型的「manus」小寫英文字母。 受影響範圍 Manus 部落格說明,部分使用者在 2025 年 12 月 29 日 Meta 收購 Manus 後產生的資料,將於 2026 年 8 月 23 日上午 8:00 至 8 月 24 日期間(SGT)刪除。受影響帳戶預計會從 8 月 23 日至 24 日失去存取權;未受影響的使用者則不必採取任何行動,可照常使用 Manus。 使用者通知 Manus 會透過 email 與 Manus 應用程式通知受影響使用者,並在備份期限前多次提醒。使用 Apple ID 或 Facebook 帳號註冊者,由於 Manus 沒有其 email,必須查看應用程式內通知。使用者也能透過 Help Center 的指南確認帳戶是否受影響;未受影響者不會收到 email,但會看到應用程式內的確認通知。 備份與還原流程 受影響使用者應依序完成以下步驟: 在備份期限前,透過 backup restoration 工具備份資料。期限為 8 月 22 日晚上 7:59(EDT)、8 月 23 日凌晨 1:59(CEST),也就是 8 月 23 日上午 7:59(SGT)。 若完成備份後又產生新的 task 資料,需再次執行備份。工具支援多次備份,重複操作可確保最新資料一併保存。 備份期限結束後,帳戶將暫時無法存取,直到 8 月 24 日晚上 8:00(EDT)、8 月 25 日凌晨 2:00(CEST),也就是 8 月 25 日上午 8:00(SGT)開放還原入口。 入口開放後,還原先前備份的資料,即可回到原本的使用狀態。 Manus 1.6 Max 的介面展示,左側為行動裝置畫面,右側為顯示相同應用的桌機螢幕,介面中包含搜尋、專案、任務清單與對話輸入框。 費用與支援 受影響使用者在 8 月 11 日至 8 月 23 日(SGT)的資料備份期間不會被收費,完成還原後也會獲得 welcome back bonuses。Manus 表示客服全年無休、每天 24 小時提供協助,使用者可查看 Help Center 指南,或直接聯絡客服。 後續方向 Manus 將這次轉型描述為回到獨立營運的下一個階段,並表示目前正準備一系列新功能,目標是再次拓展通用 AI agent 的能力邊界。公司承認資料刪除與短暫停用會造成干擾,並以持續產品迭代與支援使用者作為後續承諾;更多背景可參考 完整部落格文章。原文:https://easyvibecoding.app/curated/2898-manus-resumes-independent-operations-users-backup-data
-
181
Claude 將黎曼 ζ 函式臨界線零點比例下界從 41.6% 推進至 67.2%
Claude 將黎曼 ζ 函式臨界線零點比例下界從 41.6% 推進至 67.2%。 這項成果源自一次原本要挑戰未解問題的嘗試,並已由人類數學家檢視、以 Lean 完成形式化證明。 核心成果 AnthropicAI 於 2026 年 8 月 11 日分享這項研究;前一天發布的研究文章指出,黎曼猜想自 1859 年提出至今仍未被證明或推翻,且設有 100 萬美元獎金。猜想主張,與質數分布有關的黎曼 ζ 函式非平凡零點,都位於 Re s = 1/2 這條垂直線上。Claude 沒有解決這個猜想,但在相關問題上取得進展: 已知位於臨界線上的零點比例下界,從 41.6% 提升至 67.2%。 Jarred Sumner 貼出的定理版本寫成:當 T < Im ρ ≤ 2T 時,至少 (2/3 − o(1)) 的非平凡零點位於 Re s = 1/2。 這超越了過去由 mollifier 方法得到的 5/12 紀錄;該問題曾由 Goldston–Suriajaya 在 2025 年 11 月的 arXiv 論文 arXiv:2511.20059 提出為開放問題。 來源:@jarredsumner(回覆)|深色背景對話框,內容為要求接續解 Riemann 猜想工作的 prompt,下方標註時間為 last week 並帶有複製與時鐘圖示。 Claude 的數學做法 Claude 並非從零創造整套理論,而是把既有成果接在一起。Jarred Sumner 特別強調,主要數學基礎來自 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 的近期研究,以及 Bombieri 於 2000 年發表的論文;Claude 的關鍵貢獻,是看出這些結果可以如何組合。Goldston 也檢視了這篇論文,Claude 則將證明形式化為 Lean 程式碼。 技術上,Claude 建立一個由 Weil 二次型誘導的函式空間,再分別處理臨界線上零點帶來的正定子空間,以及偏離臨界線的零點帶來的負定結構。它沒有逐一估算可能受偏離臨界線零點影響的複雜雙重和,而是對整個非對角二次型套用以秩、跡與一階/二階矩為核心的不等式,最後從矩陣的整體結構推出零點數量下界。 左右拼貼的平面設計圖,左側為米色背景印有密集的數字與手繪箭頭符號,右側上半為芥末黃色底紋,下半為白色網格紙背景,上方置有一支金屬製的圓規,左腳尖端為金屬針頭,右腳夾有鉛筆筆芯。 證明中的關鍵數據 Jarred Sumner 貼出的技術草稿,將矩陣 Ĝ 從兩個角度描述:一方面由 Weil 形式與零點構成,另一方面由顯式公式轉換成包含 Γ′/Γ 項與 n≤X 質數和的表達式。這個轉換的重要性在於,後者不含零點的實部 β,因此可直接取得整體大小,而不必假設每個零點項個別有界。 草稿列出的核心估計包括: tr Ĝ = (1+o(1))N ‖Ĝ‖²_F = (4/3+o(1))N 臨界線上的零點形成正半定矩陣 P,且 rank P ≤ s+o(N)。 偏離臨界線的零點以成對結構形成 Q,其正特徵值數量受偏離臨界線零點對數量限制。 Poisson 求和提供零點計數關係,控制 tr P + 2p。 高度落在 (T−√T, 2T+√T] 之外的誤差矩陣 E 滿足 ‖E‖₁ ≪ T^{−1/2}。 接著,Claude 使用一個適用於 Hermitian P⪰0 與一般 Q 的 rank–trace inequality,將 rank P 下界化。代入跡、Frobenius 範數、零點計數與誤差估計後,得到 (4 − 2 − 4/3 − o(1))·N = (2/3 − o(1))·N。這套推導的重點,是讓臨界線上的零點與偏離臨界線的零點同時留在同一個矩陣分析中;兩者可能各自很大、彼此抵消,但不必分開控制其個別大小。 拼貼風格的合成畫面,左側為米黃色背景的手寫數值與箭頭符號圖表,右側上下分為棕色紋理與白色方格紙,右側中央置有一支帶有刻度與鉛筆芯的金屬製圓規。 研究流程與人類角色 Anthropic 的研究文章指出,這項結果由未公開研究版本的 Claude 在兩個 Claude Code session 中完成,總計產生 3,100 萬個 output token。Jarred Sumner 在 2026 年 8 月 3 日前後重新嘗試,讓 Claude 對黎曼猜想「take a real stab」;先前一次單一 session 沒有進展,重新開始後,Claude 曾產生並測試 650 個想法,仍未成功,之後花一天半協調約 60 個 Claude subagents: subagents 執行 2,400 個 shell commands,撰寫數百個 Python scripts。 它們針對已知黎曼 ζ 函式零點進行數千次數值檢查,並互相審查推導。 Claude 搜尋反例、下載 54 篇 arXiv 論文確認成果未被先前研究提出,並從頭獨立重做證明。 Levent Alpöge 與 Ralph Furman 代表 Anthropic 檢查結果;Claude 也與 Eric Easley 合作完成 Lean formalization,並通過標準驗證工具 comparator。 成果的限制 Jarred Sumner 表示自己不是數學家,16 歲高中輟學,只修過約半學期的高二幾何,沒有對論文提供數學內容;他的主要作用是反覆鼓勵 Claude「keep going」或「believe in yourself」。Anthropic 也明確表示,Claude 使用的技術預期無法導向黎曼猜想本身的證明。因此,這次分享的重點不是宣稱 AI 已解決黎曼猜想,而是展示 Claude 如何在既有數學研究上找到新的組合方式,將相關零點比例的已知下界推進到 67.2%。原文:https://easyvibecoding.app/curated/2919-claude-advances-riemann-zeta-critical-line-zero-proportion
-
180
Black Forest Labs 推出 FLUX 3 Video,登上全球影片模型評比第二名並開放免費試用
Black Forest Labs 推出 FLUX 3 Video,登上全球影片模型評比第二名並開放免費試用。 排行榜表現 Arena.ai 表示,Black Forest Labs 上週推出首個影片模型 FLUX 3 Video,近期正在 Arena.ai 測試更新版本。該版本在 Text-to-Video Arena 取得 1,496 分,排名第二,距離第一名 Gemini Omni Flash 的 1,512 分僅差 16 分。畫面顯示的排行榜中,第三名為 Dreamina Seedance-2.0(1,478 分),其後依序包括 Muse Video(1,457 分)、MiniMax-H3(1,453 分)與 Happyhorse-1.0(1,428 分);這些名次與分數是排行榜畫面所示的評測結果。 來源:@arena(回覆)|Text-to-Video Arena 排行榜,FLUX 3 Video 名列第二 試用方式 Black Forest Labs 貼文提供 FLUX 3 Video 的 playground 免費試用入口:FLUX 3 Video playground 。免費期限以太平洋時間 8 月 16 日晚上 11:59 為止,使用者應以頁面實際狀態與時區換算結果為準。 FLUX 3 模型免費試用宣傳短片 其他評比 Black Forest Labs 另表示,Design Arena 也將 FLUX 3 Video 評為整體影片模型第二名,並連結至相關排名貼文:Design Arena 排名貼文 。目前官方用語仍是「即將推出」更新版本,顯示 1,496 分的版本與後續正式提供時間尚未完全確認。 產品方向 Black Forest Labs 將這次排名視為起點,而非功能終點。其預告的 4K 輸出、影片編輯、多圖片與影片參考輸入,分別指向更高解析度、更完整的後製流程,以及讓生成結果更能依照既有素材維持視覺一致性;不過貼文尚未提供這些功能的發布日期、方案限制或技術規格。原文:https://easyvibecoding.app/curated/2901-black-forest-labs-flux-3-video-free-trial
-
179
eric zakariasson 打造 Gloss,讓使用者用 prompt 重新設計任何網站的視覺風格
eric zakariasson 打造 Gloss,讓使用者用 prompt 重新設計任何網站的視覺風格。 它可將頁面改成禪、inverse 或 holiday themed 等風格;影片示範中,輸入「make this brutalist」後,社交平台頁面逐步套用粗體線框與 Raw-kraft paper 風格。 在 Gloss 浮動側欄輸入指令,將頁面轉為 brutalist 風格 運作方式 Gloss 是一款以浮動 orb 操作的 Chrome extension,會擷取目前頁面的螢幕畫面與簡化 DOM 資訊,連同 prompt 傳送至 xAI Grok API,再串流注入 CSS,必要時也執行 JavaScript。使用者可以持續 prompt,每次都以新畫面反覆調整;變更會依網站保留,直到按下 Reset。程式碼與設定位於 Gloss。 限制與風險 Gloss 目前不是 Chrome Web Store 擴充功能,必須以 load-unpacked 方式安裝,因為 Chrome 禁止執行模型產生的 JavaScript。每次改造都會把可見分頁的螢幕畫面、URL、標題、頁面地標與可見標籤傳至 api.x.ai;API key 儲存在 chrome.storage.local,並只會以 Bearer token 傳給 xAI。模型產生的 JavaScript 會在頁面中執行,因此登入中或含敏感資料的網站不宜直接使用,相關行為需人工核對。 模型設定 專案預設使用 grok-4.5;若 API key 無法使用該版本,來源建議改用 grok-4.3。在 Gloss 浮動側欄輸入指令,將頁面轉為 brutalist 風格 影片中的 Prompt 與操作:Prompt(00:01): 將這個設計改為粗獷主義風格原文:make this brutalist操作步驟: 1. (00:03)點擊 Gloss 按鈕送出 prompt原文:https://easyvibecoding.app/curated/2892-eric-zakariasson-gloss-redesign-websites-prompt-visual-style
-
178
Spotify Engineering 發布 Xirp,集中管理 Claude Code、Gemini CLI 與 OpenAI Codex 的 Agent session
Spotify Engineering 發布 Xirp,集中管理 Claude Code、Gemini CLI 與 OpenAI Codex 的 Agent session。 詳細資訊見 Xirp 官方介紹。 核心功能 Xirp 的重點是讓團隊在不同 agent 與模型之間切換,而不必每次重新建立工作環境。Spotify Engineering 分享的功能包括: 同時管理多個 agent session,並支援跨工具協作。 每個 session 使用獨立 worktree,讓多個 agent 能在同一個程式碼庫平行工作,降低互相干擾。 將工作 context 從單一 Agent 或執行框架中分離,使用者可在專案進行中更換工具,並保留完整工作狀態。 依任務需求選擇模型與價格效能,也能使用自行託管的開放原始碼模型,降低供應商綁定與遷移成本。 Xirp 平台的 Sessions 介面,左側欄顯示多個專案群組與 session 清單,主畫面則呈現 Claude Code v2.1.41 的歡迎畫面與輸入提示列。 Spotify 的使用經驗 Spotify 工程團隊指出,AI coding agent 從單一 session 擴展到大量平行工作後,CLAUDE.md、個人 MCP 設定與 prompt library 等資訊容易分散,造成重複探索、token 浪費、返工與成果不一致。Tyson Singer 在 Spotify Engineering 文章 中表示,Spotify 內部已有數千名工程師採用 Xirp,累計超過 36,000 個 session,並觀察到更快的 context 切換與成本效益。 Xirp 介面的 medvault-docs 專案 Sessions 頁面,左側欄顯示 A-FRIENDLY-API 與 CLAIMS-PROCESSOR 分組下的 session 列表與狀態,右側則顯示針對專案提問的對話介面與檢索結果摘要。 Xirp 與 Portal Xirp 可獨立處理多 agent 協作;連接 Portal 後,每個 session 會從軟體目錄取得元件架構、依賴關係、所有權與架構決策等組織 context。session 結束後,逐字稿與中繼資料也會回到 Portal,讓團隊掌握工作進度,並讓其他工程師或 agent 接續未完成的工作。Portal 也能集中管理各團隊建立的 skill、規則、plugin 與 MCP 設定。 Spotify Portal 的 Workspace 頁面,顯示 Podcasts 專案的詳細資訊、狀態、成員頭像清單與包含 10 個 Sessions 的列表。 畫面觀察 示範影片顯示 Xirp 同時呈現 Claude Code、Gemini 與 Codex 的終端機工作階段,並以側欄列出多個 Sessions、右側顯示執行日誌;畫面另出現 Claude Code v1.1.26、OpenAI Codex v0.1.0 與 Fable 5 的資訊,但這些屬於示範畫面內容,不宜視為 Xirp 的正式版本或規格公告。 列出 10 個 session 的列表介面,依時間倒序列出包含 Jules W.、Oliver R.、Magda R. 與 Pia T. 的項目與對應時間差與模型版本。 Xirp 跨 Agent 管理工具介面Xirp 跨 Agent 管理工具介面 影片中的 Prompt 與操作:操作步驟: 1. (00:03)啟動 Claude Code 工作階段 2. (00:05)執行 OpenAI Codex 3. (00:06)啟動 Gemini 工作階段 4. (00:20)輸入 /Refactor this component to comply with our coding standards 5. (00:30)於 Xirp 介面切換 Sessions 與查看 parallel work 執行狀態原文:https://easyvibecoding.app/curated/2891-spotify-engineering-launches-xirp-agent-session-manager
-
177
Meta 推出 Muse Glimmer:30B 開放權重模型在本機完成多步驟 Agent 任務
Meta 推出 Muse Glimmer:30B 開放權重模型在本機完成多步驟 Agent 任務。 Muse Glimmer 的發表橫幅,黑色背景上佈滿發光的藍色網格節點與連線,左上方以白色粗體標示主標題與副標題說明其為針對常時運作 local agent workflows 所最佳化的 open-weight model。 核心發布 AI at Meta 表示,Muse Glimmer 在同尺寸模型中,針對 Agentic 程式開發、工具呼叫與多步驟任務等用途具備良好表現,模型權重採 Apache 2.0 寬鬆授權,開發者可從 Hugging Face 下載。 本機執行 為了讓模型在消費級硬體上維持回應速度,Meta 以量化技術將語言模型壓縮到 20GB 以下,並搭配輕量的 DFlash drafter model 加速 token 生成。完整精度的 30B 參數模型需要超過 55GB 記憶體;量化至約 4-bit 後,模型可在 24GB 或 32GB 記憶體配置中,與 KV cache、影像理解用的 perception encoder 及 drafter 同時運作。Meta 表示,這項壓縮對 Agent 任務的品質幾乎沒有影響,K-Quant-17GB 模型搭配量化 DFlash drafter 後,已在 MacBook M4-Max、M5-Max 與 RTX-5090 上驗證,可支援流暢對話與即時互動。 DFlash 在 RTX-5090、M5-Max 與 M4-Max 平台上分別實現 3.1x、1.8x 及 1.5x 的解碼速度提升,於 RTX-5090 達到最高 233 tok/s 單一 prompt 完成任務 Muse Glimmer 的展示重點,是從一段自然語言 prompt 端到端完成多步驟工作。示範情境是在 Raspberry Pi 的區域網路上安裝 Home Assistant,模型先探索本機的 Home Assistant 執行個體,再透過網路工具呼叫查詢裝置 API,找出 A/V 接收器,接著從零撰寫 HTML、CSS 與 JavaScript 儀表板,啟動本機伺服器並以瀏覽器驗證結果。畫面中的待辦事項涵蓋探索執行個體、辨識接收器、設計響應式介面、建置儀表板,以及測試功能與適應性;最後產生「RX-V6A Receiver」介面,包含電源與音量、來源、音效模式及 Zone 2 控制項,並顯示已連線。 終端機介面中執行 Muse Glimmer 以進行 A/V 接收器儀表板任務的畫面 互動過程與風險 媒體畫面顯示,homeassistant.local 初次解析失敗後,Agent 改用服務探索、網路介面資訊與區域網路主機探測尋找 Home Assistant。當需要存取 API 時,系統要求使用者提供 long-lived access token 或接收器 entity ID,之後以 $HA_TOKEN 讀取 token。畫面也出現含帳號密碼的 API 呼叫、SSH 與略過主機金鑰檢查等高風險來源指令;這些僅是 demo 中的觀察,不代表可直接照做,涉及憑證、SSH 或略過安全檢查的操作都必須由人工核對,且不應在對話中貼上真實 token 或私密憑證。 模型能力 技術文章指出,Muse Glimmer 以較大型教師模型 Muse Spark 的輸出進行 logit distillation,接著使用更長 context、更多 Agent 資料與推理軌跡進行 mid-training,最後結合監督式微調、on-policy distillation 與 reinforcement learning。它評估的能力包括: 端到端完成 DeepSearch QA、MCP-Atlas、𝛕-Bench 與 SWE-Bench 等完整任務。 在長流程中精確呼叫工具,並在工具失敗或回傳意外結果時診斷、重試。 透過 perception encoder 同時理解文字與影像,可處理螢幕截圖、圖表及文件。 相容 OpenClaw 等 Agent orchestration 模式,支援可控制的推理強度與超過 100 種語言。 Muse Glimmer-30B 在多項關鍵 Agent 基準測試中展現出強勁的效能,與同參數級別的模型 Gemma4-31B 及 Qwen3.6-27B 相比表現優異 開發與部署 模型目前提供 Hugging Face 權重與開發文件;Meta 表示,llama.cpp、MLX 與 ExecuTorch 的最佳化整合將於未來幾天推出,後續也可透過 Ollama、LM Studio、Unsloth、vLLM、SGLang,以及 Together AI、Fireworks AI、OpenRouter 等管道使用。Meta 另與 AMD、Arm、Dell、Intel 和 NVIDIA 合作最佳化硬體效能,技術細節可參閱官方技術文章與 Meta AI Developer Center 資源。終端機介面中執行 Muse Glimmer 以進行 A/V 接收器儀表板任務的畫面 影片中的 Prompt 與操作:Prompt(00:00): 我剛在自己家裡的網路環境中,於 Raspberry Pi 上安裝了 Home Assistant。請幫我找出並協助建立一個完全自訂的儀表板,來控制與其連接的 a/v 接收器。這個儀表板必須具備響應式設計、簡潔的外觀與質感,且要便於使用。原文:I just installed Home Assistant on a Raspberry Pi on my home network. Find in and help me build a fully custom dashboard to control the a/v receiver that is connected to it. The dashboard should be responsive, have a clean look and feel and be easy to use.原文:https://easyvibecoding.app/curated/2894-meta-muse-glimmer-open-weight-model-agent-tasks
-
176
Tibo 重置 ChatGPT Work 與 Codex 全體付費使用者額度,主張 harness 可自由選模型
Tibo 重置 ChatGPT Work 與 Codex 全體付費使用者額度,主張 harness 可自由選模型。 harness 自由 Tibo 表示,GPT-5.6 Sol 幾乎可在各種環境使用,包括 Claude Code(CC)harness;使用者也應能自行決定哪個 model 最適合自己。Boris Cherny 回應稱,Anthropic 不會因使用其他 model 的 harness 而封禁使用者;這次事件幾乎確定是其他帳號分類器觸發,他正進一步調查。 後續動向 Tibo 表示問題已解決,也因熱愛目前的團隊、期待接下來幾週的發布而不會轉職。Boris Cherny 此前則邀請他加入 Anthropic。原文:https://easyvibecoding.app/curated/2881-tibo-resets-work-codex-limits-harness-choice
-
175
xAI 發布 Imagine Image 2.0,影像生圖與編輯 Arena 均排名全球第 2
xAI 發布 Imagine Image 2.0,影像生圖與編輯 Arena 均排名全球第 2。 Grok 表示,這款新模型不只適合生成圖片,也能處理資訊圖表、廣告、遊戲 asset、UI/UX mockup 與分鏡圖等工作。 發布與可用性 Imagine Image 2.0 於 2026 年 8 月 8 日由 Grok 公布,現已在 grok.com/imagine 以新的 Quality Mode 提供使用,並支援 iOS 與 Android 應用程式。官方將它定位為「能用於實際工作的影像模型」,強調模型會更貼近 prompt 的細節,改善排版與文字呈現,也提高生成結果的事實性與實用性。API 目前尚未開放;Grok 表示 API access coming soon,Arena 也確認目前只能在應用程式中使用。 來源:@grok(回覆)|Grok Imagine Image 2.0 發表宣傳與圖像生成範例 精準編輯工具 新版本把局部修改作為核心能力,讓使用者只改動指定區域,盡量保留畫面的其他內容: Magic Wand 只修改使用者指向的區域,例如改變提袋的材質或風格。 Segmentation 可選取影像中的精確範圍,替換家具、物件或場景元素。 Smart Resize 依照指定長寬比重新調整畫面,模型會補足延伸出的內容。 Background removal 可移除背景,輸出帶透明背景的主體。 Multi-ref editing 單次生成最多接受 5 張輸入影像,減少手動合成的需求。 來源:@grok(回覆)|Grok Imagine 2.0 的精確編輯功能操作介面,展示局部修改與智慧比例調整。 宣傳影片展示了這些功能的操作情境,包括把矮凳替換成躺著的金毛尋回犬、將扶手椅改成其他樣式,以及把同一個客廳延伸成多種畫面比例。影片也展示資訊圖表、UI/UX 工作區、遊戲 asset 和 storyboards 等產出類型;這些屬於宣傳展示中的範例,不等同於額外公布的規格。 Arena 評測表現 Arena.ai 的資料顯示,Grok Imagine Image 2.0 (Low) 在 Text-to-Image Arena 以 1320 分首次登上第 2 名;前一代 Grok Imagine Image Quality 原本排名第 14。在 Image Edit Arena 中,Image 2.0 (Low) 以 1439 分同樣排名第 2;前一代原本排名第 7。 來源:@arena(回覆)|Grok Imagine Image 2.0 (Low) 以 1,320 分登上 Text-to-Image Arena 排行榜第二名。 來源:@arena(回覆)|Grok Imagine Image 2.0 (Low) 在 Image Edit Arena 排行榜中以 1,439 分獲得全球第二名。 分類表現方面,文字生圖在 Product、Branding & Commercial Design 排名第 3,並在 Art、Portraits、Text Rendering、Cartoon, Anime & Fantasy,以及 Photorealistic & Cinematic Imagery 等分類排名第 2。影像編輯則除了 Art 尚待更多票數累積外,其餘分類都排名第 2。這些名次是 Arena 的群眾評測結果,反映相對排名,不代表所有工作情境下都能取得相同品質。 延伸工作流程 引用的官方說明指出,Imagine Image 2.0 也提供針對常見任務預先配置的 templates,涵蓋照片編輯、產品拍攝、headshots、圖示與遊戲 asset。模型亦能根據少量 prompt 分別生成角色、場景與道具,讓多張影像維持一致風格,作為建立影片世界觀的基礎。整體方向是把影像生成從一次性產出,推向可反覆編輯、調整比例並整合到設計流程的工作工具。Grok Imagine 2.0 的精確編輯功能操作介面,展示局部修改與智慧比例調整。 影片中的 Prompt 與操作:操作步驟: 1. (00:05)點擊褐色提袋並套用材質變更 2. (00:10)點擊牆上畫作與家具物件 3. (00:19)點擊綠色矮凳並替換為睡覺的狗原文:https://easyvibecoding.app/curated/2875-grok-imagine-image-2-0-precise-editing-clear-text
-
174
Claude Code 將 Auto mode 設為 Pro、Max 與 Team 預設,危險指令攔截率達 89%
Claude Code 將 Auto mode 設為 Pro、Max 與 Team 預設,危險指令攔截率達 89%。 預設模式變更 ClaudeDevs 表示,8 月 14 日起,Pro、Max 與 Team 的新 session 將預設使用 auto mode。這項變更主要有兩個目的:在安全測試中,auto mode 在所有追蹤的安全指標上都達到或超越人工審核;同時減少 Claude Code 執行長時間任務時,因每次 tool call 都等待使用者核准而中斷的情況。若使用者已自行設定預設權限模式,Claude Code 會先顯示一次通知並詢問是否切換;若管理員已釘選預設值,則不會變更。 安全機制與測試結果 auto mode 不會直接放行 Claude 的操作。既有 permission rules 仍會先執行;只有寬到足以授予任意程式碼執行權限的 allow rules 會在 auto mode 中暫時擱置,再由 classifier 檢查每次 tool call 是否具備不可逆、破壞性,或可能把行動帶到使用者環境之外的風險。被攔截後,Claude 通常會自行尋找較安全的做法或向使用者要求許可;hard deny 類動作則必須先退出 auto mode,或由使用者手動執行。若連續遭到 3 次攔截,或單一 session 累計 20 次攔截,Claude Code 會退回人工核准流程。 Anthropic 以 1,053 名付費測試者進行受控研究:測試者看到一個被替換成明顯危險指令的 permission prompt,但實際上不會執行任何危險操作。人工審核只辨識出 13.6% 的危險指令,亦即 1,053 次中有 143 次;auto mode 則攔截 89%,即 937 次。 對照結果顯示,auto mode 攔下 800 個人類使用者核准的危險指令,而人類只攔下 6 個 auto mode 放行的指令。當 session 變長、使用者已經看過 50 個以上的 prompt 後,人工辨識率約降至 5%,auto mode 的攔截率則維持穩定。 Auto mode 以 89% 的有害行為攔截率遠高於人工審查(Human review)的 13.6%。 長時間自主工作 ClaudeDevs 認為,auto mode 特別適合 Claude Opus 5 這類擅長長時間任務的 model。使用者可以在背景啟動一個或多個平行任務,數小時後再回來檢查已完成的 PR,而不必持續看守權限提示。貼文也指出,auto mode classifier 每次 tool call 只會使用少量額外 token;自公告日起,這部分開銷不再計入 Pro、Max 與 Team 的使用量限制。Enterprise 與 API 使用者則要等 auto mode 成為其預設模式後,才會採用相同安排。 來源:@bcherny(回覆)|Opus 5 在 Gray Swan IPI benchmark 的間接 prompt 注入防護測試中取得最佳防禦表現,k=15 攻擊成功率僅 2.0% 使用方式與管理控制 使用者隨時可以按下 Shift+Tab 切換模式。企業管理員可在 managed settings 中釘選 defaultMode,也能以 disableAutoMode 完全停用 auto mode。引用來源補充指出,Enterprise、Claude API、Claude Platform on AWS、Amazon Bedrock、Google Cloud's Agent Platform 與 Microsoft Foundry 目前仍維持 opt-in,預計在接下來一個月逐步改為預設。即使 Anthropic 認為 auto mode 能降低多數情境的風險,官方仍建議對正式環境基礎設施的高風險變更自行檢查,因為分類系統無法消除所有風險。 引用來源補充的安全案例 Anthropic 的文章將 auto mode 描述為多層防禦的一部分,包括檢查外部網頁、檔案內容與 tool output 是否含有 prompt injection,辨識資料與 secrets 的存取及分享範圍,並在可能執行 git reset --hard 等破壞性 git 操作前檢查 git status。文章也列出三起內部攔截事件:Claude 在內部磁碟上傳失敗後,試圖把報告發布到公開程式碼分享網站;長時間 session 中試圖終止約 2,000 個 pods,並排入可能刪除數百張 GPU 訓練資源的操作;以及在只要求唯讀帳務權限時,誤選可取得帳號根層級完整管理權限的雲端角色。 外部評估與實際採用 引用文章提到,Apollo Research 透過兩週的對抗性測試協助強化 classifier,讓已知與保留攻擊集合的整體漏判率由 12% 降至 7%;但 Anthropic 特別提醒,這些是刻意設計來尋找系統弱點的 synthetic attacks,不能直接視為真實流量的漏判率。在另一項由 Trajectory Labs 執行、涵蓋 72 個 indirect prompt injection 情境、共 720 次攻擊嘗試的評估中,Claude Fable 5、Opus 5 與 Sonnet 5 使用 auto mode 時沒有攻擊成功;GPT-5.6 Sol 在 Codex 的 Auto-review 模式下則為 5.83%。這項評估使用 Trajectory Labs 提供的共用瀏覽器整合,未測試 OpenAI 與 Anthropic 第一方瀏覽器整合內建的 safeguards,因此結果不能直接外推到這些整合。 Anthropic 旗下模型(Sonnet 5、Fable 5 與 Opus 5)在各種權限模式下的 Prompt injection 攻擊成功率均接近 0%,顯著優於 GPT-5.6 Sol 的 5.83% 至 19.03%。 Sonnet 5、Fable 5 與 Opus 5 在工具呼叫任務中的 prompt injection 攻擊成功率不論在 bypass 或 auto mode 下均為 0.00%,表現優於 GPT-5.6 Sol 的 6.80%(Full Access)與 2.00%(Auto-review)。 實際採用方面,Adobe、Nuro、Gusto 與 Garner Health 已將 auto mode 用作生產預設。引用文章表示,Teams 與 Enterprise 採用者產出的 PR 約增加 25%;Garner Health 更透過 managed settings 將預設值推送給 550 名員工。Gusto 自 5 月中旬起約有 10% 的 session 觸發 classifier denial,顯示它確實攔下部分操作,而不只是移除提示。 社群回應與疑慮 Boris Cherny 表示,若結合 model training、input probes 與檢查意圖的 classifier,多層防禦可能讓未見過的 indirect prompt injection 攻擊成功率接近 0%,這是他一年前未預期的結果;他也回應稱 Anthropic「完全信任」auto mode。Fernando Torres 則認為 auto mode 的細節應該開源,以協助整個產業改善安全性,並指出 Claude 訂閱無法用於 third-party agents,是目前使用 Agent 的重大風險之一。其他回應者要求公開更多測試結果,也有人批評這些防護層讓產品不適合嚴肅工作。另有使用者回報,使用會呼叫兩個平行 review subagents 的 skill 時,Opus 5 突然要求使用者核准;Boris Cherny 請對方在該 session 執行 /bug 並提供 feedback id,顯示新預設模式仍可能需要持續除錯與驗證。原文:https://easyvibecoding.app/curated/2878-claude-code-sets-auto-mode-default-pro-max-team-89-percent
-
173
Claude Code 跨 session messaging:不同 session 可互傳摘要與變更通知,不必重新解釋背景
Claude Code 跨 session messaging:不同 session 可互傳摘要與變更通知,不必重新解釋背景。 功能概述 Anthropic 的 Claude Code 團隊表示,更新 Claude Code 後,使用者可以要求一個 session 把目前發現、決策或進度傳給另一個 session,不必在不同終端機之間重新解釋背景。傳送內容是 Claude 撰寫的文字摘要,不包含原始對話紀錄或檔案;若要搬移完整對話與 context,仍應使用 resume session。 實際互動 這項功能支援雙向溝通:目前的 session 可以詢問另一個 session,並把答案帶回原本的工作流程;Claude 也能自行判斷需要通知其他 session,例如某個變更可能影響另一個 session 正在處理的程式碼。官方文件列出的典型用途包括: 傳遞 breaking change、技術發現或已做出的決策。 協調不同 worktree 中的平行開發,通知其他 session 哪些內容已完成。 讓長時間執行的 migration 或測試工作回報狀態。 透過 Remote Control 回覆在其他電腦或網頁上送來的訊息;但跨機器情境只能回覆,不能由目前的 session 主動開始對話。 示範畫面 輔助影片顯示兩個 Claude Code 終端機視窗:左側 claude-user-profiles 將 users.name 改為 users.displayname 後,輸入「tell weekly-digest we renamed users.name to displayname」;右側 claude-weekly-digest 收到通知,發現 digest query 仍讀取舊欄位,便更新 src/jobs/weeklyDigest.ts 並執行 npm test digest。畫面顯示,兩個工作可在各自處理任務時同步介面變更,避免其中一邊完成後才發現另一邊仍依賴舊欄位。 兩個 Claude Code終端機視窗透過指令建立連線並自動交流的介面。 運作方式 Claude Code 會使用 ListAgents 找出可連線的 session,再透過 SendMessage 傳送訊息。可用 /list-agents 或 /peers 查看清單;session 名稱可由 /rename 或 --name 設定,未設定時則依工作目錄自動命名。相同機器上的 session 透過每個 session 的 socket 通訊,不經 Anthropic 伺服器;容器與主機因檔案系統隔離,彼此無法連線,但同一容器內的 session 仍可互傳。 權限與訊息控制 收到的訊息不等同於使用者授權,也不能替使用者核准權限提示、修改 CLAUDE.md 或其他設定;訊息中的 /compact 等指令也只會以純文字呈現,不會被直接執行。接收端原有的權限規則仍然適用,訊息可能被交付、暫存等待核准,或直接拒絕。使用者可用 crossSessionInbound 設為 accept、hold 或 refuse,控制是否接收其他 session 的訊息;暫存訊息最多 100 則,等待核准的對話視窗預設在五分鐘後失效。 跨機器與安全邊界 跨機器訊息會經由 Anthropic 伺服器與 Remote Control 傳遞,而且只能回覆已抵達的訊息。若要要求任何訊息離開本機前都先取得明確核准,可在設定中加入: `json { "isolatePeerMachines": true } ` 若組織要完全停用傳送、列出 session 與接收訊息,官方文件提供的設定如下;這類設定會影響整個組織,應由管理者人工核對後採用: `json { "permissions": { "deny": ["SendMessage", "ListAgents"] }, "crossSessionInbound": "refuse" } ` 版本與限制 跨 session messaging 要求 Claude Code v2.1.224 或更新版本,目前支援 macOS、Linux 與 WSL 2,不支援原生 Windows;Amazon Bedrock、Claude Platform on AWS、Google Cloud's Agent Platform 與 Microsoft Foundry 也不提供此功能。訊息目前僅支援純文字,重複訊息會受到節流,單一 session 等待 Claude 讀取的已接受訊息上限為 50 則。更新 Claude Code 後,可參考跨 session messaging 文件 進一步確認可用性。 Claude Code Docs 的說明頁面標題,背景為深色,上方帶有橘色標誌與「Claude Code Docs」字樣,下方顯示分類標題「Agents and parallel work」以及主要標題「Message your other Claude Code sessions」,並附帶一段簡短說明文字。兩個 Claude Code終端機視窗透過指令建立連線並自動交流的介面。 影片中的 Prompt 與操作:Prompt(00:02): 告訴 weekly-digest 我們已將 users.name重新命名為 display_name原文:tell weekly-digest we renamed users.name to display_name操作步驟: 1. (00:02)使用者在左側 claude-user-profiles 終端機輸入 tell weekly-digest we renamed users.name to display_name 並送出 2. (00:04)系統顯示 Relaying... 並將訊息傳遞給 weekly-digest 3. (00:08)雙方終端機開始同步處理相關程式碼更新與測試 4. (00:12)雙端完成對話與更新,顯示連線成功提示原文:https://easyvibecoding.app/curated/2874-claude-code-adds-cross-session-messaging-work-updates
-
172
Google 分享 Gemini Omni Flash:從文字、圖片、影片或音訊產生並編輯連貫影片
Google 分享 Gemini Omni Flash:從文字、圖片、影片或音訊產生並編輯連貫影片。 Gemini Omni Flash 於今年 I/O 發表、近期才開放開發者使用。2026 年 8 月 7 日,Google 整理五位開發者的作品,並邀請使用者在 Gemini App、Google Flow、Google AI Studio、Gemini API 與 Gemini Enterprise Agent Platform 體驗這項能力。 產品定位 Gemini Omni Flash 是 Omni 家族推出的第一個模型。Google 表示,Omni 讓影片創作像對話一樣簡單;除了理解物理變化,也結合 Gemini 對真實世界的知識,因此能產生更符合現實邏輯的畫面。Google 最近已開放開發者使用,並以多個個人與專業專案展示其實際用途。 深藍色背景中央顯示「Gemini Omni」字樣,四周環繞著五個帶有藍色邊框的動態畫面截圖,內容包含機器人動畫、黃色檸檬潛水艇插畫、像素風格遊戲畫面、戶外木造涼亭設計提案以及城市街景中的人物。 切換鏡頭與視角 Omni 能在不破壞原始場景連續性的前提下,改變攝影機角度、替換環境,或加入電影感縮放。開發者 Leon Lin(@LexnLin)以一名站在城市街道中央的女子為拍攝對象,製作約 20 種視角,包括近景、遠景、正面、側面、俯拍與仰拍;背景也隨之改變——她時而站在人行道、斑馬線或車道上,周圍的行人、汽車、電車與各式建築也跟著不同。 一名短髮女子身穿黃色風衣站在城市街道中央。 用語音改造環境 Omni 也能改變影片中正在發生的事情,或替換場景內的物件,同時維持畫面的整體連貫。Carlos Santana(@DotCSV)示範只用自己的聲音編輯戶外場景:把白天改成夜晚,加入陰天、雨聲與積雪,讓樹葉轉為橘色,呈現天候與季節逐步變化的效果。 庭園景觀在日夜與天候、季節變化中的外觀差異 讓日常物件動起來 在 Google Flow 中,使用者可以把手繪草圖轉成寫實影片,並用塗鴉指定個別元素的移動方式。Pan(@sebatheepan)將檸檬、咖啡杯、火柴、辣椒與剪刀等日常物品轉化為動畫角色:檸檬成為海中潛水艇,咖啡杯變成熱氣球,火柴成為火箭,辣椒組成受驚時會噴火的沉睡惡龍,剪刀則變成追逐獵物的鯊魚。手繪元素是否保留在最終作品中,也可由創作者決定。 混合視覺風格 使用者可以提供參考素材,或用自然語言描述想要的外觀,讓 Omni 將不同參考融合成風格一致的影片。Jerrod Lew(@jerrod_lew)在 Google Flow 中讓一名女子持續走過街道,影片依序在真人實景、動漫、黏土定格動畫等風格間流暢切換,人物向前行走的動作沒有被中斷。相關畫面也可觀察到低多邊形 3D 與精緻 3D 動畫等轉場效果;這些是示範畫面呈現,不代表 Google 另行公布的正式規格。 一名身穿風衣與紅色圍巾的女士在繁華街頭行走,畫面風格隨不同鏡頭在寫實與多種動畫風格之間切換 把概念轉成可視化內容 Hyperagent 團隊則用 Omni 將抽象想法變成影片,包括把空公園製作成景觀設計提案的施工前後對照、用動畫教授講解商業儀表板資料,以及把待辦事項改造成角色逐項闖關的遊戲。相關畫面顯示,一個景觀提案介面以比較拉桿切換草地實景與木造涼亭渲染圖,並標示「Generated from your video in 4 minutes」;畫面中的提案規格為總價 120,425 美元、工期 7–9 週、14×16 cedar pergola 與 175 株以上原生植物。這些數字屬於示範畫面內容,不能視為 Omni 的官方效能或服務承諾。 介面上的比較拉桿在公園實景與木造涼亭渲染圖之間切換 示範所呈現的延伸方向 同一組 Hyperagent 示範中也把 Omni 用於 8-bit 風格的工作進度儀表板,以及由 Professor Tidemark 以黏土動畫講解成長與首次工作階段流失排查的短片。畫面顯示的儀表板包含 MRR 52,400 美元、淨收入留存率 118%、19 個月 Runway 與 71% Auto-resolve rate;另一段影片則列出每週註冊數 5,010、每週活躍建構者 1,370、7 天啟用率自 9.4% 降到 8.7%、啟用中位時間 38 分鐘,以及每位已啟用使用者成本 312 美元(上升 86%)。這些同樣是媒體中展示的創意案例與畫面數據,並非貼文宣稱的模型基準測試結果。 模擬 8-bit 遊戲風格的工作進度儀表板介面,結合左側數據指標與右側任務日誌。 使用方式 Google 表示,開發者與一般使用者現在可在 Gemini App、Google Flow、Google AI Studio、Gemini API 或 Gemini Enterprise Agent Platform 嘗試 Gemini Omni。完整介紹可參閱 Google 的示範文章。 結合日常實物與手繪線條的定格動畫創意短片。 一名機器人講者正用教鞭指著白板上的成長曲線圖,下方並列展示各項關鍵指標數據。模擬 8-bit 遊戲風格的工作進度儀表板介面,結合左側數據指標與右側任務日誌。 影片中的 Prompt 與操作:操作步驟: 1. (00:00)點擊右側日誌的第一項任務「Save Brightline」原文:https://easyvibecoding.app/curated/2867-google-gemini-omni-flash-generates-edits-coherent-videos
-
171
MiniMax 推出 MiniMax Code 2.0,手機可遠端監看並介入桌面 Agent 工作
MiniMax 推出 MiniMax Code 2.0,手機可遠端監看並介入桌面 Agent 工作。 MiniMax 表示,2.0 重建於開源的 Pi Agent 框架(@pidotdev)之上。 以亮藍色藍圖背景為基底的宣傳圖,左側以大字標示「MiniMax Code 2.0」及附有圖示的「Rebuilt from the Core.」標籤,右側懸浮著數個印有程式碼標誌與文字的黑白六角形區塊。 遠端控制 新功能「Remote Control」可把手機連接到既有的桌面 session,查看 Agent 回覆、終端機輸出、程式碼變更與測試結果;使用者也能離開電腦後傳送指示、回答問題或處理核准事項。手機在此扮演的是輕量化監看與介入工具,而非完整工作環境。 MiniMax Code 的介面展示,主畫面呈現筆記型電腦螢幕與右側的智慧型手機畫面,筆電畫面中央顯示標語「MiniMax Code, making work easier.」以及帶有詢問與模型選擇的對話介面,左側為專案與導覽列,右側手機則顯示相對應的專案列表與底部任務按鈕。 瀏覽與編輯 MiniMax Code 2.0 將網頁與 HTML 輸出開在側邊欄,使用者可以直接檢查程式產生的結果,並在預覽面板編輯程式碼、文件或設定檔後儲存,不必在不同應用程式之間切換。 介面設定選項,分為兩大區塊並列顯示:「For coding」標示程式碼圖示且目前處於勾選狀態,下方說明為「More detail and dev tools」;右側為「For everyday work」標示對話氣泡圖示,下方說明為「Same power, simpler view」。 雙模式工作流 Coding 模式保留開發脈絡與程式碼管理工具,適合執行程式開發任務。 Work 模式簡化技術細節,讓使用者專注於進度與最終交付成果。 模型與提供者設定 使用者可連接 MiniMax API Key,也能透過 Base URL、API Key 和 Model Name 加入自訂 provider。完成設定後,該模型會出現在 model picker 中,可用於各類任務。官方提供下載更新:MiniMax Code。原文:https://easyvibecoding.app/curated/2869-minimax-code-remote-monitor-desktop-agent
-
170
OpenAI 更新 ChatGPT:GPT-5.6 Sol 統一支援 Plus 與 Pro 對話,GPT-5.6 Luna 開放免費無限文字聊天
OpenAI 更新 ChatGPT:GPT-5.6 Sol 統一支援 Plus 與 Pro 對話,GPT-5.6 Luna 開放免費無限文字聊天。 更新重點 OpenAI 在 2026 年 8 月 7 日表示,GPT-5.6 Sol 已成為 Plus 與 Pro 使用者所有 ChatGPT 對話的核心模型,涵蓋 Instant 與較深度的 reasoning,目標是提供更聚焦、可靠且一致的回答。Free 與 Go 使用者則獲得 GPT-5.6 Luna 的無限文字聊天;面對較複雜的問題,也能使用新的「Think」按鈕要求模型投入更多 reasoning。 GPT-5.6 Sol 改進 這次更新針對 ChatGPT 的日常對話體驗,重點包括: 優先直接回答問題,減少不必要的格式與細節。 依問題難度調整回答長度;處理規劃、研究、寫作或多步驟任務時,仍保留完整脈絡。 當單純同意使用者並無幫助時,主動提出適當修正。 Plus 與 Pro 使用者可在網頁、手機與桌面版 ChatGPT 使用滑桿,調整每次回答投入的思考量。影片畫面顯示選項可在 5.6 Instant、5.6 Medium、5.6 High 與 5.6 Extra High 之間切換。 星空背景中的手機畫面,淺色 ChatGPT 介面顯示 Ask ChatGPT 輸入框與 5.6 Medium 調整選項 可靠性評測 OpenAI 引用涵蓋金融、醫療與法律問題的內部評測指出,回答至少包含一項事實錯誤的比例,相較 GPT-5.5 Instant,GPT-5.6 Luna 約少 62%,GPT-5.6 Sol 則少 68%。官方將改進歸因於模型更善於運用找到的來源,尤其是回答涉及日期、數字、規則、來源或前提假設的問題時。原文也以自行車騎乘天氣問題示範:GPT-5.6 Sol 先回答「不會被雨淋濕」,再指出真正需要注意的是前往 Ocean Beach 時的逆風與降溫,而不是重複完整天氣預報。 比較 GPT-5.5 Instant 與 Updated GPT-5.6 Sol 兩款模型對同一通勤氣象問題的回答介面,上方顯示使用者輸入的問題文字,下方左右兩欄分別呈現不同版本的詳細天氣分析與建議,右側版本附有帶時間、天氣狀況與降雨機率的 San Francisco, CA 表格。 免費使用擴大 GPT-5.6 Luna 將在本週成為 Free 與 Go 使用者的預設模型;自下週起(官方文寫下週起、發布當日推文則稱隔日起),兩種方案可無限進行文字聊天,並透過「Think」按鈕處理需要較深思考的問題。這項擴大服務仍受 abuse guardrails 約束,檔案上傳、圖片與其他工具也仍有使用限制。背景脈絡是 ChatGPT 每週已有 10 億人使用,OpenAI 希望降低持續提問與發展想法的門檻。 宣傳 GPT-5.6 Luna 無限文字對話服務的星空背景圖 範圍與限制 Plus 與 Pro 使用者可從今日開始使用更新後的 GPT-5.6 Sol 與滑桿;Free 與 Go 使用者則依上述時程取得 GPT-5.6 Luna。這個版本的 GPT-5.6 Sol 是為日常聊天最佳化,因此只會出現在 ChatGPT 的 Chat 體驗中;支援 Work 與 Codex 的 GPT-5.6 Sol 不在本次發布範圍內。更多安全訓練與未滿 18 歲使用者的評測,可參考 OpenAI 的官方說明。原文:https://easyvibecoding.app/curated/2873-openai-gpt-5-6-sol-unifies-plus-pro-chats-luna-unlimited-free
-
169
Cloudflare WebMCP developer preview:Dashboard 切一個開關,網站不改程式碼即帶入 agent 可呼叫的 MCP tools
Cloudflare WebMCP developer preview:Dashboard 切一個開關,網站不改程式碼即帶入 agent 可呼叫的 MCP tools。 Cloudflare 部落格文章頁首視覺圖,左側標題文字寫著「Give any website a WebMCP interface」,上方帶有橘色的 Cloudflare 品牌 logo,右側為對應的橘色系等距 3D 插圖,中央主體為標示有 MCP 字樣的書本造型主機,周圍環繞著積木方塊、對話框、球體與線條連接的抽象圖示。 運作方式 WebMCP 是新的 browser standard,將隨 Chrome 146 以實驗性形式推出,讓網頁透過 document.modelContext 暴露 MCP tools。Cloudflare 會在 edge 注入 bridge script,不需修改網站程式碼、重新部署或變更 origin,靜態網站與單頁應用程式都適用;若瀏覽器不支援 WebMCP,bridge 會直接返回、不做任何事,頁面行為與先前完全相同。 工具套件 預覽版提供兩組可在瀏覽器內執行的 packs: Content Credentials:讀取圖片前段的內容來源 metadata,支援 scanimagesc2pa 與 inspectimagec2pa;目前只會解碼並回報憑證,signatureVerified 一律為 false,不代表已完成密碼學驗證。 Site MCP Server:從網站頁面直接連到既有的 MCP server,沿用訪客目前的 origin 與 session。 部署與影響 管理者可在 Cloudflare Dashboard 的 Agent Readiness > Labs 啟用 WebMCP 並選擇 packs,預設開啟上述兩組,下一次傳送 HTML 時就會帶入 bridge。Cloudflare 的 BrowserRun 已支援 WebMCP,可直接發現並呼叫網站工具;這項設計試圖取代只複製內容的 crawler,讓 AI agents 執行任務時少花 token 在猜測頁面操作,也讓訪客保有主導權,網站維持原有流量。原文:https://easyvibecoding.app/curated/2871-cloudflare-webmcp-developer-preview-browser-ai-agents
-
168
OpenAI Developers 發布 Agent Plugins 1.0.0:Agent Skills 與 MCP 設定共用一份目錄格式,Codex、Cursor、GitHub Copilot 等六款工具首發支援
OpenAI Developers 發布 Agent Plugins 1.0.0:Agent Skills 與 MCP 設定共用一份目錄格式,Codex、Cursor、GitHub Copilot 等六款工具首發支援。 這套由 OpenAI 與 AWS、Cursor、GitHub、Microsoft、Vercel 等生態夥伴共同開發的格式,整合 Agent Skills 與 MCP 伺服器設定。 發布內容 Agent Plugins 是開放、與供應商無關的可攜式套件格式,1.0.0 規格定義了相容客戶端如何一致地探索與載入可重複使用的元件。OpenAI Developers 列出的初始相容客戶端包括: Codex ChatGPT Cursor GitHub Copilot Kiro VS Code 發文者分享這項標準的重點,在於開發者只需建置一次 plugin,就能跨多個相容 Agent client 使用,而不必為每個產品重新整理或複製內容。官方網站可參閱 Agent Plugins。 套件結構 一個 Agent Plugin 是包含必要 manifest、以及放置於固定位置之選用元件的資料夾。基本結構如下: `text my-plugin/ ├── plugin.json ├── skills/ │ └── summarize/ │ ├── SKILL.md │ ├── scripts/ │ └── references/ ├── mcp.json └── com.example.client/ └── hooks/ ` plugin.json 用來識別 plugin,並標示其支援的 Agent Plugins 版本。 skills/ 放置遵循 Agent Skills 規格的 Agent Skills。 mcp.json 描述 stdio、Streamable HTTP 或傳統 HTTP+SSE MCP 伺服器。 反向網域名稱的 extension namespace 可讓個別客戶端加入專屬行為,而不必修改可攜式核心。 相容性邊界 這項標準只建立可攜式元件的最低互通基礎:共用內容採用一致結構,但發行、Marketplace、安裝流程、權限管理、使用者體驗與客戶端專屬能力,仍由各客戶端自行控制。因此,Agent Plugins 並不是要統一所有 plugin 生態,而是先處理同一份 Agent Skills 或 MCP 設定在不同產品間重複封裝的問題。 影片展示 輔助影片示範了「One plugin │ multiple compatible clients」的概念。畫面中的 hello-plugin 先建立 plugin.json,再加入 skills/greet/SKILL.md,並顯示以下設定;這是 demo 中展示的範例,不等同於額外公布的官方產品設定: `json { "$schema": "https://agent-plugins.org/schemas/1.0.0/plugin.schema.json", "name": "hello-plugin", "version": "1.0.0", "description": "A portable plugin for agent greetings.", "extensions": { "com.openai": { "interface": { "shortDescription": "Reusable greetings", "logo": "./assets/logo.png" } }, "com.cursor": { "icon": "./assets/icon.png" } } } ` 影片從講者開場,接著走過官網規格說明,再實地示範建立 hello-plugin:先寫 plugin.json,再加入 skills/greet/SKILL.md 與 com.openai/com.cursor 擴充設定。 開放治理 Agent Plugins 採取公開授權並以公開方式開發。初始 Technical Steering Committee 包含來自 Amazon、Cursor、Microsoft、OpenAI 與 Vercel 的 Core Maintainers;提案與技術決策也公開,外部參與者可透過 GitHub Discussions 提出具體的可攜性需求與實作支援,完整規格、schema、治理方式與貢獻流程則集中在 Agent Plugins specification repository。原文:https://easyvibecoding.app/curated/2868-openai-developers-release-agent-plugins-open-standard
-
167
Prime Intellect 開源 Prime Agent:harness 讀自己的執行軌跡改寫 prompt 與 skill,搭 Opus 5 在 ARC-AGI-3 勝人類專家基準
Prime Intellect 開源 Prime Agent:harness 讀自己的執行軌跡改寫 prompt 與 skill,搭 Opus 5 在 ARC-AGI-3 勝人類專家基準。 產品定位 Prime Intellect 將 Prime Agent 定位為通用程式開發 harness,也適合研究與長時間自主評測(long-horizon autonomous evaluation)。官方表示,它不只針對單一 benchmark 設計,在 ARC-AGI-3 上以 Opus 5 取得 95.5% 成績,超過人類專家基準 95.4%;團隊也稱,Prime Agent 在多項長上下文與長 horizon 任務中,相較模型原本搭配的專有 harness,能讓開放權重與封閉模型的下游表現更好。 Prime Agent 搭配 Opus 5 在 ARC-AGI-3 達到 95.5%(179/183 levels),超越圖上標示的人類專家 baseline 95.4%;同圖其餘搭配為 Prime Agent + Sol 的 78.3%、+ Terra 的 25.7% 與 + GLM 5.2 的 8.6%;圖上的對照組為 GPT-5.6 Sol 的 ARC-AGI-3 harness 13.3%、Claude Opus 5 的 ARC-AGI-3 harness 30.2%,以及 GPT-5.6 Sol 走 Responses API 的 38.3%。 Prime Agent 建置於 pi 之上,採完全開源與 MIT License。 三個核心設計 Prime Agent 將三種機制組合在同一個執行環境中: RLM-native programmatic tool calling:模型把 context 視為變數,並在持續運作的 REPL 中以程式碼操作歷史內容、呼叫工具與啟動 sub-agents。 Persistent multi-agent orchestration:sub-agents 能並行或在背景執行,彼此直接傳送訊息,並保留自己的工作狀態。 Self-improving Continual Harness:harness 可保存並更新 prompt、記憶、skill 與 sub-agent 規格,讓 Agent 根據實際執行軌跡逐步調整工作方式。 單一 turn 與 Continual Harness 迴圈的架構圖,圖上標示 MODEL、IPYTHON KERNEL、SUB-AGENTS 與 CONTINUAL HARNESS;圖說寫明 Continual Harness 讀取跨 turn 的執行軌跡並寫回 harness 狀態 RLM 執行模型 Prime Agent 的模型使用持續存在的 IPython kernel,並將它視為唯一的工具介面。檔案操作、Shell 命令、工具呼叫、context 管理與 sub-agent 啟動,都能由模型在 kernel 中以程式碼完成。這讓長 session 不必把所有歷史重新塞回 active context;模型可以把有用資料保存在變數或外部狀態中,把長時間工作變成可以用程式管理的問題。 RLM 架構圖,說明讓 LLM 透過 persistent Python REPL 來檢查與轉換輸入資料,並在該 Python REPL 內呼叫 sub-LLMs 的運作機制。 多 Agent 與持續工作 rlm(...) 能建立真正的子 Agent,每個子 Agent 都擁有自己的模型、IPython kernel、session tree 與對話歷史。Agent 之間可透過 daemon 傳遞訊息,協調平行工作、追蹤進度或處理共用資源;官方說明這類訊息傳遞限於同一個「核心家庭」,也就是父、子與兄弟 session 之間。Prime Agent 也支援 background session、heartbeat、schedule、persistent goal 與 bounded autonomous mode,官方提醒通過的 gate 只驗該 gate 檢查的項目、達到上限並不代表任務成功;即使終端機中斷,工作仍可在背景繼續,之後再重新連線。官方展示的使用情境包括 EmulatorBench、Factorio、MazeBench,以及從零以 Rust 建立 SEGA Genesis 與 Game Boy Color emulator。 Prime Agent + GPT-5.6 Sol (xhigh) 在 EmulatorBench 的 GAME BOY COLOR 測試中達到 0.998 分數;圖上另外三種搭配(Codex + GPT-5.6 Sol、Prime Agent + Claude Opus 5、Claude Code + Claude Opus 5)皆為 0.000。官方標示 EmulatorBench 為 preview benchmark,數字是 16 次重建平均的初步結果 執行 Prime-Agent 配合 GLM-5.2 在 MazeBench 上的迷宮導航與測試過程 Continual Harness 與 skill harness 狀態會持續寫入磁碟,並在不同 turn 與 session 間保留。/refine 會檢視 Agent 過去嘗試及其結果,對 prompt note、記憶、skill 或 sub-agent 規格做最小、有證據支持的修改,而不是重寫整個 harness。基礎 system prompt 維持不可變更,更新也會留下歷史紀錄並支援 rollback。這裡的 skill 是可匯入的 Python package,可由內建 skill creator 將重複性的工作流程整理成專案或個人 skill。 Prime Agent 相比各模型專有與原生 harness,在 9 項長上下文與長 horizon benchmark 的多數對照中分數較高,但並非全部:Opus 5 的 OOLONG 為 0.900 對 Claude Code 的 0.920、LongBenchv2 為 0.744 對 0.746,GPT-5.6 Sol 的 OBLIQ-Bench 為 0.612 對 Codex 的 0.646、LongCoT-Mini 為 0.671 對 0.681、ManyIH IF 為 0.216 對 Codex 的 0.232,GLM-5.2 的 LongBenchv2 則是 0.680 對 Pi-Mono 的 0.696。EmulatorBench 的 Opus 5 兩欄(0.047、0.062)帶星號,官方說明 Opus 的 run 未能解出任務。 評測結果 Prime Intellect 表示,Prime Agent 在 ARC-AGI-3 上以 Opus 5 取得 95.5% 的 RHAE Best@1(圖上標示該次通過 179/183 個 levels),三次執行分數為 95.0%、95.2% 與 95.5%;三次合計的 Best@3 分數為 99.97%,且 183 個 levels 全數至少通過一次。官方也指出,透過程式化函式直接處理資料,能在達到較高分數的同時降低整體 token 使用量。影片畫面另顯示另一次執行的中途狀態,從 93.39%(164/183 levels)更新至 95.54%(178/183 levels、11,118 actions),並將 Prime Agent 的 95.5% 與 native coding harnesses 的 38.3%、人類基準 95.4% 並列;這些是畫面展示的數據,不是額外的正式評測規格。 開源與安裝 原始貼文提供的安裝方式如下;官方文件說明該 installer 會下載已版本化的發行版並驗證其 SHA-256 checksum。(編按)它仍是透過網路下載、直接交由 Shell 執行的指令,建議先確認內容、權限與執行環境再執行: 介紹 Prime Agent 程式碼 harness 的安裝指令與 ARC-AGI-3 基準測試表現 `bash curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh ` 專案原始碼可見於 Prime Agent GitHub repository,發布說明則見 Prime Intellect 官方部落格。文件特別警告,Prime Agent 會以使用者權限執行模型產生的 Python 與專案命令;它的 worker 與 kernel 生命週期隔離、復原機制都不是 security sandbox,所以要用可信任的 repository、指示、skill 與 extension,並在可檢查、可還原的工作副本或外部沙盒中執行不受信任的程式碼。介紹 Prime A…
-
166
OpenAI 拆解 GPT-Live 語音架構:移除 turn detector,語音啟動的網路往返從六次降到一次
OpenAI 拆解 GPT-Live 語音架構:移除 turn detector,語音啟動的網路往返從六次降到一次。 核心體驗 GPT-Live 的 voice model 能同時接收與輸出音訊,不再依賴先判斷何時輪到誰說話的 turn detector。當需要更深度的推理或工具呼叫時,系統會在非同步路徑交由 GPT-5.5 等 frontier models 處理,語音主流程仍持續運作。OpenAI 表示,這讓 ChatGPT Voice 從啟動開始就能提供更快速、自然的對話。為了讓對話 UI 與分析、安全系統仍能取得離散訊息,application server 會用部分逐字稿與時間訊號把連續語音切分成一則則發言,最終稿才寫入分析管線。 系統架構 OpenAI 在六個月內重做從 client 到 model 的 voice stack,將音訊與應用程式邏輯分離: 音訊經由專用 fast path 傳送,delegation、tool use 與其他後端工作則放在非同步 RPC 邊界後方,避免緩慢的工具或服務阻塞語音。 media frontend 與 inference logic 改用 Go 撰寫;新系統的 p95 表現達到舊 Python asyncio 系統 p50 的水準。 WebRTC 負責低延遲媒體傳輸,能處理封包遺失、時鐘漂移與連線變化,並透過減少 buffering 與 blocking 維持次秒級回應。 GPT-Live 系統架構圖,展示即時語音路徑與非同步委派路徑的資料流向 啟動與長時間執行 OpenAI 開發 WebRTC Abridged Roundtrip Protocol(WARP),以一組向後相容的協定改良組成:把 DTLS 交握夾帶在 ICE 上(SPED)、改用較快的 DTLS 1.3、預先協商 SCTP 交握(SNAP)與 data channel,將媒體與資料啟動所需的網路往返從六次降至一次。WARP 以開放規格形式推進 IETF TSVWG,libwebrtc 與 Pion 已加入支援。另以 Instant Connect 預先協商 SDP 參數,與 WARP 合起來,才讓 client 能以單一 UDP 封包啟動 session。面對長時間對話,系統會在舊 model instance 持續交談時預熱替代 instance、填入最新 context,必要時完成 context compaction 後再切換,避免語音中斷。 VANILLA WEBRTC 與 WEBRTC + WARP 交握流程的比較圖 實際驗證與延伸 OpenAI 先以 read-only 的 silent test,將少量、逐步增加的 ChatGPT Voice 流量影子導向 GPT-Live,未改變使用者聽到的內容。測試顯示,容量不只取決於 GPU,也受 CPU stream handler、佇列、網路路徑、地理位置與長時間 session 影響;因此團隊增加更細緻的 telemetry、分階段 rollout 與快速隔離故障的控制。這套架構已支援 ChatGPT 桌面版 app 中的電腦控制與 Agent 協作,未來也將成為 GPT-Live API 的基礎。詳細工程說明見 OpenAI 技術文章。原文:https://easyvibecoding.app/curated/2850-openai-gpt-live-voice-architecture-removes-turn-detector
-
165
Alpamayo 2 Super 開放商用:34B 規模在 LingoQA 拿下 79.2 分居首,自駕先推理再行動
Alpamayo 2 Super 開放商用:34B 規模在 LingoQA 拿下 79.2 分居首,自駕先推理再行動。 發布定位 Alpamayo 2 Super 於 2026 年 8 月 4 日推出,目標涵蓋 robotaxis、卡車、接駁車、配送車、拖拉機,以及長尾的各式行動機器人——Jensen Huang 形容未來會有數十億台自主機器。他表示,模型依 OpenMDW-1.1 授權開放商用,團隊可以檢視、微調並部署;他認為開放模型有助於推進安全(safety)與資安(security),下一波 AI 就是 robotics,而這一波從 autonomous vehicles 開始。 模型架構與部署 NVIDIA 表示,Alpamayo 2 Super 建立在 NVIDIA Cosmos 3 Super Reasoner 上,並以 reinforcement learning 做 post-training。它的模型規模是 10 billion-parameter Alpamayo 1 與 Alpamayo 1.5 的 3 倍,能更有效從稀疏範例中泛化推理,尤其針對罕見的多方互動情境。模型會融合車輛前方、側面與後方攝影機影像,形成 360 度環景脈絡。 背景為黑色的科技宣傳圖片,中央上方呈現一台透視內部的黑色汽車並圍繞金色發光圓環,下方橫向排列五個帶有金色線條圖示的方形區塊。 開放授權與工作流程 先前 Alpamayo 版本只供研發用途,這次 OpenMDW-1.1 一次套用到整個 Alpamayo 家族,開發者不必另外申請授權即可商用部署;它允許微調、建立衍生模型及商業再散布,讓車商、卡車製造商與供應商能搭配自有資料、駕駛政策及部署策略開發。NVIDIA 描述的 cloud-to-car workflow,是先在雲端用 Alpamayo 2 Super 產生 reasoning traces、synthetic training data 與 teacher outputs,再將蒸餾後的專用模型最佳化,部署到車上做即時推論;Alpamayo 1.5 與 Alpamayo 1 則提供成本較低的選項。 多任務能力 每個駕駛情境可產生五類相互連結的輸出: 描述車輛行駛路徑的 trajectory。 解釋決策因果關係的 chain-of-causation(CoC)trace。 表達讓行、變換車道與停車等意圖的 meta-action。 為訓練與驗證資料產生 CoC 標註的 reasoning auto-label。 結合 2D visual grounding、將回答對應至影像特定區域的 visual question answering。 這些輸出可協助開發者檢查模型看見了什麼、為何選擇某個動作,並支援 NVIDIA Halos 的安全驗證流程與 ISO/PAS 8800 對齊的 AI safety 工作。NVIDIA 也稱,模型可把車隊影片轉成更完整的訓練資料,將標註週期從數月壓縮至數日。 Alpamayo 2 Super 在各項主要自動駕駛(AV)任務上的表現全面超越 Qwen3-VL-32B-Instruct。 評測與生態系 NVIDIA 表示,Alpamayo 2 Super 在 LingoQA、近 40 個模型的評測中排名第一;以 Lingo-Judge 測試時,分數比 Qwen2.5-VL 72B 高 17.0 分、比 Gemini 2.5 Pro 高 15.1 分、比 GPT-4o 高 23.2 分。它也支援 scene understanding、model critiquing 與 knowledge distillation,並可搭配 NVIDIA AlpaSim、NVIDIA AlpaGym、NVIDIA Physical AI Open Datasets、開放訓練 recipes 與 autolabeling pipeline。Alpamayo 系列在 Hugging Face 的下載量已超過 500,000 次。 Alpamayo 2 Super (34B) 以 79.2 分在 LingoQA 自動駕駛推理基準測試中位居第一,領先其他模型。原文:https://easyvibecoding.app/curated/2856-nvidia-alpamayo-2-super-open-models-reason-before-action
-
164
Demis Hassabis 轉任 Google DeepMind 主席,專注 AGI 長期策略與 Isomorphic 生醫研究
Demis Hassabis 轉任 Google DeepMind 主席,專注 AGI 長期策略與 Isomorphic 生醫研究。Google 的大寫字母「G」標誌,色彩依序為紅、黃、綠、藍並帶有漸層效果。領導交接 他表示,自己一生都在追求 AGI,當前正處於關鍵時刻,因此交出 Google DeepMind 的日常營運責任,騰出時間思考 AGI 的長期發展與全球策略。Koray Kavukcuoglu 將升任 Google DeepMind SVP,負責領導團隊;Demis Hassabis 對 Koray Kavukcuoglu、Josh Woodward 及執行團隊表達高度信心。工作重心 在新職務中,Demis Hassabis 將與 Sundar Pichai 合作處理 AGI 相關策略,並從 London Platform 37 辦公室為模型與研究團隊提供建議。他也會更投入 Isomorphic,藉由加速 AI 在生醫領域的進展,推動協助治癒癌症等疾病的目標;他認為改善人類健康應是 AI 最重要的應用方向之一。Google 與 Alphabet 執行長 Sundar Pichai 身穿學位袍在畢業典禮致詞。Google DeepMind 的背景 Sundar Pichai 的內部訊息指出,Gemini App 已達每月超過 950M 名使用者,Gemma 模型下載量超過 900M;Demis Hassabis 另提到 Gemini 4 等新模型正在推進。這次人事調整的核心,是讓 Demis Hassabis 專注 AGI 與科學願景,同時由 Koray Kavukcuoglu 接手 Google DeepMind 的日常領導。原文:https://easyvibecoding.app/curated/2844-demis-hassabis-gdm-chair-alphabet-chief-scientist
We're indexing this podcast's transcripts for the first time — this can take a minute or two. We'll show results as soon as they're ready.
No matches for "" in this podcast's transcripts.
No topics indexed yet for this podcast.
Loading reviews...
ABOUT THIS SHOW
輕鬆Vibe Coding — Anthropic 官方文章翻譯、Claude API 與 Prompt Engineering 實作心得、X 技術社群精選的中文音訊版。
HOSTED BY
EasyVibeCoding
CATEGORIES
Loading similar podcasts...