EPISODE · Sep 4, 2026 · 13 MIN
EP401 - GPT6 Astra 怎麼用?7 件今天晚上就能改的事
from AI懶人報 · host 湯懶懶
🚀 特別感謝贊助 本集節目由 VoAI 絕好聲創 提供技術支援。 🎤 VoAI 提供最有「台灣味」的 AI 聲音,支援情感語音、台式口音,甚至能一鍵生成虛擬人! 🎁 AI懶人報聽眾專屬優惠: 👉 輸入優惠碼 AILRB26 立享 95 折! 立刻體驗:https://www.voai.ai/ ━━━━━━━━━━━━━━━ ⏱ 章節 00:00 前天 Fable 5.1,昨天 GPT-6 Astra 01:25 大家在討論的那個 99.9 分 02:34 換一家獨立機構來量,答案不一樣 03:21 該算的是一整件任務,不是 token 04:19 它怎麼記住事情 05:05 它跨過了關鍵網路安全能力門檻 05:43 什麼時候該用,什麼時候先不用 07:12 它現在真的做得到什麼 09:52 你手上的流程要改什麼 12:13 那到底什麼才是重要的 ━━━━━━━━━━━━━━━ 📌 本集在講什麼 前天 Anthropic 發表 Fable 5.1,中間隔不到 24 個小時,OpenAI 昨天就發表了 GPT-6 Astra。 這一集不比誰比較強,只回答一個問題:你手上的流程要不要因為它而改變。 ・大家在傳的 ARC AGI 3 那個 99.9 分,是在客製測試環境拿到的。同一個模型換成標準測試環境,只有 62.7 分,而且辦這個 benchmark 的機構自己講明兩個環境不能直接比較 ・換一家獨立第三方機構來量綜合評分,Astra 是 61 分,跟 OpenAI 自己的 Sol 同分、落後 Anthropic 的 Fable 5.1 的 66 分,而它的價格大約是 Sol 的 2.5 倍 ・token 單價比較貴,不代表完成一整件任務比較貴。步驟少,中間產生的 token 就少 ・它的記憶不再是壓成一份摘要,而是留下可以搜尋的筆記,舊的上下文本身也還找得回來 ・OpenAI 說它是第一個跨過關鍵網路安全能力門檻的模型,所以開放是分階段的 影片裡的四個示範情境(森林世界、自己拉流程節點、自己玩遊戲抓穿模、自己修碰撞範圍)全部是開發者自己拍的示範影片,不是 OpenAI 官方公布的測試結果,你自己的環境能不能複製,還是要親手試一次。 ━━━━━━━━━━━━━━━ ✅ 今天晚上做得完的四件事 把你最常跑的那一個任務記錄下來,它從頭到尾花了多少錢、走了多少個步驟。先有舊數字,之後換模型才知道有沒有省到 如果你在用 Codex,去設定檔裡把跨上下文的筆記功能打開,它現在還不是預設值 挑一個你平常不敢讓 AI 碰的任務,放進一個獨立的資料夾或容器,只給它那個範圍的權限,讓它自己跑一次 把你手上那些「因為單價比較便宜所以選它」的決定重算一次,改成算完成一件任務要花多少錢 📅 這個月要補起來的三件事 替 AI 可以動的環境定出邊界:哪些資料夾它可以寫、哪些金鑰它拿不到、哪些動作一定要你按過才會發生 把驗收方式寫下來。它會自己執行、自己修,所以你要看的是成果,不是它寫的每一行程式碼 養成看獨立第三方評測的習慣,不要只看發表會上面的分數 ━━━━━━━━━━━━━━━ 🔗 資料來源 OpenAI 官方發表:https://openai.com/index/gpt-6-astra/ ARC Prize 的 ARC-AGI-3 測試說明:https://arcprize.org/blog/astra 獨立第三方評測:https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra 關鍵網路安全能力門檻:https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/ ━━━━━━━━━━━━━━━ 📮 追蹤 AI 懶人報 Instagram、Threads、Facebook 搜尋「AI 懶人報」 Podcast 每天更新,Apple Podcast、Spotify、SoundOn 都聽得到 #AI懶人報 #GPT6 #Astra #OpenAI #AI工具 -- Hosting provided by SoundOn
Embed this episode
NOW PLAYING
EP401 - GPT6 Astra 怎麼用?7 件今天晚上就能改的事
No transcript for this episode yet
Similar Episodes
No similar episodes found.