GPT-6 Astra 機械手臂實測:抓放 95%、精準插件 10%,離工廠還多遠|AIRUN
GPT-6 Astra 機械手臂實測:抓放成功 95%,精準插件只有 10%
結論先講:GPT-6 Astra 能操作機械手臂做簡單抓放,第三方實測 20 次成功 19 次;但需要精準對位的插件任務 20 次只成功 2 次,離工廠任務還很遠。
事件時間先釐清。OpenAI 在 2026 年 9 月 4 日推出 GPT-6 Astra(見 OpenRouter 模型頁)。第三方評測站 Robocurve 的 Astra 接上機械手臂的實測報告,頁面標註日期同為 2026 年 9 月 4 日,報告內嵌圖表的產出時間戳也是同一天;本文以此作為「發布日」的依據。本文發稿日是 9 月 6 日,資料以這兩份來源為準,來源沒講的一律寫「官方未公布」。
GPT-6 Astra 真的能操作機械手臂做工廠任務嗎?
能做桌面級的簡單抓放,做不到需要精準對位的組裝。Robocurve 的實測只有兩個任務:把紅色積木放進碗裡、把圓形拼圖片插進對應的圓槽。前者 Astra 完成 19/20,後者只完成 2/20(來源)。這兩個任務都不是工廠任務,任何人把這份報告說成「AI 已經能上產線」,都是誇大。
先解釋一個術語。「實體 AI(physical AI)」指的是把語言模型接上感測器與致動器,讓模型輸出的指令直接變成馬達動作,而非只輸出文字。Robocurve 這次的做法,是用同一套 Inspect Robots 代理策略(agent policy,即模型觀察、決策、下指令的固定流程)把 Astra 接到 YAM 機械手臂上,並沿用先前測 Claude Fable 5 與 Fable 5.1 的相同任務與相同評分尺(來源)。
要注意的是,這是第三方實驗,並非 OpenAI 的產品功能。OpenRouter 上的官方模型描述寫的是「進階分析、軟體工程、深度研究、科學工作、文件產出」與「電腦與瀏覽器操作的長程代理任務」,完全沒有提到機器人或實體控制(來源)。OpenAI 的官方發布頁也是本篇連結的來源之一,但關於機械手臂支援,官方未公布任何內容。
Robocurve 測了什麼、怎麼評分?
兩個任務、三個模型、每格 20 次、總共 120 次,每次由真人評審依 0 到 4 分的階段給分(來源)。這種計分方式的好處是失敗的那次也留下「走到哪一步」的紀錄,而非只看成功與否。
五個階段的白話版是:0 分沒有明確靠近物件、1 分碰到物件、2 分把物件抬離桌面、3 分移到放置點上方、4 分放到最終位置。Robocurve 註明這套尺度與先前測 Fable 的報告完全相同,所以三個模型的數字可以直接比。
任務一「積木入碗」是抓放:抓一塊紅色積木,放進碗裡。任務二「拼圖入槽」是插件:捏住圓形拼圖片中央的旋鈕,插進板子上對應的圓槽。第二個任務難在最後一步的對位,這正是三個模型全部卡住的地方。
Astra、Fable 5.1、Fable 5 在機械手臂上的數字差多少?
抓放任務 Astra 大幅領先,插件任務三個模型一起卡在最後一步。下表整理自 Robocurve 結果表,成本是依各家牌價估算的每次執行費用(美元)。
| 任務 | 模型 | 完成次數 | 平均階段(0–4) | 每次輸出 token | 估算每次成本(美元) | 每次分鐘數 |
|---|---|---|---|---|---|---|
| 積木入碗 | GPT-6 Astra | 19/20(95%) | 3.95 | 2.1k | 0.94 | 2.5 |
| 積木入碗 | Fable 5.1 | 8/20(40%) | 2.40 | 12.9k | 2.12 | 6.8 |
| 積木入碗 | Fable 5 | 1/20(5%) | 1.30 | 19.2k | 2.69 | 8.2 |
| 拼圖入槽 | GPT-6 Astra | 2/20(10%) | 2.00 | 2.7k | 1.36 | 3.4 |
| 拼圖入槽 | Fable 5.1 | 2/20(10%) | 2.35 | 10.5k | 2.18 | 5.9 |
| 拼圖入槽 | Fable 5 | 0/20(0%) | 1.50 | 16.3k | 2.63 | 7.9 |
抓放任務上,Astra 的完成率是 Fable 5.1 的 2.4 倍,每次成本約為 2.3 分之一,時間也從 6.8 分鐘縮到 2.5 分鐘(來源)。token 用量是關鍵:Astra 每次只輸出約 2.1k token,Fable 5.1 要 12.9k,這直接反映在成本與時間上。
插件任務要看細節。Astra 與 Fable 5.1 完成次數相同,都是 2/20,但 Astra 的平均階段 2.00 反而低於 Fable 5.1 的 2.35。也就是說,在失敗的那 18 次裡,Astra 平均走得比 Fable 5.1 更短。Robocurve 只說 Astra「到達溝槽後在與 Fable 相同的最後一步停住」,沒有解釋原因,這裡也不猜。
為什麼精準插件會卡住?
來源只給了現象,沒給原因:三個模型都在拼圖片對準圓槽的最後一步停住。這一步需要的是毫米級的位置修正,與抓放任務「大致放進碗裡就算成功」的容錯完全不同。
從 Robocurve 的階段分布可以看出差異。積木入碗任務中,Astra 有 19 次到達第 4 階段,剩下 1 次停在第 3 階段;拼圖入槽任務中,Astra 的 20 次分散在各階段,只有 2 次到 4(來源)。同一個模型、同一套手臂、同一套代理流程,容錯要求一變,成功率就從 95% 掉到 10%。
這個落差就是老闆該記住的重點。語言模型加機械手臂,目前擅長的是「拿起來、放過去」這類寬鬆任務;碰到組裝、插件、鎖固這類需要精準對位的工序,實測數據沒有任何一個模型過關。
GPT-6 Astra 的價格與規格是多少?
標準牌價是每百萬輸入 token 10 美元、每百萬輸出 token 50 美元,上下文長度 1M token(約 100 萬),最大輸出長度官方未公布(來源)。發布日期為 2026 年 9 月 4 日。
OpenRouter 頁面列出多個供應商與價位,以下僅列部分:OpenAI Flex 每百萬 5/25 美元、OpenAI 標準 10/50 美元、OpenAI Fast 20/100 美元、Azure 10/50 美元。這四家的快取讀取每百萬從 0.5 到 2 美元不等:Flex 0.5 美元、標準 1 美元、Fast 2 美元、Azure 1 美元。同頁另有 Azure (US) 等供應商,Azure (US) 為每百萬 11/55 美元,完整報價以 OpenRouter 原頁為準。同一頁列出 GPQA Diamond 得分 94.6%,這是研究生程度的科學問答題庫,屬於一般能力指標,與機械手臂表現無直接關聯。
換算回 Robocurve 的數字:一次抓放約 0.94 美元、一次插件嘗試約 1.36 美元。這是實驗室裡每次執行都由雲端模型即時決策的成本,若要放進產線一天跑上千次,光模型費就是一筆要先算清楚的帳。
這對台灣中小企業意味著什麼?
三個判斷,直接給。
第一,短期內不要為「AI 直接控制手臂」改任何採購決策。 很快會有整合商拿這份報告當簡報第一頁。你要看的是驗收數字:對方能不能在你的工件、你的治具上,用你的容錯標準跑出 20 次以上的完成率。連桌面拼圖都只有 10%,工廠級的插件與鎖固更沒有數據。
第二,先算每次決策的雲端成本,再談節省工程師。 目前每次執行 0.94 到 1.36 美元,時間 2.5 到 3.4 分鐘,這是一顆積木的價格與速度。傳統寫死的控制邏輯每次執行成本趨近於零、時間以秒計。語言模型的優勢在於不用逐行寫邏輯就能處理沒見過的情境,這個優勢只在「工件常變、產量不高、容錯寬鬆」的場景才算得過來,例如小批量的物料搬運或分揀。
第三,責任歸屬要在導入前寫進合約,而非事後補。 模型的每次動作都是即時推論,同一個指令不保證每次動作相同,Robocurve 的 20 次試驗裡就有分布差異。誰負責安全驗證、誰負責誤動作損失、模型更新後要不要重新驗收,這些問題會比技術成熟更早逼到現場。現在就把「每次執行有完整紀錄與影片」列為必要條件,Robocurve 做到了每一次都有逐字稿與影片可查,供應商沒理由做不到。
寫 AI 新知這條線,我們的立場一向是先把數字攤開再下判斷。這篇的判斷是:GPT-6 Astra 在實體操作上確實比前一代模型進步很大,但進步的是簡單抓放的成功率與成本,離「操作層不需要工程師」還差一整個精準對位的門檻。這個門檻什麼時候過,來源沒有給任何時程,我們也不替它猜。
如果你的公司正在評估把 AI 放進營運流程,先從資料與流程層開始,實體致動這一段等驗收數據到位再說。想知道你的品牌在 ChatGPT、Perplexity 這些 AI 引擎裡目前被推薦到什麼程度,可以到 AIRUN 的 AEO 服務頁 做一次體檢。
常見問題
GPT-6 Astra 真的能操作機械手臂做工廠任務嗎?
能做桌面級的簡單抓放,做不到精準對位。Robocurve 2026 年 9 月 4 日的第三方實測中,Astra 把積木放進碗裡的完成率是 19/20,把拼圖片插進圓槽只有 2/20。兩個任務都不是工廠任務,目前沒有任何數據支持它能上產線。
OpenAI 官方有宣布 GPT-6 Astra 支援機器人控制嗎?
沒有。OpenRouter 上的官方模型描述只提到進階分析、軟體工程、深度研究與電腦、瀏覽器操作,關於機械手臂或實體控制,官方未公布任何內容。機械手臂的測試是第三方評測站 Robocurve 用自己的手臂與代理流程做的實驗。
GPT-6 Astra 跟 Claude Fable 5.1 在機械手臂上誰比較強?
抓放任務 Astra 明顯領先,完成率 95% 對 40%,每次成本 0.94 美元對 2.12 美元,時間 2.5 分鐘對 6.8 分鐘。插件任務兩者都只完成 2/20,Astra 的平均階段分數 2.00 還略低於 Fable 5.1 的 2.35,兩者都卡在最後對位那一步。
用 GPT-6 Astra 控制機械手臂一次要花多少錢?
依 Robocurve 用牌價估算,一次抓放約 0.94 美元、一次插件嘗試約 1.36 美元。模型本身的標準牌價是每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。這是實驗室每次由雲端模型即時決策的成本,產線大量執行前要先算清楚。
台灣中小企業現在該為實體 AI 改變自動化採購嗎?
不該。目前的實測只證明簡單抓放可行,精準插件三個模型全部失敗。評估任何整合商提案時,要求對方在你的工件與容錯標準下跑出 20 次以上的完成率、每次執行留完整紀錄與影片,並在合約寫清楚誤動作責任與模型更新後的重新驗收。
AIRUN 對抗式創業體檢 AgentFlow Solutions(双云行銷試運行)