Post
2026年9月5日 上午09:40
歡迎所有互動

GPT-6 Astra使用半天的心得

Oh-My-Pi harness。主要使用Astra-Low,只有Reviewer subagent用Astra-Medium。

Agent-Flow/Graph能力極佳

模型本身可以理解事務之間相依性,平行調用subagent的積極程度提升非常多。例如當不同平台需要不同實作時Astra會傾向先思考contract,然後各平台指派各自的subagent。

5.6 Sol偶爾也會這麼做,但Astra切分事務的方式make sense很多。而且跟Claude Code用harness逼迫模型切subagent的方式不太一樣,Astra不需要harness就會有這種行為。

理解意圖的能力有明顯上升

可惜還是跟Fable差一大截。

我給5.6的固定prompt會包含目前專案的常見用詞解說,下prompt時也會稍微提醒一下目前修改範圍內的通用詞彙,不然Sol很容易開始想偏。

在下prompt給Astra的時候就不太需要這樣做。大部分狀況下Astra會注意到我的prompt給得不是很明確,然後會用兩三道grep看現有程式碼嘗試理解我在說什麼。

(但也是有例外啦,有一次不小心叫他screenshot沒有說明是要用adb exec-out screencap,agent就開始撞我macOS的螢幕截取權限🫠

使用詢問工具的意願更積極而且更有組織

這個比較難說明。感覺上Astra的思考鏈(CoT)會先走過重要技術決策點,把不確定的地方標記下來整理後一次問。不過OpenAI model現在已經不回傳CoT了所以不太好確認。

但至少詢問次數有明顯上升。5.6一週可能問不到一次,而Astra使用不到12小時就已經問了快20幾次。而且問的問題還真的需要我思考一下。

Long-Horizon的部分反而沒有明確進步

這個是相對5.6 Sol Medium而言。

6 Astra Low的能力理論上介於5.6 Sol High/Medium之間,但我感覺不出來在long horizon task上相對5.6 Sol有任何進步。

同樣一個功能大約還是要來回6~8次才至少能動,Verification step的效果還是不佳,走到後面很容易從功能目標降回prompt目標。

UI/UX還是很⋯⋯OpenAI

Opus➡️Fable的UI/UX能力有明顯提升,但Sol➡️Astra沒有。

實際上Astra給出的設計跟Luna可能差不了多少,這點還蠻尷尬的。

而且這是在有給Design System、Apple HIG、跟一堆有的沒的Skill的狀況下。我不太敢想像裸跑會給出多慘的設計。

好我知道這不是模型的缺點。

QQ

還沒有人留言。想成為第一個嗎?