語音 coding agent 適合把進度往前推
Simon Willison 分享了一個很有意思的實測。他用 ChatGPT desktop app 的 Codex voice mode,搭配 GPT-6 Astra High,在做晚餐的 30 分鐘裡,完成 Django newsletter 功能的大部分工作,包含 model、migration、四種匯入來源、archive pages、搜尋整合和視覺調整。接著再花 30 分鐘用鍵盤 review PR,修正 private Git repo 的 import 方式並微調頁面。
從產品面來看,voice mode 解決的是開發進度容易被零碎時間切斷。做飯、洗碗或通勤時,腦中可能已經有下一個功能和資料流程,手卻沒有空打開 editor。這時可以描述目標、補充背景、回答 agent 的追問,讓任務先往前走。對個人開發者和小團隊來說,少一次 context switching,價值可能比多一個 code generation shortcut 更直接。
語音適合高層次、可委派、結果容易驗證的工作,例如建立 model、規劃 migration、接一個 import pipeline、列出實作步驟,或先做一版 UI。使用者提供意圖和限制條件,agent 自行探索 repository,最後交付一個可以檢查的版本,這就是它的甜蜜點。
細節修改就該切回鍵盤。貼錯誤訊息、指出 function 的精確位置、比較兩個 implementation,靠聲音描述容易漏上下文。code review 也需要同時看 diff、測試結果和實際畫面。private repository 的權限、資料格式和安全設定,更需要逐項確認,不能只說一句「把它接起來」。
我會問自己三件事。現在是在探索方向,還是在確認細節?前者開語音,後者回文字。錯一次的成本高不高?草稿頁面可以重做,付款流程、刪資料和 production 設定就用鍵盤。成果能不能稍後集中檢查?可以先讓 agent 做,再安排 review,語音才有優勢。
所以 30 分鐘語音加 30 分鐘鍵盤 review,是很健康的工作分工。前半段把空檔變成進度,後半段把品質和風險收回來。語音負責讓模糊想法開始移動,文字負責確認它能不能交付。
作者:MingTech