個人環境以 Codex 和 Open Code 為主,同時在工作中使用 Claude Code 的心得感觸總結

3 min

language: ja bn en es hi pt ru zh-cn zh-tw

你好,我是無能。

感覺好像沒什麼綜合性的總結,所以想隨性地寫一下(盡可能公平地)在使用各種工具後的感想。內容包含很多立場偏見。

話說回來,既然每種工具的用法都不同,真的能進行公平的評估嗎?關於這一點...

各模型感想

Codex

平時主要使用的是 Codex。

在 Bug 修復建議及其實現方式的聰明程度上,它是 OpenAI 的 LLM 模型,而且可能是在強大的基礎設施環境下運行,響應速度很快,不會讓人感到煩躁。由於它能以最小限度的修改完成任務,所以在執行 git diff 時非常易讀,但這一點隨著其他 LLM 模型也變得越來越聰明,感覺也不再是絕對優勢了。

基本上只要把有問題的偵錯日誌交給它,大都能解決,很少會卡住。

個人認為網頁版 ChatGPT 的審查能力非常強大,在個人環境中,我經常在 ChatGPT 的審查和 Codex 之間來回切換。可以直接將腦力激盪的結果反映到程式碼中,最終也減少了無用的提交(commit)。

而且,這不會消耗 Codex 的額度,所以非常推薦將其與網頁版 ChatGPT 併用。

我個人的預測是,為了在 IPO 前拉高估值,他們可能會增加重置機會,但目前與網頁版來回切換時的 Token 消耗完全沒有減少,所以也沒什麼困擾。

我認為它原生基本上無法進行多代理(multi-agent)式的用法,所以在那種情況下,使用其他的編碼代理可能會更好。

Open Code

我會用它來生成臨時用的 bash 腳本、直接調查粗略的日誌,或者在多個儲存庫中套用簡單的 GitHub Actions 等簡單任務或調查類工作。目前主要使用的是仍可免費使用的小米模型 Mimo V2.5,特別是在以多代理方式執行調查任務時,效率非常高。

我也會讓它總結 API 端點的實際回應調查,然後直接在 Codex 側進行實作。因為會被拿去學習,所以在那種情況下的 API Key 我會立即撤銷(Revoke)。

雖然資安意識漏洞百出,但比起為了保護 API Key 而採取迂迴的做法,這總是最簡單直接的。

基本上在主要的編碼工作中不太使用它。

關於額度,似乎是 9 小時制的,但目前為止我只遇過一次達到上限,所以我認為以免費額度來說,它相當充裕。

不過,就編碼而言,目前我使用 Neuralwatt 搭配 GLM-5.2,憑藉其壓倒性的上下文長度,當我交辦一些連 Codex 都找不到的安全性相關調查任務時,它往往能發現問題,因此非常受重用。除了安全性任務外,在編碼方面我也覺得 GLM-5.2 非常實用。我沒用過 Kimi,所以不清楚。

負面部分的話,如果反覆多次啟動和關閉,它會在 /tmp/ 存放大量暫存檔案,等察覺時已經無法啟動了。

Claude Code

整體輸出量很大,會造成資訊淹沒。在初期開發應用程式編碼時可能不錯,但如果要問我想不想在個人開發中使用,感覺有點微妙。有時它會做出超出必要的實作,這點有時會讓人困擾。

安全性調查類的任務,現在因為 Fable 的審查太過嚴重,根本無法使用。

而且,我記得個人方案也是一樣的,它與網頁版聊天的額度是共用的,一旦達到上限無法使用就結束了。不過,我記得商務版的 ChatGPT/Codex 似乎也是分開計算的,所以實質上可能是一樣的。

不過,我喜歡的開發者 xroche 先生使用 Claude 重新開始維護了停更一段時間的 HTTrack,所以這可能純粹是因為我已經習慣了 Codex,才對它有負面印象。

如果還有另一個負面印象,那就是 Anthropic 公司在商業行銷上非常成功,但我有時覺得實際情況與行銷有所落差,這或許是為了在 IPO 前拉高估值而做的,但他們正在進行一些讓人感到疑惑的活動,如下所示:

這些活動作為保護美國產業的代言人或許能發揮作用,但對於中國半導體相關的限制,說實話有些令人同情,感覺政治手段拙劣,或者說對其持續性存疑。

而且過去 FTX / Alameda 曾持有其股份,這也讓人感到有些不安。雖然已經因破產而清算完畢,且僅僅是眾多投資對象之一,但還是有一種難以言喻的感覺。

結語

老實說,現在大部分的模型都很優秀,就實作層面而言,只要正確使用,感覺差別並不大,但我還是希望那些只靠 Open Code 苦撐的人能嘗試一下 Codex。

結束。

Related Posts