GPT-4.1 vs Claude 3.7 真實工作流實測:不看基準,只看干活
為什麼不談基準測試 每次新模型發布,都會有一堆基準數據湧出來。MMLU分數、MATH分數、HumanEval通過率。這些數字看起來很科學,但它們和你實際用模型干活時的體驗,往往差了很遠。 所以我們換個角度:用真實工作流來測。最近兩週,我們把 GPT-4.1 和 Claude 3.7 Sonnet 都接進了 SFD…

為什麼不談基準測試
每次新模型發布,都會有一堆基準數據湧出來。MMLU分數、MATH分數、HumanEval通過率。這些數字看起來很科學,但它們和你實際用模型干活時的體驗,往往差了很遠。
所以我們換個角度:用真實工作流來測。最近兩週,我們把 GPT-4.1 和 Claude 3.7 Sonnet 都接進了 SFD 實驗室的工作流,測了四類任務:程式碼生成、長文件處理、多步驟推理、中文內容創作。以下是真實結論。
程式碼生成:Claude 3.7 更好用,但有前提
Claude 3.7 第一次輸出基本可用,結構清晰,有錯誤處理,注解到位。改了兩處就能跑。GPT-4.1 結構也不錯,但有一個典型問題——給了一個「理論上完整但實際上跑不了」的版本。需要兩三輪修正。
前提是:Claude 3.7 在 Extended Thinking 模式下才有這個優勢。關掉 thinking,兩者差不多。Extended Thinking 的代價是回應時間從 8s 增加到 35s。
長文件處理:Claude 的雲幻雱制更穩定
我們用一份80頁的技術規格文件問了10個問題。Claude 3.7:10個問題8個完全正確,2個有資訊遗漏但沒有雲幻。GPT-4.1:7個完全正確,1個有明顯的資訊錯位。差距不大,但 Claude 的「不雲幻」表現更穩定。
多步驟推理:DeepSeek R1 才是真正的對手
在多步驟推理任務上,GPT-4.1 和 Claude 3.7 都不是最強的選手。DeepSeek R1 在這類任務上的表現比兩者都好,主要原因是它的推理造更「實誠」——它真的會在 thinking 過程中反覆檢驗自己的中間結論。
中文內容創作:Claude 3.7 明顯更好
GPT-4.1 的中文寫作有一種很難描述的「外國腔」——語法正確,但讀起來不像中文母語者寫的。Claude 3.7 的中文流暢很多,能感知中文讀者的閱讀習慣,用詞更自然。
SFD編者注
我們現在的實際用法:Claude 3.7 是主力,處理程式碼和內容;GPT-4.1 接進了部分自動化流水線做快速分類和摘要;DeepSeek R1 接了推理密集型任務的佇列。沒有單一模型能包打天下,組合起來才是正確答案。