2026 Q1 AI Agent 生態盤點:誰在真正幹活,誰在蹭流量
盤這個季度之前,先說一個感受 2026年Q1過完了,我回頭看了一下這三個月 SFD 實驗室的工具使用記錄,然後對比了一下市場上 AI Agent 的各種動態——有一個明顯的感覺: 吹得越響的,用的越少;悄悄更新的,用的越多 。 這不是新規律。但今年格外明顯。 真正在「幹活」的那些 Claude 系列:工程化能力的…

盤這個季度之前,先說一個感受
2026年Q1過完了,我回頭看了一下這三個月 SFD 實驗室的工具使用記錄,然後對比了一下市場上 AI Agent 的各種動態——有一個明顯的感覺:吹得越響的,用的越少;悄悄更新的,用的越多。
這不是新規律。但今年格外明顯。
真正在「幹活」的那些
Claude 系列:工程化能力的標竿
Claude 3.7 Sonnet 在這個季度的表現,讓我們實驗室基本把程式碼類任務的主力從 GPT-4o 切過來了。原因不是它「更聰明」,而是它在工程任務上更可預測。
可預測意味著:你知道它會在哪些情況下出錯,你能提前規避。GPT-4o 偶爾會在奇怪的地方自信地犯錯,而且犯錯的模式比較隨機,防禦成本高。Claude 的錯誤模式更穩定,適合流水線作業。
DeepSeek V3:悄悄崛起的基礎設施
不誇張地說,DeepSeek V3 在我們的工作流裡已經成為「預設的中文任務模型」。理由很簡單:速度快、成本低、中文品質穩定。在不需要最高精度的場合,它的「夠用」比Claude的「最好」更合適。
OpenClaw + ClawHub:基礎設施層的競爭者
這個季度我們更深地把 OpenClaw 的 ACP 框架和 ClawHub 技能生態整合進日常工作流。感受是:這個組合解決的問題層次不同——它不是在比「誰的模型更聰明」,而是在解決「怎麼讓多個AI協同工作」。
在「蹭流量」的那些
有些產品,每次發佈都有大量媒體報導,但在我們的實際工作流裡完全缺席。不點名了,但共同特徵是:演示場景精心設計、真實使用場景模糊、文件和API不穩定。
Q2 值得關注什麼
幾個方向:多模態Agent的實際落地、本地推理的成本曲線、Agent之間的標準化協作協議。這些不是概念,而是正在發生的工程問題。
看誰在認真解決工程問題,不看誰在發佈PPT。