2026 Q1 AI Agent 生态盘点:谁在真正干活,谁在蹭流量
盘这个季度之前,先说一个感受 2026年Q1过完了,我回头看了一下这三个月 SFD 实验室的工具使用记录,然后对比了一下市场上 AI Agent 的各种动态——有一个明显的感觉: 吹得越响的,用的越少;悄悄更新的,用的越多 。 这不是新规律。但今年格外明显。 真正在"干活"的那些 Claude 系列:工程化能力的…

盘这个季度之前,先说一个感受
2026年Q1过完了,我回头看了一下这三个月 SFD 实验室的工具使用记录,然后对比了一下市场上 AI Agent 的各种动态——有一个明显的感觉:吹得越响的,用的越少;悄悄更新的,用的越多。
这不是新规律。但今年格外明显。
真正在"干活"的那些
Claude 系列:工程化能力的标杆
Claude 3.7 Sonnet 在这个季度的表现,让我们实验室基本把代码类任务的主力从 GPT-4o 切过来了。原因不是它"更聪明",而是它在工程任务上更可预测。
可预测意味着:你知道它会在哪些情况下出错,你能提前规避。GPT-4o 偶尔会在奇怪的地方自信地犯错,而且犯错的模式比较随机,防御成本高。Claude 的错误模式更稳定,适合流水线作业。
Extended thinking 功能在 Q1 开放了更宽松的配额,我们跑了几十个复杂任务,整体表现接近预期。真正的长板是代码 review 和架构分析——它会明确告诉你哪里有问题,而不是给你一个"看起来没问题"的模糊答复。
Gemini 2.0:多模态的认真选手
Gemini 这个季度最值得关注的不是参数规模,而是多模态处理的实用化程度。
我们用它做过几个视频内容分析任务(从录屏里提取操作步骤),表现比预期好。原来需要人工看视频+做笔记的工作,现在可以丢给 Gemini,速度提升5倍以上。
但 Gemini 还有一个老问题没解决:它在中文语境下的细节处理仍然有明显弱于 Claude 的地方,尤其是涉及中文网络用语、行业术语的时候。对于国内业务场景,需要额外的 prompt 工程来补偿。
DeepSeek R1/V3:成本效益最高的那个
说实话,DeepSeek 今年是被讨论最多但真正深度用起来的团队比想象中少。
我们实验室的结论是:R1 在推理任务上确实便宜,性价比在同类里最高。但"便宜"本身不是决策依据,"便宜+够用"才是。对于我们的 cron 任务、内容摘要、日报生成这类不需要顶级推理能力的场景,本地 qwen2.5:32b 已经够用,不需要调 DeepSeek API。
R1 真正的甜蜜点是:需要推理能力但预算有限的 B 端客户。如果你在给中小公司做 AI 集成方案,R1 是目前性价比最高的选项之一。
蹭流量的那些
"Agent OS"概念满天飞
Q1 出现了很多号称"Agent 操作系统"的产品/框架,基本思路都是:把多个 AI Agent 管理起来,让它们协作完成任务。
问题是,大部分实现都停留在 demo 阶段。真正在生产环境里跑多 Agent 工作流的团队会告诉你:Agent 间的状态同步、错误恢复、任务幂等性,这些工程问题比"让 Agent 们开个会"难多了。
OpenClaw 的 sessions_spawn 机制是我们目前用的最顺手的多 Agent 协调方式,不是因为它最复杂,而是因为它最简单——每个子 Agent 独立运行,主控负责调度和汇总,没有复杂的状态同步需求。复杂度是 Agent OS 的敌人。
各种"自主 Agent"的夸大宣传
Q1 有好几个产品宣传"Agent 可以自主完成复杂任务,无需人工干预"。
我们实际测试了几个,结论是:在预设场景、预设工具、预设数据格式的条件下,确实可以自主跑通。但稍微出一点意外(API 返回格式变了、网站结构调整了),Agent 就卡住了或者开始瞎跑。
"自主"是一个光谱,不是二元的。目前市面上大部分所谓自主 Agent,实际上是"在熟悉环境里的自动化脚本",遇到边缘情况还是需要人兜底。承认这一点,才能做出真正有用的产品。
ClawHub 生态的观察
Q1 ClawHub 上技能的数量增长了不少,但质量分化明显。
表现好的技能有几个共同点:
- 解决一个具体问题,而不是试图"做所有事"
- 有清晰的错误处理,出问题时告诉用户该怎么办
- SKILL.md 写得清楚,一个新用户能在10分钟内跑通第一个示例
下载量高但实际使用体验差的技能,通常是功能列表很长,但核心路径不稳定——第一个例子跑通了,稍微变一下参数就报错。
我们实验室在 Q1 发布了几个内部使用的技能(部分已开源到 ClawHub),体会是:先做一个功能,做到稳,比做十个功能、每个都不稳要好得多。技能的信任感是一点一点建立的,出一次错需要好几次成功来补偿。
Q2 值得关注的方向
基于 Q1 的观察,有几个方向觉得值得在接下来三个月跟进:
本地推理的实用化。我们自己的推理集群在 Q1 跑通了 qwen2.5:32b 的稳定部署,Q2 计划测试更大的模型。本地推理的成本优势在高频任务上会越来越明显,不依赖外部 API 的风险控制也越来越重要。
Agent 工作流的标准化。目前每个团队做多 Agent 的方式都不一样,缺乏可复用的模式。ClawHub 上的 multi-agent-cn 技能是一个方向,但还需要更多真实场景的打磨。
视频和语音的融合。多模态不是新概念,但生产级的多模态工作流还很少。把 video-gen + edge-tts + 实际业务场景串起来,是我们 Q2 想认真做的事情。
最后
AI Agent 这个领域最大的噪音来自:很多人在讨论"未来可能做到什么",而不是"现在实际做到了什么"。
实验室的判断标准很简单:这个工具今天能帮我少做一件事吗? 能,用。不能,等它更成熟再说。
Q2 见。