2026 年 4 月 AI 行业周报:GPT-4o 图像生成炸场,开源模型大混战
OpenAI 悄悄上线 GPT-4o 原生图像生成 4 月初,有人发现 GPT-4o 的 API 里多了一个 image_generation 参数。不是 DALL·E,不是 Midjourney 的接口,是 GPT-4o 直接出图 。 测试了一波,效果怎么说呢——比 DALL·E 3 好,但离 Midjourn…

OpenAI 悄悄上线 GPT-4o 原生图像生成
4 月初,有人发现 GPT-4o 的 API 里多了一个 image_generation 参数。不是 DALL·E,不是 Midjourney 的接口,是 GPT-4o 直接出图。
测试了一波,效果怎么说呢——比 DALL·E 3 好,但离 Midjourney v7 还有距离。文字渲染有明显进步(之前大模型的死穴),人脸和手部还是有偶发性崩坏。
真正让人在意的是价格:一张 1024×1024 的图片大约 $0.04。对比 Midjourney 的 $10/月(无限但排队)和 DALL·E 3 的 $0.04/张,这个定价策略的意图很明显——OpenAI 想把图像生成变成 API 里的一个功能调用,而不是独立产品。
对开发者来说这是好事。以后在同一个 API 调用里就能同时要文本回复和配图,不用额外接图像 API。但对图像领域的创业公司来说……又是紧箍咒。
开源阵营:Qwen3-Coder 和 DeepSeek V3.5 正面刚
Qwen3-Coder 开源后,我们第一时间在 SFD 的本地集群上跑了一轮测试。
结果:代码生成能力确实猛。在 HumanEval 测试集上跑到了 92.3%,跟 Claude Sonnet 4 的 94.1% 差距已经很小了。关键是——72B 参数,4 张 A100 就能推理。这对不想把所有代码都发给 OpenAI 的公司来说,是个很有吸引力的方案。
与此同时,DeepSeek V3.5 也悄悄更新了。MoE 架构下的激活参数只有 4.2B,但整体参数规模 236B。这意味着什么?意味着在合适的硬件上(比如我们的 MLX 集群),推理成本比同等性能的密集模型低了大概 5 倍。
2026 年 Q1 最明显的趋势就是:开源模型在代码能力上已经跟闭源模型打平手了。剩下的差距不在能力,在产品集成和生态——Claude Code、GitHub Copilot 这些闭源产品之所以受欢迎,不是因为模型本身强很多,而是因为它们的 IDE 集成、代码补全体验真的好用。
AI Agent 的「Agent」这个词越来越不够用了
上周参加了新加坡的一个 AI Meetup,有人抛了个观点:「Agent」这个词已经不够准确了。现在的 AI 已经不是「帮你做事」的 Agent,而是「自己判断要做什么事」的协作实体。
他举了个例子:在 SFD 实验室,我们的 15 个 Agent 每天早上会自己检查任务队列、分配工作、互相交接,完全不需要人介入。上周小猎鹰做安全扫描时发现一个 API 的 CORS 配置有问题,它没有等人发现,直接写了修复方案,等小蜜蜂醒了之后推送部署。
这不是 Agent,这是同事。
行业趋势也是这样。从 OpenClaw 的 33,000+ 技能生态到 n8n 的低代码自动化,AI 已经从「工具层」进入了「团队层」。你在管理的不是一堆工具,而是一个会自己运转的系统。
一个小细节:本地推理集群越来越多人装了
一个不起眼的趋势:越来越多的开发者和中小企业开始搭建本地推理集群,不再把所有请求都发到云端。
原因是成本。不是算力成本变高了,是 API 调用的隐性成本——数据隐私、延迟、供应商锁定,以及最实际的:当你一天跑几十万 token 时,云端 API 的账单真的不便宜。
我们用 Qwen3.5 35B 在两台 Mac Studio 上跑本地推理,单 token 成本几乎是零。当然有局限性——模型规模受限,并发上不去,但对于内容生成、代码辅助、日常问答这些场景,完全够用。
一周总结
本周最大的感受:2026 年的 AI 行业正在从「功能竞赛」转向「效率竞赛」。不是谁能多做一个功能,而是谁能用更少的资源跑出同样的效果。
开源模型在缩小差距,本地推理在降门槛,Agent 在变自主化。这些趋势指向同一个方向:AI 不再是只有大公司玩得动的东西。
SFD 编者注
这周我们做了个决定:把所有付费模型调用都切到免费或平替方案(OpenRouter + 本地 Qwen3.5 兜底)。省钱不是目的,目的是验证一套「不依赖任何单一供应商」的推理通路。现在 15/15 Agent 全跑通了,每天省了不少钱。这个经验之后会写篇文章详聊。