AI日报 | 2026年8月26日:阿里千问Qwen3.8-Flash开源,智谱GLM-5.3-Flash对标Opus仅1/40价
2026年8月26日AI行业要闻速览:阿里开源Qwen3.8-Flash(125B/6B激活,超越Claude Opus,输入1元/百万tokens);智谱开源GLM-5.3-Flash原生多模态模型,价格仅Opus 1/40;OpenAI再降价20%引发价格战;IBM Granite 4.2开放推理模型;京东物流超脑大模型3.0。
头条:阿里 Qwen3.8-Flash 开源,6B 激活干翻 Opus、只要 1 元
8月26日晚,阿里发布并开源千问 Qwen3.8-Flash:采用下一代(Qwen4 雏形)架构,125B 总参仅激活 6B,在 DeepSWE、CoWorkBench 等基准上超越 Claude Opus 4.6、接近 4.8;每百万 token 输入 1 元、输出 3 元,约为 DeepSeek-V4-Flash 的 1/3,训练成本较前代降近 90%,权重已上 Hugging Face 与魔搭。
看点在于「小激活 + 高性能」被验证为可规模化的工程路线:过去 MoE 是把参数摊薄,这次把激活压到 6B 还能超 Opus,意味着长上下文、整库分析的推理成本真正进入平民区间。国产模型从「性价比」转向「性能也够用」的拐点正在发生。(来源:南方都市报)
智谱 GLM-5.3-Flash 开源:对标 Opus,价格仅其 1/40
8月26日,智谱上线并开源 GLM-5 系列首个原生多模态模型 GLM-5.3-Flash(320B-A18B),AA 综合智能指数 57 分与 Claude Opus 4.8 持平、编程表现相当,定价为 Opus 4.8 的 1/40,首次大规模使用国产芯片集群服务,端到端性能提升 3 倍,单 token 成本已比肩英伟达 GPU。
这是国产芯片承载前沿模型的一次公开压力测试:若 10 万张国产卡能稳定跑出对标 Opus 的服务,那么「算力自主」就从口号变成可验证的能力。对国内用户,同等体验下成本骤降,长尾应用有了落地理由。(来源:IPO 早知道)
价格战再升温:OpenAI 月内二次降价,谷歌半价跟进
8月26日消息,OpenAI 宣布一款大模型价格下调 20% 以上、输出降至每百万词元 20 美元,为不到一个月内第二次降价;谷歌 Gemini 3.7 Flash 以半价首发,Anthropic 取消涨价转永久优惠价。《福布斯》预言「价格逐底战」来临。
当三家同时往下调,说明推理成本曲线仍在陡降,且各家都用降价抢开发者心智。对做产品的团队,这是把「贵的功能」重新塞回免费层的窗口期;但也要警惕低价不可持续,选模型时留好可替换接口。(来源:观点新媒体)
更多值得关注的动态
- 京东物流发布「超脑」大模型 3.0:PreX/OptiX/OmniX/GeoX/EmbodiedX 五大工业模型,亿级包裹路径规划从分钟级压到秒级,车辆自动化调度率 86%。(来源:贝果财经)
- IBM 发布 Granite 4.2:首款密集推理模型(3B/8B/30B),Apache-2.0 权重、可关掉的 thinking 模式,面向企业可控部署。(来源:Hugging Face)
- Anthropic 推 Claude Code 2.1.246 安全更新:网关 API key 不再发往 Anthropic;Claude 共享记忆打通 chat 与 Cowork。(来源:Anthropic)
- OpenAI 自研推理芯片 Jalapeño 首测:每瓦特工作量 1.9 倍于当前硬件,128 芯片/1.7 exaFLOPS/27TB HBM,剑指 Blackwell 与 Rubin。(来源:SemiAnalysis)
- 腾讯开源 WeMM-Embedding 多模态检索模型(2B/4B/9B),文/图/视频/文档统一向量空间。(来源:腾讯)
- 苹果 M6 与 M5 Ultra 亮相:首款 2nm 芯片、512GB 内存,明确为本地大模型推理设计。(来源:TechCrunch)
- Perplexity 推出可完全本地运行的 Agent:DGX Spark 或 24GB RTX,无云依赖。(来源:Perplexity)
一句话总结今日
国产模型用「小激活 + 国产卡」把性能与价格同时拉到新位置,而国际巨头用连续降价守住开发者——2026 下半年的主旋律,是把上个月还贵的功能,这个月变成默认配置。
💬 评论与反馈
有什么想法?吐槽、建议、补充——直接说,每条都会看。
或者直接联系我们: