阿里 Qwen3.8 Max 登顶 Agentic Index
8 月 6 日,Artificial Analysis 更新了 Agentic Index(智能体能力指数),阿里 Qwen3.8 Max 排到综合第一。这条消息在 Hacker News 上拿到 420 多分,社区讨论里有人拿它和 Kimi K3 做同样的排障对比,说 Qwen 会自己搭诊断工具、做统计分析。
Qwen3.8 Max 是 8 月 3 日正式发布的,属于 Qwen 家族目前最强的型号。总参数量 2.4 万亿,激活参数 95B,上下文窗口 1M tokens。这是阿里第一次开源 Max 级别的权重,官方说权重会在发布后一周放出,同批还有 Qwen3.8-27B。27B 版本在 HN 上被不少人称为"真正的新闻",因为 Qwen3.6-27B 本来就是本地跑模型的热门选择。
在 Artificial Analysis 的智能指数(Intelligence Index)上,Qwen3.8 Max 得 58 分,对比模型的中位数是 33。定价是输入 $2/百万 tokens、输出 $6/百万 tokens,缓存命中 $0.25(省 88%)。
自主编程的三个演示
官方博客展示了三个全自主的编程案例,全程没有人工介入:
第一个是让模型从零开始维护一个开源 CLI 项目 oh-my-cli,跑了 10 多天。需求从 GitHub Issues 进来,模型自己认领、写代码、跑测试、合并 PR。截至 7 月 30 日,仓库积累了 265 个 commit、127 个 PR 和 151 个 issue。
第二个是复现一篇关于"LLM 推理数据选择"的论文。模型只有论文和 GPU,自己写了 7600 行代码,花了约 125 小时跑完 33 轮训练,复现了论文的六个主要结论(论文的方法在 AIME24 上比随机选数据高 7.7 个百分点)。之后它又自己跑了 88 小时的改进循环,提出 18 个改进思路,最终把 AIME24 分数再提高了 2.7 分,超过原论文方法。
第三个是参加阿里云天池上一个 526 支人类队伍的比赛(多模态对话意图识别)。模型在 24 小时内自己读规则、微调 BERT 系模型和 Qwen2.5-VL-7B、搭加权投票系统,45 次提交把准确率从 0.60 提到 0.853,超过 458 支人类队伍。
长任务与多模态
Qwen3.8 Max 还演示了芯片设计:让它自主优化一个 GCD/RSA 密码加速器,从 8298 门一路压到 678 门,物理布局面积从 106×106 微米缩到 46×46 微米(减少 81%),最终在 500MHz 达成时序收敛。
电商模拟基准(365 天运营模拟,基于淘宝天猫脱敏数据)上,模型年终总余额 ¥416,252,是初始资金 10 万的 4.16 倍,比第二名 GLM 5.2 高 38%。多模态方面支持 200 页以上 PDF 和 100 小时以上视频的处理,官方还发了 Qwen-MM-Plugins,让现有 agent 框架直接接入图像、视频处理能力。
OpenAI 更新 GPT-5.6 Sol,Luna 免费开放
同一天,OpenAI 宣布 ChatGPT 的一系列更新。Plus 和 Pro 用户的 GPT-5.6 Sol 做了调优,回答更聚焦、事实更可靠,还加了思考深度滑块,同一个模型同时负责即时回答和深度推理。
免费用户的变化更大:默认模型换成 GPT-5.6 Luna,文本聊天不限量。遇到更难的题可以点 Think 按钮临时调用更高推理能力。OpenAI 在公告里说每周有 10 亿人用 ChatGPT,这次调整明显是想把更多算力让给免费层,同时应对 Google AI Mode 等竞品对搜索型用户的争夺。HN 评论区有人评论"免费无限 Luna 是很厉害的一步棋"。
怎么看这两天
Qwen3.8 Max 和 GPT-5.6 Luna 免费开放撞在同一天,方向其实一致:模型的竞争重点已经从"谁更聪明"转向"谁能干更长的活"。Qwen 用 2.4T 参数和开放权重证明自主长任务能力,OpenAI 用免费策略守住用户盘子。对普通用户来说,免费层能用的模型质量在明显上升,这是最实际的变化。






