9 月 2 日,三家机构同日发布了各自的新一代 AI 模型。Google 推出了 Gemini 3.8 Flash 系列,主打长周期软件工程能力;阿里千问更新了 Qwen3.8-Max-0902,在 Code Arena 编程总榜上超越 Claude Opus 5 max 夺冠;World Labs 发布了多模态世界模型 Atlas,支持像素级相机控制的图像视频生成与 3D 重建。

Gemini 3.8 Flash:为长周期任务重新设计的推理引擎

Google 此次发布了两个版本:Gemini 3.8 Flash(通用版)和 Gemini 3.8 Flash Cyber(网络安全专用版)。这是 Google 六周内推出的第三款 Flash 模型。

3.8 Flash 的核心改进在于"更努力地思考"。面对复杂任务时,模型会执行更多推理步骤、反复调用工具。Google 称这带来了在长周期任务上的实质性提升,代价是高思考强度下可能消耗更多 token。

关键 benchmark:

3.8 Flash 的定价走"先甜后苦"路线。2026 年底前享受推广价 $0.75/百万输入 token(≈¥5.47)、$3.75/百万输出 token(≈¥27.38)。2027 年 1 月 1 日起价格翻倍至 $1.50/$7.50。

3.8 Flash Cyber 版本专为网络安全场景设计。在 CyberGym 自主漏洞发现基准测试上,它超过了 3.5 Flash Cyber 和多个更大的前沿模型。该版本目前仅通过 Fairwind 计划向受信任的安全团队开放。

模型已上线 Gemini API、Google AI Studio、Android Studio、Google Antigravity 等平台。支持文本、图片、音频、视频输入,上下文窗口最高 100 万 token,单次输出最多 6.4 万 token。

Qwen3.8-Max-0902:Code Arena 冠军,编程能力再突破

阿里千问同日发布了 Qwen3.8-Max 的 0902 快照版本。这是基于 Qwen3.8-Max 进行进一步后训练的升级版,重点强化编程和专业办公场景。

在 Code Arena 前端编程总榜中,Qwen3.8-Max-0902 以 1691 分夺冠,比之前提升 22 分,超过了 Claude Opus 5 max。Code Arena 同步更新的性价比榜单(帕累托前沿)显示,该模型每百万 token 综合均价为 $5。

技术规格:

千问方面表示,0902 版本在多工具编排和端到端任务交付上有明显进步,视觉理解能力也在图表推理、文档解析等多模态感知任务上更加精准。

模型已上线千问 AI 平台,同时接入千问办公、Qoder、千问 App。

World Labs Atlas:从图像生成到 3D 世界重建

World Labs(李飞飞创办的空间智能公司)于 9 月 1 日发布了 Atlas。这是一个从头预训练的多模态世界模型,能同时处理文本、图像、视频和 3D 数据。

Atlas 采用多模态自回归扩散 Transformer 架构,将所有输入合并到共享的空间上下文中进行推理。

核心能力:

World Labs 表示 Atlas 的性能随训练算力增加而持续提升,部分合作伙伴已获得抢先体验资格,早期访问将在未来几周内开放。

三者对比

特性Gemini 3.8 FlashQwen3.8-Max-0902World Labs Atlas
发布方Google阿里千问World Labs
定位长周期推理/编程编程/办公 Agent多模态世界模型
上下文1M token1M tokenN/A
输入价格$0.75/M(促销)$2/M未公开
输出价格$3.75/M(促销)$6/M未公开
视频生成✓(1440p, 1min)
3D 重建
网络安全版✓(Cyber)
开放程度公开 API公开 API抢先体验

影响

Google 和千问在同一天更新了各自的旗舰模型,竞争焦点集中在长周期编程和自主 Agent 两个方向。3.8 Flash 在 DeepSWE 上超过更大模型的表现,以及 Qwen3.8-Max-0902 在 Code Arena 上超越 Claude Opus 5 max,都在传递一个信号:Flash 级别的轻量模型正在逼近甚至超过传统旗舰模型在特定任务上的能力。

World Labs 的 Atlas 则开辟了另一条赛道。从单一图像重建完整 3D 场景、在视频生成中保持像素级几何一致性,这些能力如果按承诺落地,对机器人仿真、数字孪生和创意工具都会产生实际影响。