9 月 2 日,三家机构同日发布了各自的新一代 AI 模型。Google 推出了 Gemini 3.8 Flash 系列,主打长周期软件工程能力;阿里千问更新了 Qwen3.8-Max-0902,在 Code Arena 编程总榜上超越 Claude Opus 5 max 夺冠;World Labs 发布了多模态世界模型 Atlas,支持像素级相机控制的图像视频生成与 3D 重建。
Gemini 3.8 Flash:为长周期任务重新设计的推理引擎
Google 此次发布了两个版本:Gemini 3.8 Flash(通用版)和 Gemini 3.8 Flash Cyber(网络安全专用版)。这是 Google 六周内推出的第三款 Flash 模型。
3.8 Flash 的核心改进在于"更努力地思考"。面对复杂任务时,模型会执行更多推理步骤、反复调用工具。Google 称这带来了在长周期任务上的实质性提升,代价是高思考强度下可能消耗更多 token。
关键 benchmark:
- DeepSWE v1.1(长周期软件工程测试):超过多数体量更大的前沿模型
- HLE-Verified:54.9%,覆盖 STEM、人文、专业领域的多步推理
- Vals Finance Agent V2:金融领域专业分析超越 3.7 Flash
- Harvey's Legal Agent Benchmark:法律领域同样表现突出
3.8 Flash 的定价走"先甜后苦"路线。2026 年底前享受推广价 $0.75/百万输入 token(≈¥5.47)、$3.75/百万输出 token(≈¥27.38)。2027 年 1 月 1 日起价格翻倍至 $1.50/$7.50。
3.8 Flash Cyber 版本专为网络安全场景设计。在 CyberGym 自主漏洞发现基准测试上,它超过了 3.5 Flash Cyber 和多个更大的前沿模型。该版本目前仅通过 Fairwind 计划向受信任的安全团队开放。
模型已上线 Gemini API、Google AI Studio、Android Studio、Google Antigravity 等平台。支持文本、图片、音频、视频输入,上下文窗口最高 100 万 token,单次输出最多 6.4 万 token。
Qwen3.8-Max-0902:Code Arena 冠军,编程能力再突破
阿里千问同日发布了 Qwen3.8-Max 的 0902 快照版本。这是基于 Qwen3.8-Max 进行进一步后训练的升级版,重点强化编程和专业办公场景。
在 Code Arena 前端编程总榜中,Qwen3.8-Max-0902 以 1691 分夺冠,比之前提升 22 分,超过了 Claude Opus 5 max。Code Arena 同步更新的性价比榜单(帕累托前沿)显示,该模型每百万 token 综合均价为 $5。
技术规格:
- 上下文窗口:1M token(最大输入 991K,最大输出 131K)
- 定价:输入 $2/百万 token,输出 $6/百万 token
- 支持输入类型:文本、图片、视频
- 支持功能:Function Calling、Web Search、Code Interpreter、Fine-tuning
- 隐式缓存读取价格:$0.25/百万 token
千问方面表示,0902 版本在多工具编排和端到端任务交付上有明显进步,视觉理解能力也在图表推理、文档解析等多模态感知任务上更加精准。
模型已上线千问 AI 平台,同时接入千问办公、Qoder、千问 App。
World Labs Atlas:从图像生成到 3D 世界重建
World Labs(李飞飞创办的空间智能公司)于 9 月 1 日发布了 Atlas。这是一个从头预训练的多模态世界模型,能同时处理文本、图像、视频和 3D 数据。
Atlas 采用多模态自回归扩散 Transformer 架构,将所有输入合并到共享的空间上下文中进行推理。
核心能力:
- 相机控制生成:从一张或多张图像出发,按指定相机位置和角度生成新视角,输出最长 1 分钟、分辨率 1440p 的视频
- 空间重建:从一张到数十张输入图像重建真实世界场景,同时生成新视角图像帧和显式 3D 输出,性能超过专门的 3D 重建模型
- 时空模拟:从输入视频中建模空间和时间,支持视频重帧和 Real-to-Sim 机器人仿真工作流
- 图像生成:从文本生成图像和 360° 全景图,支持复杂提示词和文字渲染
World Labs 表示 Atlas 的性能随训练算力增加而持续提升,部分合作伙伴已获得抢先体验资格,早期访问将在未来几周内开放。
三者对比
| 特性 | Gemini 3.8 Flash | Qwen3.8-Max-0902 | World Labs Atlas |
|---|---|---|---|
| 发布方 | 阿里千问 | World Labs | |
| 定位 | 长周期推理/编程 | 编程/办公 Agent | 多模态世界模型 |
| 上下文 | 1M token | 1M token | N/A |
| 输入价格 | $0.75/M(促销) | $2/M | 未公开 |
| 输出价格 | $3.75/M(促销) | $6/M | 未公开 |
| 视频生成 | ✗ | ✗ | ✓(1440p, 1min) |
| 3D 重建 | ✗ | ✗ | ✓ |
| 网络安全版 | ✓(Cyber) | ✗ | ✗ |
| 开放程度 | 公开 API | 公开 API | 抢先体验 |
影响
Google 和千问在同一天更新了各自的旗舰模型,竞争焦点集中在长周期编程和自主 Agent 两个方向。3.8 Flash 在 DeepSWE 上超过更大模型的表现,以及 Qwen3.8-Max-0902 在 Code Arena 上超越 Claude Opus 5 max,都在传递一个信号:Flash 级别的轻量模型正在逼近甚至超过传统旗舰模型在特定任务上的能力。
World Labs 的 Atlas 则开辟了另一条赛道。从单一图像重建完整 3D 场景、在视频生成中保持像素级几何一致性,这些能力如果按承诺落地,对机器人仿真、数字孪生和创意工具都会产生实际影响。




