Gemini 3.6 Flash 登场:更便宜、更聪明

7 月 21 日,Google 发布 Gemini 3.6 Flash,这是 Gemini 3.5 Flash 的正式后继型号。一同发布的还有 Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber 两款模型。

三个模型,三个定位

Gemini 3.6 Flash 面向编程、知识工作和多模态任务。和上一代相比,输出 token 用量平均减少 17%,完成多步骤任务时需要的推理步骤和工具调用次数也降了。API 输入价格每 100 万 token 1.50 美元(约合 11 元人民币),输出价格从上一代的 9 美元降到 7.50 美元(约合 55 元人民币)。

Google 公布的测试数据里,新模型在编程基准 DeepSWE 拿到 49%,比 3.5 Flash 的 37% 高了 12 个百分点。OSWorld-Verified 计算机操作测试从 78.4% 提升到 83.0%。模型已经上线 Gemini 应用、Gemini API、Google AI Studio、Android Studio、Google Antigravity 和 Gemini Enterprise。

Gemini 3.5 Flash-Lite 面向智能体搜索、文档处理这些高吞吐量场景。每秒最多输出 350 个 token,API 输入和输出价格分别是每 100 万 token 0.30 美元(约合 2.2 元人民币)和 2.50 美元(约合 18 元人民币)。

Gemini 3.5 Flash Cyber 针对软件漏洞的发现、验证和修复做了优化。目前通过 CodeMender 向政府机构和受信任合作伙伴提供限量测试。

Google 还确认,Gemini 3.5 Pro 仍在和合作伙伴测试中,Gemini 4 已经启动预训练。


阿里千问发布 Qwen-Image-3.0 图像模型

同一天,阿里发布 Qwen-Image-3.0 图像生成基础模型。最大的卖点是支持最大 4.5k token 超长输入,可以一次生成公式符号、几何图形、逻辑推导步骤混在一起的知识图解和复杂 UI 界面。

支持 12 国语言和 20 多款字体原生渲染,小到 10px 的字也能看清。可以生成报纸、分镜、试卷这类复杂版面,毛孔和发丝细节也能还原。

阿里同时宣布联合上海交通大学学生创新中心,在千问 App 上线暑期 AI 通识课,面向全国学生免费开放。


NVIDIA 发布合成视频检测器

英伟达也发了新品——合成视频检测器 NIM(Synthetic Video Detector NIM)。面向媒体机构和个人用户,逐帧分析视频,用分类评分判断是否 AI 生成。

内部测试数据:无压缩视频准确率 92%,15% 压缩率下 85%,50% 压缩率下 82%。在 RTX GPU 上每帧最快 22 毫秒,在企业级 L40 GPU 上约 30 毫秒。