[AINews] Black Forest Labs 发布 FLUX 3:多模态流模型,超越 Seedance 2.0、Gemini Omni 和 Grok Imagine;同时推出 FLUX-mimic 视频动作机器人模型
周四向来是 AI 发布最密集的日子。虽然 OpenAI 抢先 Anthropic 一步,推出了新的 ChatGPT Voice(面向消费者)和 OpenAI Presence(面向企业),并且今天在曝光量上超过了 Claude Voice(我们确信这只是时间上的巧合),但这两件事似乎都不如 BFL 今天发布的 FLUX 3 Video 意义重大。
我们上次报道 BFL 是在广受好评的 Anjney Midha 播客 中。大多数熟悉生成式媒体的人都会记得 BFL 在 2024 年首次推出 Flux 1 时的官网——页面以森林为背景,暗示下一步将是视频模型。两年之后,它终于成真了。
博文概述了 Self Flow,它将 BFL 的所有模态整合在一起,并给出了强有力的性能声明。其核心能力包括(所有输出均自带原生音频生成):
- 文生视频
- 图生视频:既可以从起始帧继续生成(“动画”模式),也可以使用图像作为视觉参考
- 视频生视频:从参考片段出发,将源视频的核心元素(例如同一个角色)带入新的场景或上下文中
- 生成式视频-音频延续:从输入的视频和音频中延续生成
- 关键帧生成视频:在定义好的关键帧之间实现受控过渡
- 多语言对话
- 广泛的视觉风格与宽高比:远超传统影视输出
- 智能体式片段串联:将单个片段串联成更长的多镜头序列
- 高风格多样性:FLUX 3 Video 轻松驾驭从便携摄像机实拍到动画、影视特效等多种风格
- 强大的文字生成与动画设计
上述部分功能来自其他前沿实验室模型的 SOTA(最先进水平)特性,例如我们在 Grok Imagine 播客 中讨论过的那些。因此,社区已经收到明确信号:这些能力现在已经有了独立且可能是 SOTA 级别的复现,并且开发版(开放权重)即将推出。
这还没完,团队还发布了 FLUX3-mimic,它证明了 FLUX 3 模型已经学到了足够强大的世界模型,足以驱动机器人……并预测它们在真实工厂环境中的影响。
AI 新闻 2026 年 7 月 22 日 - 2026 年 7 月 23 日。 我们查看了 12 个子版块、544 条 Twitter 消息,没有进一步 Discord 内容。AINews 网站支持搜索所有往期内容。提醒:AINews 现在是 Latent Space 的一个栏目。你可以选择订阅/退订邮件频率!
AI Twitter 回顾:开放代码、开放模型,以及围绕蒸馏的政策分歧
The Stack v3 是当天最重要的开放数据发布
@anton_lozhkov 宣布了 The Stack v3,这是目前公开的最大开放代码数据集:原始数据 114 TB,包含 2.24 亿个仓库、440 亿个文件、770 种语言,去重/过滤后大约 5 万亿个 token。
相比 v2,过滤后的语料库从约 5500 亿 token 跃升至约 5 万亿 token,其中增长尤为显著的包括:C++(增加 15 倍)、TypeScript(增加 7.5 倍)、Rust(增加 7 倍)和 Python(增加 4.8 倍)。运营层面的重要变化:v3 将内容直接打包上传(而非使用 Software Heritage ID),包含了截至 2025 年 8 月的 GitHub 最新爬取数据,排除了限制性许可证下的代码,同时提供了“即训版”和“完整桶”(供自定义去重/过滤)。Hugging Face 的研究人员明确将其定位为下一代开放代码模型和网络防御工具的基础设施——参见 @LoubnaBenAllal1、@lvwerra 的推文,以及 @eliebakouch 的评论指出:之前的 Stack 版本已被许多公开的代码模型训练混合数据所采用。
蒸馏仍然是活生生的意识形态分歧点
几条高热度帖子反击了试图将“互联网规模预训练”与输出层面的“蒸馏”截然分开的做法。@GergelyOrosz 将“通过提示词检查模型”比作“逆向工程竞争对手的产品”,而 @SchmidhuberAI 则强调蒸馏有着悠久的历史。@Suhail 认为,务实对策不是禁止,而是加大对国内开放权重模型的投入;@garrytan 说得更直接:开放权重具有战略重要性。
这些文章隐含的意思是,像 The Stack v3 这样的开放数据集,显著抬高了每个希望构建有竞争力代码模型(而不依赖封闭生态系统)的实验室的基础水平。