Flux 3
FLUX 3 现已在早期访问阶段提供。FLUX 3 是我们的新多模态基础模型。它在统一的架构内从图像、视频和音频中共同学习,因为它需要学习的不是这些元素中的任何一个孤立的部分。相反,模型必须学习对世界的表征:物体如何结合在一起,事物如何运动,事件听起来怎样。没有单一的模态能提供完整的描述。每个模态都是通过不同传感器捕获的同一基本现实的投影,每个传感器在这个过程中都会失去一些信息。在特定时间点上,图像捕获空间结构和关系。视频恢复时间维度并揭示时间动态和物理规律。音频揭示机械现象与声学之间的因果关系,而单靠视觉无法检测到。语言将这些感知与目标、抽象和指令连接起来。从一个模态学习,你会对该投影有很好的模型;同时从所有模态中学习,它们的相互约束能告诉你更多:声音必须与撞击相匹配,运动必须遵循质量,未来必须从过去延续。模态不再是分开的,而是关于一个基本现实的证据。FLUX 3 是我们完全基于这一原则构建的首个模型,也是我们开发实际视觉智能使命的一个检查点:能够在物理和数字环境中感知、预测和行动的模型。在内容创作和物理人工智能方面的早期结果表明,这条道路是正确的。FLUX 3:一个模型,多种能力。FLUX 3 基于 Self-Flow,我们的一种方法,用于有效对齐多模态生成和理解,处于相同的基础架构。基于这种方法,我们显著扩展了计算和数据资源,以同时训练 FLUX 3 的视频、图像和音频。Self-Flow 与流匹配(FM)。左侧:每种模态的生成误差(Fréchet 距离),每种模态归一化为 FM = 100(较低为更好)。右侧:通过微调,在四个任务组中的操作任务成功率(较高为更好)。能力与早期评估结果,因此,FLUX 3 能够混合模态,并共同生成图像和视频+音频;既可以从纯文本提示生成,也可以在提供图像和视频作为输入参考的情况下生成。我们在下面突出了一些模型的关键能力。视频 FLUX 3 可以在一次生成中创建时长最长达 20 秒的高多样性视频和音频。其核心能力包括以下内容(所有输出都伴有本地音频生成):文本转视频生成。图像到视频生成,可以从起始帧继续(“动画”)或使用图像作为视觉参考。参考片段的视频到视频生成,将源视频的核心元素 - 例如相同的角色 - 转移到新场景或上下文中。基于输入视频和音频的生成视频音频续集。从定义时刻之间进行控制过渡的关键帧到视频生成。多语言对话。广泛的视觉风格和宽高比,远远超出传统的电影输出。将单个剪辑连接成更长的多镜头序列的代理链。高风格多样性 - FLUX 3 视频轻松处理从抓拍摄像机视频到动画及电影的多种风格。在前期分析中,我们生成了720p的10秒文本转视频片段,带有音频。评估结果仍在初期,我们期待进一步改进。由于模型及其周边工具仍在开发中,因此这些结果只是初步的,我们期待在早期访问阶段有进一步的改进。在早期评估中,FLUX 3在最多69%的比较中优于Grok Imagine Video,60%优于Kling v3 Pro,59%优于Happy Horse v1,57%优于Happy Horse 1.1,52%优于Seedance 2.0和Gemini Omni Flash。FLUX 3在77%的比较中优于Runway Gen-4.5,在93%的比较中优于Luma Ray 3.2。虽然仍在开发中,FLUX 3 视频在捕捉人脸表情、将声音与物理事件关联和多语言能力方面已经特别强大。此外,这些能力可以结合起来创建持续数分钟的序列,其中视觉参考有助于确保角色在所有场景中保持一致。FLUX 3 视频现已在此处提供早期访问。图像 FLUX 3 可以生成和编辑各种风格、宽高比和分辨率的图像。在中期训练期间进行的初步评估中,FLUX 3 在处理复杂提示和文本生成方面相较于早期版本已有显著提高。该模型生成的输出风格多种多样,并能在多种语言中渲染高精度文本。与视频评估一样,这些输出样本也显示出良好的增强结果。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡