Hacker News 中文摘要

RSS订阅

Flux 3 -- Flux 3

文章摘要

FLUX 3是Black Forest Labs推出的多模态基础模型,统一学习图像、视频和音频,通过多模态相互约束来理解现实世界,而非单一模态。该模型能捕捉空间结构、时间动态、物理规律及因果关联,是首个完全基于多模态证据构建的视觉智能模型。

文章总结

FLUX 3是Black Forest Labs推出的新一代多模态基础模型,它在一个统一架构中同时学习图像、视频和音频,旨在理解世界的完整表征——物体如何组合、事物如何运动、事件如何发声。单一模态只能提供部分信息,而多模态联合学习能通过相互约束揭示更深层的现实规律,例如声音必须匹配撞击、运动必须符合质量、未来必须遵循过去。

该模型基于Self-Flow方法,大幅扩展了计算和数据资源,实现了视频、图像和音频的同步训练。FLUX 3具备多种能力:视频方面,可生成长达20秒的带音频视频,支持文本到视频、图像到视频、视频到视频生成,以及关键帧过渡、多语言对话和多种视觉风格;图像方面,能合成和编辑多种风格、宽高比和分辨率的图像,文本生成能力显著提升;动作预测方面,通过原生集成和微调,与mimic robotics合作开发了FLUX-mimic模型,用于灵巧操作和生产部署。

初步评估显示,FLUX 3在视频生成上优于多个竞品,尤其在捕捉人类面部表情、声音与物理事件关联及多语言能力方面表现突出。未来几周至几个月,将逐步开放视频与音频生成、动作预测、图像合成与编辑等API及私有权重访问,并计划发布开源多模态骨干模型。团队正致力于将感知、动作和语言预测统一到同一模型中。

评论总结

根据评论内容,主要观点和论据如下:

正面评价(少数): - 评论10认为模型能力令人印象深刻,批评评论区过于负面(评分None)。 - 评论15表示这是欧洲首个令人期待的AI项目(评分None)。

负面评价(多数): - 技术缺陷:评论1指出示例中缺乏人物展示、滥用“世界模型”术语、仅展示跳切剪辑(评分None)。评论12称视频片段在特定场景下才显得真实(评分None)。评论13认为图像/视频生成模糊、缺乏细节和艺术感(评分None)。 - 逻辑矛盾:评论2质疑“视觉智能”是单模态,与多模态宣传矛盾(评分None)。评论4指出视频包含图像和音频,但架构描述令人困惑(评分None)。 - 写作质量:评论3批评前两段有LLM生成文本的“臭味”,立即失去兴趣(评分None)。 - 版权与开放权重:评论11指责训练数据侵权(评分None)。评论5和6关注开放权重计划,但评论14认为开源模型仍未超越专有模型(评分None)。 - 社会批判:评论7和8批评技术发展缺乏人文关怀,认为人类已变得机械(评分None)。评论9讽刺模型学习“声音匹配冲击”这种婴儿本能(评分None)。

关键引用: - 评论1:“Showed close to zero examples of people... Claims 20 seconds of video, shows only jumpcuts.” - 评论3:“reading already the first two paragraph there is this unmistakable stench of LLM slop writing.” - 评论10:“the model actually looks impressively capable... the downers have always been the first to leave their dung comments.” - 评论14:“open-weight models ought to be outperforming proprietary ones... Flux still isn’t crossing that quality bar.”