德国AI公司Black Forest Labs发布FLUX3的图像模型,官方口号是“控制每一个像素”。和常见的文生图模型相比,它把控制权往前推了一步:除了写场景描述,使用者还可以用边界框把画面里每个元素的位置定下来,再逐框做修改。目前该模型可以通过官方API和Playground使用,API价格在10月8日前打五折。

布局的实现方式是把画布抽象成坐标网格。不管最终出图是什么比例,画布在两个方向上都按0到1000归一化,每个元素用一个边界框圈定范围,并配上一段自己的描述。举个例子,可以把人物放在画面中央,左边背景放现代建筑,右边背景放古典建筑,生成结果会在满足这些位置约束的前提下补齐细节。
编辑能力是这次更新的另一个重点。官方给出的说法是,对成品图的修改可以按框进行,并且分多轮完成,改过的区域之外保持像素级不变。这一点针对的是图像编辑里的老问题:每次重绘都会带来整体漂移,改到后面,最初满意的部分也变了样。按框编辑把这个误差累加的范围限制在局部。
输入侧支持最多10张参考图,模型会自行决定把这些参考放在画面什么位置,再整体渲染出一张图。输出侧的原生分辨率最高约16.8兆像素,也就是常说的4K量级,放大之后仍能保留细节。官方演示里还放了包含文字的样张,字体、颜色和排布都能按描述走。
开放方式分了两种。商业权重现在就可以联系官方获取,用于微调并部署到自有基础设施;开源权重计划在接下来几周内放出。定价方面,按照第三方平台公布的档位,4K生成的价格明显高于2K,促销期4K单张约0.3美元,2K约0.05美元,分辨率是决定单价的主要变量。
把这条发布放回FLUX3的节奏里看,脉络是清楚的。FLUX3这个多模态基座7月以早期访问形式上线,8月先放出了视频生成能力,图像这一档到10月才补齐。先做视频、后补图像的顺序并不常见,官方的解释是把图像子模型建立在已经跑通的基座之上。对使用者来说,真正有分量的是边界框这套接口——它把图像生成从“描述得准不准”的运气问题,往“布局定得对不对”的工程问题挪了一步。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
