返回

文章详情

展示HN:FeyNoBg – 自动背景去除模型和训练库

Hacker News2026年7月27日 16:59

原始背景去除 我们推出了FeyNoBg,一个最先进的自动背景去除模型。在八个基准测试中,它在四个测试中发布了最佳已发布S测量,并在其他测试中接近领先者2%。基准测试UHRSD-TE FeyNoBg 0.981 BiRefNet 0.957 描述 测试超高分辨率图像中的显著物体掩膜,包括4K和8K场景。我们还将发布用于训练我们模型的库NoBg。使用NoBg运行FeyNoBg或训练您自己的背景去除模型。两者都是开源的。在Hugging Face上下载FeyNoBg,或在GitHub上使用NoBg构建。 去除需要组合 在您的计算机中,图像作为像素网格存储。背景去除算法的目标是预测每个像素的透明度值,使背景像素变为透明,前景像素保持不透明,边界像素变为半透明。生成这种透明度图需要两种技能。首先,模型必须将前景与背景分开。当主体站在简单的背景前面时,这可以通过颜色比较轻松完成。然而,在对比度低、拥挤或伪装的图像中,模型必须使用形状、纹理和上下文来识别哪些像素形成主体。其次,模型必须追踪前景的边界。在简单的图像中,颜色或纹理的急剧变化提供了强边缘信号。但真实边界更难以识别。头发、毛皮、细线和运动模糊会使前景和背景元素混在一起。模型必须测量边缘像素属于主体的程度,并相应地设置其透明度。这称为图像抠图。通常,这些技能是通过不同种类的聚焦数据来教授的。这创造了一个失败点。糟糕的训练组合可能会产生不平衡的模型,其中一种技能的改进以牺牲另一种技能为代价。输出要么漏掉部分主体,要么缺乏干净的边缘。真实图像复杂,并且需要在前景识别和边界精度方面的灵活性。这是我们在训练FeyNoBg时的关键见解。 创造学习空间 我们选择BiRefNet作为FeyNoBg的基础,因为它的架构已经符合我们的目标。BiRefNet赋予模型的两个部分互补的职责。它的定位模块找到前景,而重建模块追踪主体的边界。模型通过一个经过四个阶段运行的特征提取器开始处理输入图像。早期阶段捕获局部细节。后期阶段将收集到的细节组合成称为特征图的更广泛的图像表示。定位模块使用这些图来找到主体,而重建模块使用它们来恢复其边界。特征提取器的第三个阶段工作最为艰巨。它看到图像的足够部分,以推测整个主体,同时保留表示其形状所需的空间细节。定位和边界重建在很大程度上依赖于这里生成的特征图。考虑到这一阶段保持丰富的图像表示,我们预计增加更多深度将有助于模型更好地保留信息,从而提高性能。 accordingly, we expanded the third stage from 18 to 24 blocks. This grew the model modestly from 222M parameters to 263M. Origin BiRefNet 222M parameters depths=[2, 2, 18, 2] Grown model FeyNoBg 263M parameters depths=[2, 2, 24, 2] We preserved every compatible pre-trained weight during the expansion. Only the six new blocks started untrained. This gave FeyNoBg additional capacity to learn new skills without forgetting what the base model already knows. With room to learn more, it was time to teach an old model some new tricks. Strength in Diverse Data Our first training run was with MaskFactory, a collection of synthetic image and mask pairs created for precise foreground segmentation. This was the only dataset used for the run. If our intuition was correct, the resulting model would improve on some benchmarks while regressing on others. That is what happened in our controlled evaluation, where the model improved on the CAMO benchmark but regressed on DIS5K. Next, we focused on building a more diverse dataset. We assembled 26.1K images from 10 datasets covering crowded scenes, camouflage, high resolution subjects, portraits, and anime, then trained for 7,000 steps. Our goal was to expose the model to as many scenarios as possible during training. 数据集S3OD 添加了什么 设计用于帮助模型在熟悉的图像集合之外进行推广的合成场景。在最后一次运行之前,我们修订了最初的组合。我们添加了来自S3OD的4,000张图像,将动漫减少到500张,并移除了ThinObject-5K、HIM-2K和COIFT。这使我们拥有了贡献最多有用、一致训练示例的来源。组合数据集引入了两个问题。首先,它们在大小上差异很大。没有限制,最大的来源将主导训练并造成t

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡