Key points are not available for this paper at this time.
我们为视觉感知的鲁棒性建立了严格的基准。合成图像如ImageNet-C、ImageNet-9和风格化ImageNet提供了针对合成腐蚀、背景和纹理的特定类型评估,但这些鲁棒性基准受限于特定变体,并且合成质量较低。在本工作中,我们引入生成模型作为合成难度图像的数据来源,以基准深度模型的鲁棒性。利用扩散模型,我们能够生成具有比以往任何工作都更为多样化的背景、纹理和材料的图像,我们将这个基准称为ImageNet-D。实验结果表明,ImageNet-D导致从标准ResNet视觉分类器到最新基础模型如CLIP和MiniGPT-4的多个视觉模型的准确率显著下降,准确率降低幅度高达60%。我们的工作表明,扩散模型可以作为测试视觉模型的有效来源。代码和数据集可在https://github.com/chenshuang-zhang/imagenetd获取。
Zhang等(星期三)研究了这个问题。