SAM3 几行代码支持任意图像分辨率,减少显存占用(针对transformers库)
分析
sam3的图像和视频模型的图像分辨率默认是1008*1008,这么大的图像和视频需要极大的显存。经过查看transformers的源码,我们发现这个image_size主要影响的是模型global attention的rope,看它代码实现:
class Sam3ViTLayer(GradientCheckpointingLayer):
"""Vision Transformer layer with rotary position embeddings and optional windowed attention."""
def __init__<
订阅专栏 解锁全文
&spm=1001.2101.3001.5002&articleId=159128644&d=1&t=3&u=39a4702791094754a77b00deead7571a)
285

被折叠的 条评论
为什么被折叠?



