arXivDaily arXiv每日学术速递 周一至周五更新

作者

Alexei A. Efros

Computer Vision

共收录 117 篇
2609.07939 2026-09-17 cs.CV 版本更新

Bottom-up Modeling of Repeated Elements via Single Image Analysis-by-Synthesis

基于单图像分析合成自底向上的重复元素建模

Syrine Kalleli, Alexei A. Efros, Mathieu Aubry

机构 * LIGM(LIGM机构) ; CNRS(法国国家科学研究中心) ; Univ Gustave Eiffel(古斯塔夫·埃菲尔大学) ; ENPC(法国国立路桥学校) ; Institut Polytechnique de Paris(巴黎综合理工学院) ; UC Berkeley(加州大学伯克利分校)

AI总结 本文提出一种自底向上的单图像重复元素发现方法,通过重建目标学习可调原型,无需标注或分割,在FSC-147上验证了其有效性与可解释性。

Comments Accepted to ECCV 2026. Project page: https://vayvi.github.io/repeated-elements/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02748 2026-09-03 cs.CV 新提交

Balancing Frequencies and Pixels in Flow Matching

在流匹配中平衡频率与像素

Lucas Degeorge, Paul Couairon, Arijit Ghosh, Alexei A. Efros, David Picard, Vicky Kalogeiton

机构 * École Polytechnique(巴黎综合理工学院) ; CNRS(法国国家科学研究中心) ; IP Paris(巴黎理工学院) ; AMIAD ; École Nationale des Ponts et Chaussées(巴黎路桥学院) ; UGE(巴黎第八大学) ; UC Berkeley(加州大学伯克利分校)

AI总结 本研究针对像素空间流模型训练的频谱失衡问题,提出Focal Log-Frequency Loss(f-loss),结合频率与像素监督的训练策略,可将流匹配收敛速度提升最高40%,同时改善FID和感知保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18237 2026-08-18 cs.CV cs.LG 版本更新

The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

视觉相似性的多种意义:一种文本提示的图像感知度量

Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang

AI总结 研究人类视觉相似性判断的上下文依赖问题,通过引入大规模数据集微调VLM,产生能捕捉多种视觉相似性意义的TPIPS度量,该度量与人类感知更契合,还在多种任务中开启新功能。

Comments Project Webpage: https://peterwang512.github.io/TPIPS Code: https://github.com/adobe-research/TPIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14645 2026-07-21 cs.CV 版本更新

Autoregressive Modeling of Film with Applications in Video Montage

电影的自回归建模及其在视频蒙太奇中的应用

Marcelo Sandoval-Castañeda, Fabian Caba Heilbron, Shiry Ginosar, Bryan Russell, Josef Sivic, Alexei A. Efros, Greg Shakhnarovich

机构 * TTI-Chicago(芝加哥丰田理工学院) ; Adobe(奥多比公司) ; Czech Institute of Informatics, Robotics and Cybernetics, Czech Technical University(捷克技术大学捷克信息学、机器人学与控制论研究所) ; UC Berkeley(加州大学伯克利分校)

AI总结 研究针对视频蒙太奇挑战,提出FilmGPT自回归Transformer,通过在电影语料库训练捕捉电影“语法”,推理时用镜头约束解码算法选最佳镜头,在镜头预测和电影编辑任务中表现出色,还适用于多种视频蒙太奇应用。

Journal ref SIGGRAPH Conference Papers '26, Article 129, 1-11, ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20536 2026-06-19 cs.CV 新提交

The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation

FID 彩票:量化生成模型评估中的隐藏随机性

Nicolas Dufour, Alexei A. Efros, Patrick Pérez

机构 * Kyutai ; UC Berkeley(加州大学伯克利分校)

AI总结 研究FID作为随机变量在训练和生成种子上的方差,发现重训练比重采样导致更大FID波动,提出新评估协议:使用每类最优引导、报告多个训练种子的误差条。

Comments Website: https://kyutai.org/fid-lottery

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03990 2026-06-03 cs.LG cs.CL cs.CV

Neuron Populations Exhibit Divergent Selectivity with Scale

神经元群体随规模表现出分化的选择性

Amil Dravid, Yasaman Bahri, Alexei A. Efros, Yossi Gandelsman

机构 * UC Berkeley(加州大学伯克利分校) ; TTIC

AI总结 通过分析Rosetta神经元在不同规模模型中的分布与特性,发现其数量遵循次线性幂律增长,且选择性随规模增强,而非Rosetta神经元则保持低选择性,提出一个平衡特征效用与神经元容量的分析模型解释这一极化现象。

Comments Project page and code: https://avdravid.github.io/rosetta-neuron-scaling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18572 2026-06-03 cs.CV cs.AI cs.LG

Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale

回到柏拉图的洞穴:大规模检验跨模态表示收敛性

A. Sophia Koepke, Daniil Zverev, Shiry Ginosar, Alexei A. Efros

机构 * UC Berkeley(伯克利大学) ; Technical University Munich, MCML(慕尼黑技术大学) ; University of Tübingen, Tübingen AI Center(图宾根大学) ; Toyota Technical Institute at Chicago(芝加哥丰田技术研究所)

AI总结 本文通过大规模数据集实验,质疑了柏拉图表示假说中跨模态表示收敛的证据,发现对齐度随数据规模增大而显著下降,且仅反映粗粒度语义重叠。

Comments Project page: http://akoepke.github.io/cave_umwelten/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00090 2026-05-04 cs.CV cs.LG

It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models

迟到也不晚:通过噪声优化在训练好的扩散模型中恢复崩溃

Anne Harrington, A. Sophia Koepke, Shyamgopal Karthik, Trevor Darrell, Alexei A. Efros

机构 * UC Berkeley(加州大学伯克利分校) ; University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) ; TU Munich, MCML(慕尼黑工业大学,MCML)

AI总结 本文通过噪声优化提升扩散模型生成多样性,减少模式崩溃,同时保持基础模型的保真度。

Comments CVPR 2026. Project page at https://akoepke.github.io/divgen/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10721 2025-11-17 cs.CV cs.LG

Fast Data Attribution for Text-to-Image Models

文生图模型的快速数据归因方法

Sheng-Yu Wang, Aaron Hertzmann, Alexei A Efros, Richard Zhang, Jun-Yan Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) ; Adobe Research(Adobe研究) ; UC Berkeley(伯克利大学)

AI总结 针对现有文生图模型数据归因方法计算成本高、难以落地的问题,提出将基于遗忘的慢速归因蒸馏到特征嵌入空间的高效方法,在两类模型上实现数千至数十万倍提速,性能达标。

Comments NeurIPS 2025 camera ready. Project page: https://peterwang512.github.io/FastGDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08010 2025-10-28 cs.CV cs.AI

Vision Transformers Don't Need Trained Registers

视觉Transformer不需要训练寄存器

Nick Jiang, Amil Dravid, Alexei Efros, Yossi Gandelsman

机构 * UC Berkeley(伯克利大学)

AI总结 本文发现视觉Transformer中高范数标记由稀疏寄存器神经元引起,提出无需训练的测试时寄存器方法,通过转移激活至未训练标记,提升下游任务性能并媲美训练寄存器模型。

Comments Project page and code: https://avdravid.github.io/test-time-registers. Accepted to NeurIPS '25 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02864 2025-09-23 cs.RO cs.CV

The Sound of Simulation: Learning Multimodal Sim-to-Real Robot Policies with Generative Audio

模拟之声:利用生成式音频学习多模态仿真到现实的机器人策略

Renhao Wang, Haoran Geng, Tingle Li, Feishi Wang, Gopala Anumanchipalli, Trevor Darrell, Boyi Li, Pieter Abbeel, Jitendra Malik, Alexei A. Efros

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出 MultiGen 框架,将生成式音频模型集成到物理仿真器中,在无真实机器人数据的情况下实现机器人倾倒任务的多模态仿真到现实零样本迁移。

Comments Conference on Robot Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04201 2025-05-27 cs.CV

IT$^3$: Idempotent Test-Time Training

IT$^3$:幂等测试时训练

Nikita Durasov, Assaf Shocher, Doruk Oner, Gal Chechik, Alexei A. Efros, Pascal Fua

AI总结 本文提出幂等测试时训练(IT$^3$),利用幂等性替代辅助任务,仅用当前测试实例实现分布偏移的实时适应,并在多个领域和架构上优于现有方法。

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18082 2025-05-12 cs.LG

Prioritized Generative Replay

优先化生成回放

Renhao Wang, Kevin Frans, Pieter Abbeel, Sergey Levine, Alexei A. Efros

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) ; University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出优先化生成回放方法,用条件扩散模型对在线经验进行参数化记忆和稠密化,并通过相关性函数引导生成更有用的转移,从而提升在线强化学习的性能和样本效率。

Comments Project page available at: https://pgenreplay.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14391 2025-04-11 cs.CV

Rethinking Patch Dependence for Masked Autoencoders

重新思考掩码自编码器中的图像块依赖性

Letian Fu, Long Lian, Renhao Wang, Baifeng Shi, Xudong Wang, Adam Yala, Trevor Darrell, Alexei A. Efros, Ken Goldberg

机构 * UC Berkeley(加州大学伯克利分校) ; UCSF(加州大学旧金山分校)

AI总结 本文通过分解MAE解码机制发现其重建依赖编码器全局表示而非解码器内图像块交互,据此提出仅用交叉注意力的CrossMAE框架,在ViT-S到ViT-H上以更低计算成本取得与传统MAE相当或更优的性能。

Comments Transactions on Machine Learning Research (TMLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21770 2025-03-28 cs.CV

Visual Jenga: Discovering Object Dependencies via Counterfactual Inpainting

视觉叠叠乐:通过反事实修复发现物体依赖关系

Anand Bhattad, Konpat Preechakul, Alexei A. Efros

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术学院) ; University of California, Berkeley(加利福尼亚大学伯克利分校)

AI总结 本文提出“视觉叠叠乐”任务,通过逐步移除物体揭示场景依赖,并利用成对关系不对称性与大型修复模型生成反事实来量化,提出一种简单有效的无需训练方法。

Comments project page: https://visualjenga.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09408 2025-02-21 cs.CV cs.LG

Data Attribution for Text-to-Image Models by Unlearning Synthesized Images

通过反学习合成图像实现文本到图像模型的数据归因

Sheng-Yu Wang, Aaron Hertzmann, Alexei A. Efros, Jun-Yan Zhu, Richard Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) ; Adobe Research(奥多比研究院) ; UC Berkeley(加州大学伯克利分校)

AI总结 针对文本到图像模型的数据归因需反复重训练、成本过高的问题,本文提出模拟反学习合成图像并依据损失偏差识别影响训练样本的高效方法,且经金标准重训练验证优于已有方法。

Comments NeurIPS 2024 camera ready version. Project page: https://peterwang512.github.io/AttributeByUnlearning Code: https://github.com/PeterWang512/AttributeByUnlearning

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04341 2025-02-14 cs.CV

Interpreting the Second-Order Effects of Neurons in CLIP

解读CLIP中神经元的二阶效应

Yossi Gandelsman, Alexei A. Efros, Jacob Steinhardt

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 针对CLIP神经元功能解读难题,提出“二阶透镜”分析其通过后续注意力头直接流向输出的效应,揭示多义性并用于批量生成语义对抗样本与零样本分割,性能更优且拓展模型能力。

Comments project page: https://yossigandelsman.github.io/clip_neurons/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12390 2025-01-23 cs.CV

GPS as a Control Signal for Image Generation

GPS作为图像生成的控制信号

Chao Feng, Ziyang Chen, Aleksander Holynski, Alexei A. Efros, Andrew Owens

机构 * University of Michigan(密歇根大学) ; UC Berkeley(加州大学伯克利分校)

AI总结 本研究利用照片元数据中的GPS标签作为控制信号,训练条件扩散模型生成随位置变化的图像,并通过分数蒸馏采样提取三维模型,验证了GPS条件化对图像生成和三维结构估计的有效性。

Comments Project page: https://cfeng16.github.io/gps-gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12387 2025-01-22 cs.CV

Continuous 3D Perception Model with Persistent State

连续3D感知模型与持久状态

Qianqian Wang, Yifei Zhang, Aleksander Holynski, Alexei A. Efros, Angjoo Kanazawa

机构 * University of California, Berkeley(加州大学伯克利分校) ; Google DeepMind(谷歌DeepMind)

AI总结 提出统一框架CUT3R,利用持续更新的状态递归模型在线生成度量尺度点图,实现3D重建与未观测区域推断,在多种3D/4D任务上达到先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05014 2025-01-07 cs.CV cs.LG

Test-Time Training on Video Streams

视频流上的测试时训练

Renhao Wang, Yu Sun, Arnuv Tandon, Yossi Gandelsman, Xinlei Chen, Alexei A. Efros, Xiaolong Wang

机构 * UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Meta AI ; UC San Diego(加州大学圣迭戈分校)

AI总结 本文提出面向视频流的 online TTT,利用当前帧与邻近历史帧在线更新模型,在真实视频的分割等任务上显著超过固定模型及离线 TTT。

Comments Project website with videos, dataset and code: https://test-time-training.github.io/video

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10889 2024-12-23 cs.CV cs.AI

Synthesizing Moving People with 3D Control

基于3D控制的运动人物合成

Boyi Li, Junming Chen, Jathushan Rajasegaran, Yossi Gandelsman, Alexei A. Efros, Jitendra Malik

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 提出基于扩散模型的框架,通过学习不可见部分先验和3D姿态控制渲染,从单张图像生成忠实于目标3D运动且视觉相似的人物动画。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09417 2024-12-12 cs.CV cs.GR cs.LG

Rethinking Score Distillation as a Bridge Between Image Distributions

将分数蒸馏重新思考为图像分布之间的桥梁

David McAllister, Songwei Ge, Jia-Bin Huang, David W. Jacobs, Alexei A. Efros, Aleksander Holynski, Angjoo Kanazawa

机构 * UC Berkeley(加州大学伯克利分校) ; University of Maryland(马里兰大学)

AI总结 该研究将分数蒸馏采样重新解读为图像分布间的最优传输路径,指出其伪影源于路径线性近似与源分布估计差,通过校准源分布文本条件以低开销实现多领域高质量生成,性能优于现有专用方法。

Comments NeurIPS 2024. Project webpage: https://sds-bridge.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10320 2024-12-11 cs.CV

Toon3D: Seeing Cartoons from New Perspectives

Toon3D: 从新视角观看卡通作品

Ethan Weber, Riley Peterlinz, Rohan Mathur, Frederik Warburg, Alexei A. Efros, Angjoo Kanazawa

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 针对卡通动漫图像几何不一致导致现有SfM方法失效的问题,提出Toon3D方法,通过变形输入图像结合单目深度引导恢复3D结构,构建了对应数据集,实验证明其能得到更可靠的相机位姿与场景几何,可支持新视角观看卡通。

Comments Please see our project page: https://toon3d.studio

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09413 2024-11-25 cs.CV cs.GR cs.LG

Interpreting the Weight Space of Customized Diffusion Models

定制化扩散模型权重空间的可解释性研究

Amil Dravid, Yossi Gandelsman, Kuan-Chieh Wang, Rameen Abdal, Gordon Wetzstein, Alexei A. Efros, Kfir Aberman

机构 * UC Berkeley(加州大学伯克利分校) ; Snap Inc.(Snap公司) ; Stanford University(斯坦福大学)

AI总结 本文通过构建超过60,000个定制化扩散模型的数据集,提出weights2weights权重子空间,并展示其在采样、编辑和反演中的应用,证明微调扩散模型的权重空间可作为可解释的元潜在空间生成新模型。

Comments Project Page: https://snap-research.github.io/weights2weights

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05862 2024-09-11 cs.CV

Evaluating Multiview Object Consistency in Humans and Image Models

评估人类与图像模型中的多视图对象一致性

Tyler Bonnen, Stephanie Fu, Yutong Bai, Thomas O'Connell, Yoni Friedman, Nancy Kanwisher, Joshua B. Tenenbaum, Alexei A. Efros

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文构建多视图三维形状推断基准,采集人类选择、反应时间与注视数据,并评估DINOv2、MAE和CLIP,发现人类显著优于模型且在困难试验中投入更多加工。

Comments Project page: https://tzler.github.io/MOCHI/ Code: https://github.com/tzler/mochi_code Huggingface dataset: https://huggingface.co/datasets/tzler/MOCHI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02752 2024-08-07 cs.CV cs.AI

Diffusion Models as Data Mining Tools

Ioannis Siglidis, Aleksander Holynski, Alexei A. Efros, Mathieu Aubry, Shiry Ginosar

机构 * Ecole des Ponts(巴黎路桥学院) ; Univ Gustave Eiffel(Gustave Eiffel大学) ; CNRS(法国国家科学研究中心) ; University of California, Berkeley(加州大学伯克利分校)

Comments Project Page: https://diff-mining.github.io/ Accepted in ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07504 2024-07-31 cs.CV

COLMAP-Free 3D Gaussian Splatting

Yang Fu, Sifei Liu, Amey Kulkarni, Jan Kautz, Alexei A. Efros, Xiaolong Wang

机构 * UC San Deigo(加州大学圣地亚哥分校) ; NVIDIA(英伟达公司) ; UC Berkeley(加州大学伯克利分校)

Comments Project Page: https://oasisyang.github.io/colmap-free-3dgs

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05916 2024-04-01 cs.CV cs.AI

Interpreting CLIP's Image Representation via Text-Based Decomposition

Yossi Gandelsman, Alexei A. Efros, Jacob Steinhardt

机构 * UC Berkeley(加州大学伯克利分校)

Comments Project page and code: https://yossigandelsman.github.io/clip_decomposition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16936 2024-02-28 cs.CV cs.LG

Disentangled 3D Scene Generation with Layout Learning

Dave Epstein, Ben Poole, Ben Mildenhall, Alexei A. Efros, Aleksander Holynski

机构 * UC Berkeley(加州大学伯克利分校) ; Google Research(谷歌研究院)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05473 2023-12-27 cs.CV

Differentiable Blocks World: Qualitative 3D Decomposition by Rendering Primitives

Tom Monnier, Jake Austin, Angjoo Kanazawa, Alexei A. Efros, Mathieu Aubry

机构 * LIGM, Ecole des Ponts, Univ Gustave Eiffel(LIGM,巴黎高科桥梁学校,古斯塔夫·埃菲尔大学) ; UC Berkeley(加州大学伯克利分校)

Comments Project webpage with code and videos: https://www.tmonnier.com/DBW. V2 update includes comparisons based on NeuS, hyperparameter analysis and failure cases

详情

展开后加载摘要…

URL PDF HTML 收藏
↑