arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

至 收录 552
2608.10665 2026-08-12 cs.AI cs.CV cs.GT 新提交

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。

Comments European Conference on Computer Vision 2026

URL PDF HTML 收藏
2608.10544 2026-08-12 cs.CV cs.AI cs.LG 新提交

Flow Straight to Reality: Perceptually Consistent Flow Matching for Efficient Image Restoration

直接流向现实:用于高效图像复原的感知一致流匹配

Sangwoo Jo, Donggeun Ko, Jayeon Kang, Youngsang Kwak, Jaehwa Kwak, Sungjoon Choi

机构 * Korea University(高丽大学) Aim Future

AI总结 本文提出PCFlow框架,通过结合潜在一致性流目标、LCPL损失与无冲突梯度投影策略,实现高效图像复原,在低计算成本下取得竞争力性能。

Comments Accepted to ECCV 2026. Code is available at https://github.com/aiimaginglab/PCFlow

URL PDF HTML 收藏
2608.10500 2026-08-12 cs.CV 新提交

DSAR: Dual-Stream Autoregressive Modeling of Temporal Cloth Dynamics for Photorealistic Animatable Avatars

DSAR:用于生成逼真可动画化虚拟化身的布料时序动力学双流自回归建模

Haozhong Xiong, Yao Yu, Yu Zhou, Sidan Du

机构 * Nanjing University(南京大学)

AI总结 本文提出DSAR双流自回归框架,显式建模布料时序因果结构,解决现有方法布料动力学捕捉不足问题,在多方面性能获显著提升。

Comments Accepted to ECCV 2026. 25 pages, 7 figures, including supplementary material

URL PDF HTML 收藏
2608.10411 2026-08-12 cs.CV 新提交

A second-order theory of texture for depth from focus

聚焦测距的纹理二阶理论

Sreekar Ranganathan, Ioannis Gkioulekas

AI总结 该研究提出基于波动光学的纹理二阶理论,发现传统视为无纹理的表面因主观散斑也会产生纹理,通过窄带光谱滤波器提升二阶纹理对比度,大幅改善看似无纹理场景的被动深度重建效果。

Comments ECCV 2026, project website: https://imaging.cs.cmu.edu/second-order-texture/

URL PDF HTML 收藏
2608.10345 2026-08-12 cs.CV 新提交

CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images

CasDeblurGS:用于从两张模糊图像重建3D高斯溅射的级联2D到3D多视图一致性方法

Haeyun Choi, Minhyuk Jang, I-Gil Kim

机构 * University of Virginia(弗吉尼亚大学) KT R&D Center(KT研发中心)

AI总结 CasDeblurGS是一种级联框架,仅用两张已知内参的运动模糊图像即可重建连贯3D场景,在Deblur-NeRF场景上PSNR较基线提升1.19dB和2.11dB,渲染与几何一致性均改善。

Comments Accepted to the ECCV 2026 MUSTCV Workshop. Project page: https://haeyun-choi.github.io/Cascaded2D3D_page/

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

URL PDF HTML 收藏
2608.09691 2026-08-11 cs.CV 新提交

Diffuse the object, keep its label: curating detector training data from a few unlabeled photographs via VLM-built 3D vegetation scenes

扩散目标,保留其标签:通过VLM构建的3D植被场景从少量未标记照片中整理检测器训练数据

Mario Malizia, Marnix Enting, Rob Haelterman, Ken Hasselmann

机构 * Royal Military Academy(皇家军事学院) KU Leuven(鲁汶大学) Flanders Make(佛兰德制造研究院)

AI总结 本研究针对植被中小物体标记图像稀缺导致检测器跨站点泛化差的问题,通过VLM构建3D植被场景合成标记训练图像,实现无监督站点适应,在排雷基准上性能优于传统跨站点标签复用。

Comments Accepted at the Curated Data for Efficient Learning (CDEL) Workshop @ ECCV 2026

URL PDF HTML 收藏
2608.09636 2026-08-11 cs.CV cs.AI 新提交

NeuroRefiner: Morphology-Aware Multi-Agent Refinement for 3D Fluorescence Microscopy Neuron Segmentation

NeuroRefiner:面向3D荧光显微镜神经元分割的形态感知多智能体细化方法

Haiyang Yan, Jinyue Guo, Yanchao Zhang, Bingqing Wang, Zhenchen Li, Jing Liu, Jiazheng Liu, Linlin Li, Hua Han

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Normal University(北京师范大学)

AI总结 针对3D荧光显微镜神经元分割的拓扑与细节保留难题,本文提出NeuroRefiner多智能体系统结合TopoRefineNet工具,在多数据集上实现优于现有方法的分割性能,ZBFWB数据集F1分数提升3.02%。

Comments Accept by ECCV 2026

URL PDF HTML 收藏
2608.09497 2026-08-11 cs.CV 新提交

SwissCrop25: A National Multi-Year Benchmark for Operational Crop Mapping

SwissCrop25:用于业务化作物制图的国家级多年基准数据集

Thomas Lauber, Mehmet Ozgur Turkoglu, Sélène Ledain, Helge Aasen

机构 * Agroscope(阿格罗斯普(瑞士农业研究机构))

AI总结 本研究推出覆盖2019-2025年7个生长季的国家级作物制图基准SwissCrop25,通过留一法年份交叉验证协议测试三类模型,发现领域特定模型表现更优,TSViT整体性能最佳,还揭示了年际分布偏移及季内模型性能权衡等关键结论。

Comments Accepted at the ECCV 2026 Workshop TerraBytes II. To appear in the workshop proceedings

URL PDF HTML 收藏
2608.09493 2026-08-11 cs.CV 新提交

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

GeoRoute:面向交通未来帧预测的几何感知混合推理方法

Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh, Nam-Tien Le, Hieu Anh Ngo, Phuong Huu Vu Tran, Son Nguyen Minh Le, Nguyen Trong Nghia, Tu Tran Thi Cam, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) University of Science, Ho Chi Minh City(胡志明市科学大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)

AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

URL PDF HTML 收藏
2608.09474 2026-08-11 cs.CV 新提交

FaLCon: Facet-Anchored Retrieval with Late Consensus for Sim2Real Text-Based Person Anomaly Search

FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索

Hieu Dinh Trung Pham, Phuong Huu Vu Tran, Thuan Duc Mai, Son Nguyen Minh Le, Khang Le Minh, Hoang Vo, Minh-Chi Phung, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology(信息技术大学) Ho Chi Minh city University of Science(胡志明市科学大学)

AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

URL PDF HTML 收藏
2608.09388 2026-08-11 cs.CV 新提交

Efficient Human-Contact Representation for Human-Scene Interaction

面向人-场景交互的高效人体接触表示

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen

机构 * AIOZ University of Liverpool(利物浦大学) NTHU(国立清华大学)

AI总结 针对人-场景交互中接触表示效率不足的问题,提出稀疏接触掩码与稀疏算子,在三个基准数据集的接触预测和场景合成任务上,实现至少12倍提速且精度优于现有最优模型。

Comments Accepted in ECCV 2026 Workshops

URL PDF HTML 收藏
2608.08963 2026-08-11 cs.CV cs.AI cs.LG 新提交

Fourier Self-Supervision for Fine-Grained Generalized Category Discovery

用于细粒度广义类别发现的傅里叶自监督学习

Sarah Rastegar, Mina Ghadimi Atigh, Pascal Mettes, Yuki M. Asano, Cees G. M. Snoek

机构 * University of Amsterdam(阿姆斯特丹大学) University of Technology Nuremberg(纽伦堡工业大学)

AI总结 提出傅里叶自监督学习,通过双频率过滤策略优化特征空间,在多细粒度数据集上实现优于现有方法的广义类别发现性能。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2608.08904 2026-08-11 cs.CV cs.AI cs.LG 新提交

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

机构 * New York University(纽约大学) Reflex Université de Montréal(蒙特利尔大学) Maastricht University(马斯特里赫特大学)

AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。

Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026

URL PDF HTML 收藏
2608.08840 2026-08-11 cs.CV 新提交

SLAP: Selective Local Vision-Language Alignment for Fish Re-Identification via Partial Optimal Transport

SLAP:基于部分最优传输的鱼类重识别选择性局部视觉-语言对齐

Cigdem Beyan, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen

机构 * University of Verona(维罗纳大学) Institute of Marine Research(海洋研究所) University of Agder(阿格德大学)

AI总结 针对鱼类重识别中全局对齐易引入噪声的问题,提出基于POT的选择性局部视觉-语言对齐框架,在多数据集上实现优于CLIP类方法的性能,泛化性良好。

Comments This is the author version prior to incorporating the camera-ready comments. The final version will be included in the Proceedings of the European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏
2608.08749 2026-08-11 cs.RO 新提交

OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies

OnEvoMemory:通过机器人在线试跑演化预训练机器人策略的记忆机制

Zhongxi Chen, Shenqi Zong

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 针对现有机器人记忆机制依赖外部模型的问题,提出OnEvoMemory价值引导记忆模块,结合离线初始化与在线试跑优化记忆选择,提升了基础VLA策略在长时程机器人操作中的性能。

Comments 6 pages, 1 figure. Accepted as a poster at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

URL PDF HTML 收藏
2608.08727 2026-08-11 cs.CV cs.AI 新提交

TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

TomaMMU:用于番茄叶片病害的综合多模态理解基准

Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da Quach

机构 * FPT University(FPT大学) Korea University(高丽大学)

AI总结 本研究推出用于番茄叶片病害多模态理解的TomaMMU数据集及TomaBench基准,评估14种VLMs时发现其细粒度识别等存在差距,微调后MCQ准确率达96.09%,为相关研究提供了方向。

Comments Accepted at ECCV CVPPA Workshop

URL PDF HTML 收藏
2608.08631 2026-08-11 cs.LG cs.SY eess.SY 新提交

Trajectory Design and Budgeted Querying for Digital Twin Calibration

数字孪生校准的轨迹设计与预算查询

Vladyslava Spitkovska, Dmytro Kuzmenko

机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) University of Turin(都灵大学)

AI总结 该研究针对数字孪生校准中交互数据采集成本高的问题,提出耦合强化学习控制器、循环参数估计器与预算查询策略的框架,在倒立摆、水上世界任务中验证了其低误差性能,推动将轨迹设计与查询分配作为校准的显式变量。

Comments Accepted at the CDEL 2026 workshop at ECCV 2026 (non-archival)

URL PDF HTML 收藏
2608.08519 2026-08-11 cs.CV 新提交

eBIRD: Event-based Intensity Image Reconstruction Using Controllable Diffusion Models

eBIRD:基于可控扩散模型的事件驱动强度图像重建

Ignacio Bugueno-Cordova, Fabian Valderrama, Rodrigo Verschae

机构 * Institute of Engineering Sciences, Universidad de O’Higgins(奥伊金斯大学工程科学学院) The Iniciativa de Datos e Inteligencia Artificial, University of Chile(智利大学数据与人工智能倡议)

AI总结 本研究提出eBIRD框架,结合DDPM与ControlNet实现事件引导强度图像重建,在N-MNIST和RGBE-Gaze数据集上验证了通用与专用扩散学习策略的效果,表明可控扩散模型是该任务的有前景方法。

Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)

URL PDF HTML 收藏
2608.08309 2026-08-11 cs.CV cs.AI cs.LG 新提交

Three Necessary Principles for Self-Supervised Visual Representation Learning

自监督视觉表征学习的三条必要原则

Nikos Giakoumoglou, Paschalis Giakoumoglou, Tania Stathaki

机构 * Imperial College London(帝国理工学院) CERTH, ITI(CERTH ITI)

AI总结 该研究提出自监督视觉表征学习的三条必要原则,通过理论证明与受控实验分析各原则的作用,表明主流自监督方法可纳入统一框架,且任意两个原则无法替代第三个。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026) Workshops

URL PDF HTML 收藏
2608.07984 2026-08-11 cs.CV 新提交

AgriField-40K: Adapting Vision Models to Agriculture With Efficient Continual Pretraining

AgriField-40K:通过高效持续预训练使视觉模型适配农业场景

Vasileios Tzouras, Paraskevas Pegios, Lazaros Nalpantidis

机构 * Technical University of Denmark (DTU)(丹麦技术大学(DTU)) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

AI总结 针对农业计算机视觉依赖昂贵标注与模型适配成本高的问题,构建含17种公开资源的AgriField-40K数据集,提出参数高效的AgriMAE方法,可少用9倍可训练参数实现与全微调相当甚至更优的下游性能,为农业视觉持续预训练提供实用资源。

Comments Accepted at the Computer Vision in Plant Phenotyping and Agriculture (CVPPA) Workshop at the European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏
2608.07948 2026-08-11 cs.CV 新提交

SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model

SynVAR:在视觉自回归模型中协同空间与语义对齐

Zhennan Chen, Tianxing Shi, Pengcheng Xu, Kepan Nan, Qian Wang, Zili Yi, Jian Yang, Ying Tai

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Western University(西安大略大学) JIUTIAN Research, CMCC, China(中国移动通信集团九天研究)

AI总结 本文提出首个专为视觉自回归模型(VAR)定制的无训练增强框架SynVAR,通过空间-语义协同控制策略及三个关键组件抑制误差,显著提升了VAR的复杂场景建模能力。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2608.07663 2026-08-11 cs.CV cs.AI cs.CL 新提交

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

保持简洁:用于超长视频理解的多键情景记忆检索

Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

机构 * Yonsei University(延世大学) Adobe Research(奥多比研究院)

AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。

Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/

URL PDF HTML 收藏
2608.07600 2026-08-11 cs.RO eess.IV 新提交

AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion

AdaDexGrasp:基于3D视觉-触觉表示融合的自适应灵巧抓取

Xirui Liang, Jiaqi Liang, Jingkai Xu, Yuran Wang, Ruochong Li, Yuanpei Chen, Masayoshi Tomizuka, Wei Zhan, Ruihai Wu

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 针对机器人抓取难以复刻人类视觉-触觉融合自适应能力的问题,提出AdaDexGrasp视觉-触觉融合抓取框架,通过3D表示融合实现接触感知抓取生成与优化,实验验证其提升了抓取成功率与泛化性。

Comments Accepted at ECCV 2026

URL PDF HTML 收藏
2608.07361 2026-08-10 cs.RO cs.CV 新提交

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

驾驶视觉-语言-动作模型中规划 token 的深度探测与剪枝

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

AI总结 本文针对驾驶 VLA 模型的规划 token,通过探测其 32 个解码器层的信号并剪枝部分层,在误差小幅增加下实现 1.33 倍解码器加速,验证了规划信息早期存在但格式适配问题。

Comments Accepted at the 6th DriveX Workshop (Foundation Models for Autonomous Driving), ECCV 2026. 14 pages, 8 figures, 4 tables

URL PDF HTML 收藏
2608.07176 2026-08-10 cs.CV cs.AI 新提交

Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation

面向隐空间生成的表征驱动型内窥镜视觉嵌入对齐

Francisco Caetano, Tim J. M. Jaspers, Haiko Middeljans, Martijn R. Jong, Rixta A. H. van Eijck van Heslinga, Floor Slooter, Albert J. de Groof, Jacques J. Bergman, Peter H. N. De With, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) Amsterdam University Medical Centers(阿姆斯特丹大学医学中心) University of Amsterdam(阿姆斯特丹大学)

AI总结 本研究针对内窥镜生成模型的领域差距与计算成本问题,提出REVEAL模型,基于500万帧内窥镜数据训练,在多任务中性能优于同类模型,为临床智能工具开发提供基础。

Comments Accepted at the DCA-MI Workshop (ECCV 2026)

URL PDF HTML 收藏
2608.07063 2026-08-10 cs.CR cs.AI 新提交

Soft Redaction of Image Provenance via Zero-Knowledge Proofs

通过零知识证明对图像来源进行软编辑

Muhammad Awan, John Collomosse

AI总结 针对图像来源透明度与隐私的冲突,提出基于零知识证明的软编辑方法,通过距离证明实现隐私保护,兼容C2PA且构建与验证效率较高。

Comments To appear at ECCV 2026 workshop on Privacy Fairness Accountability and Transparency in Computer Vision (PFATCV)

URL PDF HTML 收藏
2608.07003 2026-08-10 cs.CV 新提交

HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models

HRDiT:基于现成扩散Transformer模型的无需训练高分辨率图像生成

Yu Xue, Haoxuan Qu, Zhuoling Li, Hongbin Xu, Jianxiong Yin, Simon See, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) South China University of Technology(华南理工大学) NVIDIA AI Tech Centre(英伟达AI技术中心)

AI总结 本研究针对现成DiT模型适配高分辨率图像合成的空间紊乱、生成时间长两大挑战,提出新方法,经实验验证其有效性,代码公开。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2608.06973 2026-08-10 cs.CV 新提交

When One Modality Is Not Enough: Multimodal Sex and Life-Stage Classification of Red Deer from Aerial RGB-Thermal Video

当单模态不够时:基于航拍RGB-热红外视频的马鹿多模态性别与生命阶段分类

Hugo Markoff, Christoph Praschl, Ivan Ludoški, Sara Beery, Michael Ørsted, David C. Schedl

机构 * Aalborg University(奥尔堡大学) University of Applied Sciences Upper Austria(上奥地利应用科学大学) University of Novi Sad(诺威萨德大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究以马鹿为对象,融合航拍RGB与热红外视频的自监督DINOv3特征,构建多模态分类流程,在四次飞行中实现26只个体25只的正确分类,提升了种群性别与生命阶段分类的鲁棒性,可自动化获取兽群结构数据。

Comments Accepted at the ECCV 2026 Workshop on Computer Vision for Ecology (CV4Ecology), archival proceedings track. 17 pages, 7 figures, 5 tables

URL PDF HTML 收藏
2608.06901 2026-08-10 cs.CV cs.LG 新提交

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

一次剪枝:面向视觉-语言模型的无需重训练的任务无关剪枝

Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

机构 * Chung-Ang University(中央大学) Soongsil University(崇实大学) Kookmin University(国民大学)

AI总结 本文提出名为PORTA的无需重训练的任务无关VLM剪枝框架,通过自适应稀疏分配实现高压缩下的竞争力性能,支持高效VLM压缩。

Comments Accepted to ECCV 2026

URL PDF HTML 收藏