arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

至 收录 4771
2608.13555 2026-08-14 cs.RO cs.AI cs.CV 新提交

HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark

HumanTracker:面向全面且与人类对齐的运动跟踪基准

Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang, Zekai Li, Chenghuai Lin, Xinqiang Yu, Wenyao Zhang, He Wang, Li Yi

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Galbot Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 针对人形运动跟踪评估与人类感知不符、基准多样性不足的问题,提出HumanTracker基准及偏好对齐指标HumanScore,该指标可更好预测人类偏好并揭示运动学指标遗漏的接触与稳定性故障。

Comments Accepted to ECCV 2026

URL PDF HTML 收藏
2608.13478 2026-08-14 cs.CV 新提交

MapRoute++: Surrogate-Guided Semantic Routing for Visual Concept Unlearning

MapRoute++:用于视觉概念遗忘的代理引导语义路由

Ashok Urlana, L. D. M. S. Sai Teja, Vivek Hruday Kavuri, Ponnurangam Kumaraguru

机构 * IIIT Hyderabad(印度信息技术学院海得拉巴分校) TCS Research(塔塔咨询服务公司研究院) NIT Silchar(锡尔卡尔国家理工学院)

AI总结 本研究针对Genμ 2.0挑战视觉概念遗忘任务,在MapRoute基础上引入新训练目标、概念表示及语义路由,使模型在保留相关概念的同时提升概念移除效果,在官方基准上超越SOTA基线12.1%

Comments Accepted at Unlearning and Model Editing Workshop, ECCV 2026

URL PDF HTML 收藏
2608.13385 2026-08-14 cs.CV 新提交

When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL

何时仅需任务向量?隐式多模态上下文学习的经验理论

Jiaqian Li

机构 * Brown University(布朗大学)

AI总结 本文提出选择-实现假说,通过受控多模态任务和VQA基准研究发现,静态任务向量的成功取决于演示诱导变化的跨查询共享程度,为隐式多模态上下文学习的方法选择提供了统一经验理论。

Comments Accepted by Empirical Theory in Representation Learning @ ECCV 2026, Oral

URL PDF HTML 收藏
2608.13283 2026-08-14 cs.AI 新提交

Towards Context-Aware Clinical Motion Understanding in Daily Living at Home: Freezing of Gait Detection with Egocentric Vision

面向居家日常生活中上下文感知的临床动作理解:基于第一视角视觉的步态冻结检测

Vayalet Stefanova, Diwas Lamsal, Margot Genbrugge, Maxim Yudayev, Christian Schlenstedt, Moran Gilat, Bart Vanrumste, Benjamin Filtjens

机构 * KU Leuven(鲁汶大学) Medical School Hamburg(汉堡医学院) Delft University of Technology(代尔夫特理工大学)

AI总结 该研究针对居家PD患者的FOG检测,对比IMU-TCN等模型,发现IMU-TCN性能最优,预训练第一视角视频特征可补充可穿戴传感器的临床动作理解上下文。

Comments Accepted to ECCV Workshop 2026 (Human Motion Challenges in Real-World and Clinical Settings)

URL PDF HTML 收藏
2608.13239 2026-08-14 cs.CV 新提交

Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

社会视听问答的推理:我们处于什么阶段?

Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera, Stéphane Lathuilière

机构 * Inria(法国国家信息与自动化研究所) Univ. Grenoble Alpes(格勒诺布尔大学) CNRS(法国国家科学研究中心) University of Twente(特文特大学)

AI总结 本文针对社会视听问答研究,发现IntentBench存在高噪声,Vanilla SFT基线性能优于现有推理方法,仅用文本模态即可实现与视频相当的性能,并发布了IntentBench-Prime等资源。

Comments Accepted at HCMIW ECCV workshop. Code available here: https://github.com/koenv759/VanillaSFT

URL PDF HTML 收藏
2608.13226 2026-08-14 cs.CV cs.AI 新提交

CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝

Peng Ling, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Zeyu Hu, Xin Wang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) LIGHTSPEED

AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。

Comments Accepted to ECCV 2026 as an Oral Presentation

URL PDF HTML 收藏
2608.13045 2026-08-14 cs.CV 新提交

P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

P2Fusion:基于提示的双先验蒸馏红外-可见光图像渐进融合

Yi Shi, Huichao Xie, Yuqing Wang, Mingyu Wang, Kaihui Yang, Yu Liu, Ruitao Lu, Lizhe Li, Junwei Han, Dingwen Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Hefei University of Technology(合肥工业大学) Rocket Force University of Engineering(火箭军工程大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 针对红外-可见光图像融合的信息差异挑战,提出基于双固有提示的P2Fusion框架,结合Teach-to-Fuse机制与GDER模块,在多数据集上实现SOTA性能并提升下游感知鲁棒性。

Comments Accepted by ECCV 2026. Website: https://p2fusion.github.io

URL PDF HTML 收藏
2608.13031 2026-08-14 cs.CV cs.AI 新提交

UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

UniTraffic-Agent:面向2026年AI城市挑战赛第3赛道的统一交通视频推理,含两项域外评估

Peng Li, Qianqian Xu, Shilong Bao, Yangbangyan Jiang, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院) Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

AI总结 UniTraffic-Agent是第10届AI城市挑战赛第3赛道的MR-CAS解决方案,采用观察-推理-行动-验证工作流,在TAR、FETV、PSI-VQA三项任务中取得相应排名,为交通视频推理提供了新方案。

Comments This paper has been accepted to ECCV 2026 AI City Challenge Workshop

URL PDF HTML 收藏
2608.13014 2026-08-14 cs.CV cs.GR cs.HC cs.RO 新提交

EgoPHI: Estimating Contact and Force from Egocentric Vision

EgoPHI:从第一视角视觉估计接触与力

Andela Ilic, Rachel Schuchert, Yijing Jiang, Christian Holz

机构 * ETH Zürich(苏黎世联邦理工学院)

AI总结 EgoPHI是从单目RGB图像与物体几何联合估计手和物体网格的密集3D接触图与力分布的方法,通过物理模拟扩充数据集,在多场景下实现了性能提升与泛化,推动了第一视角手-物体交互的物理推理。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2608.12843 2026-08-14 cs.CV cs.AI 新提交

Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法

Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo, Hoang Vo, Do Trung Hieu, Hieu Dinh Trung Pham, Khang Minh Le, Huy Minh Nhat Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学) University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) Vietnam National University, Ho Chi Minh City(胡志明市国家大学) VinUniversity Vietnamese-German University(越南德国大学)

AI总结 该研究针对大规模基于文本的行人异常检索难题,提出带分歧感知重排序的异构视觉语言集成方法,在PAB基准上取得90.92% mAP等优异指标,验证了方案有效性。

Comments Accepted at the ECCV 2026 Workshop

URL PDF HTML 收藏
2608.12721 2026-08-14 cs.CV 新提交

VOS-Agent: The 1st Place Solution for the 8th LSVOS Challenge (MOSEv2 Track)

VOS-Agent:第8届LSVOS挑战赛(MOSEv2赛道)的第一名解决方案

Canyang Wu, Jinrong Zhang, Xusheng He, Ce Bian, Xianjing Han, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanyang Technological University(南洋理工大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对复杂视频目标分割中微小目标、语义主导目标的稳健传播难题,本文提出VOS-Agent协作框架,以SAM3为共享密集分割模块,根据目标特征激活专用智能体,在ECCV 2026第8届LSVOS挑战赛MOSEv2赛道获第一名,J&JF指标达69.82%。

Comments 1st Place Solution for the 8th LSVOS MOSEv2 Challenge (ECCV 2026 Workshop)

URL PDF HTML 收藏
2608.12600 2026-08-14 cs.CV cs.AI 新提交

PseudoMapLabeler: Confidence-Aware Pseudo-Label Generation for Semi-Supervised Online Mapping

PseudoMapLabeler:面向半监督在线地图构建的置信感知伪标签生成方法

Chikao Tsuchiya, Dhaval Bhanderi, David Ilstrup, Hsinmin Cheng, Christopher Ostafew

机构 * Nissan Advanced Technology Center - Silicon Valley(日产先进技术中心 - 硅谷) Nissan North America(日产北美公司)

AI总结 针对在线高清地图构建的标注数据稀缺问题,提出带置信感知伪标签的师生半监督学习框架,在nuScenes数据集低标注 regime下使mAP提升6.1,有效缓解数据稀缺困境。

Comments 17 pages, 4 figures, Accepted at ECCV 2026 DriveX Workshop on Foundation Models for Autonomous Driving

URL PDF HTML 收藏
2608.12537 2026-08-14 cs.CV 新提交

Surface-to-Skeleton 3D Cephalometry: Estimating Hidden Skeletal Landmarks from CT-Derived External Soft-Tissue Surfaces

表面到骨骼的3D头影测量:从CT衍生的外部软组织表面估计隐藏的骨骼标志点

Tomoki Abe, Taiki Kanaya, Kazuki Saita, Mao Noda, Chie Tachiki, Yasushi Nishii, Hideo Saito

机构 * Keio University(庆应义塾大学) Tokyo Dental College(东京齿科大学)

AI总结 该研究构建表面到骨骼任务,用集成层次化点云模型从CT衍生外部软组织表面估计隐藏骨骼标志点,在40个留存患者中取得2.97mm的骨骼标志点平均径向误差,证实了隐藏骨骼标志点推断的可行性。

Comments Accepted to AI4M3D Workshop at ECCV 2026

URL PDF HTML 收藏
2608.12515 2026-08-14 cs.CV cs.RO 新提交

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?

Vladyslava Rudas, Dmytro Kuzmenko

机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) University of Turin(都灵大学)

AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。

Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)

URL PDF HTML 收藏
2608.12442 2026-08-14 cs.CV 新提交

MV2: Multi-View Multi-Vehicle Driving Dataset for Novel View Synthesis

MV2:用于新视角合成的多视角多车辆驾驶数据集

Sanjay Bhargav Dharavath, Hanvitha Saraswathi Mukkamala, Faizan Farooq Khan, Ioannis Kakogeorgiou, Aditya Arun, C V Jawahar, Zakaria Laskar

机构 * International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) IIT, National Centre for Scientific Research “Demokritos”(德谟克利特国家科学研究中心 IIT) Adobe MDSR, India(奥多比印度MDSR部门) Indian Institute of Science Education and Research, Thiruvananthapuram(特里凡得琅印度科学教育与研究学院)

AI总结 针对驾驶场景新视角合成的难题,提出含50个场景12000张图像的MV2多车辆数据集,经严格配准验证,基准测试显示视角差异增大NVS性能下降,前馈位姿估计器弱于优化方法。

Comments 18 pages, 7 figures, ECCV accepted paper

URL PDF HTML 收藏
2608.11546 2026-08-14 cs.CV 版本更新

Through Van Gogh's Eyes: Global Style Transfer with Diffusion Model

透过梵高的眼睛:基于扩散模型的全局风格迁移

Jeongha Lee, Yujin Kim, Ghazanfar Ali, Suhyun Kim, Jae-In Hwang

机构 * Korea Institute of Science and Technology(韩国科学技术研究院) University of Science and Technology(科技大学) Korea University(高丽大学) Gachon University(嘉泉大学) Kyung Hee University(庆熙大学)

AI总结 该研究针对现有艺术图像合成方法难以捕捉艺术家全局风格的问题,提出多对一的全局风格迁移范式及对应的全局风格引导、内容对齐引导方法,在WikiArt上验证了其在风格保真度等指标上的优势。

Comments Published at ECCV 2026

URL PDF HTML 收藏
2607.03612 2026-08-14 cs.CV cs.LG 版本更新

SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers

SAF3R:用于前馈3D重建Transformer的动态稀疏注意力

Jianing Deng, Yuanzhe Li, Jialu Wang, Song Wang, Tianlong Chen, Huanrui Yang, Jingtong Hu

机构 * University of Pittsburgh(匹兹堡大学) University of Arizona(亚利桑那大学) Tongji University(同济大学) University of Central Florida(中佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 研究前馈3D重建Transformer,分析其全局注意力模式,提出SAF3R框架,集成稀疏注意力机制、离线头部分析和在线适应策略,在保持质量同时提高稀疏率加速端到端速度。

Comments ECCV 2026. Updated related work

URL PDF HTML 收藏
2606.29395 2026-08-14 cs.CV 版本更新

NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation

NaLA: 一种用于高质量3D场景生成的原生3D LLM布局代理

Cheng Wan, Yongsen Mao, Wenzheng Wu, Yuxuan Xie, Chucheng Xiang, Runze Wang, Xiang Zhang, Zhongyuan Liu, Rushi Dai, Yuan Liu

AI总结 提出NaLA,一种原生3D LLM布局代理,通过直接编码3D边界和资产到LLM中,采用粗到细预测机制,解决文本-3D模态差距导致的布局不合理问题,在生成质量和推理效率上优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://adamcwan.github.io/NaLA/. Code: https://github.com/adamcwan/NaLA-code

URL PDF HTML 收藏
2606.26902 2026-08-14 cs.AI 版本更新

Learning to Recover Task Experts from a Multi-Task Merged Model

从多任务合并模型中恢复任务专家

Jinwook Jung, Taegyu Kim, Kumju Jo, Sungyong Baik

AI总结 提出ReTeX框架,通过预测参数偏移来撤销多任务合并中的参数干扰,从单个合并检查点恢复任务专家性能,并利用SVD子空间签名实现无路由器的任务识别,在视觉和NLP领域恢复超过95%的个体专家性能,同时提升对未见任务的泛化能力。

Comments ECCV 2026

URL PDF HTML 收藏
2512.17897 2026-08-14 cs.CV cs.AI cs.LG cs.RO 版本更新

RadarGen: Automotive Radar Point Cloud Generation from Cameras

RadarGen:从摄像头生成汽车雷达点云

Tomer Borreda, Fangqiang Ding, Sanja Fidler, Shengyu Huang, Or Litany

机构 * Technion(技术学院) MIT(麻省理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。

Comments ECCV 2026. Project page: https://radargen.github.io/

URL PDF HTML 收藏
2512.11393 2026-08-14 cs.CV 版本更新

The N-Body Problem: Parallel Execution from Single-Person Egocentric Video

N体问题:从单人物体中心视频进行并行执行

Zhifan Zhu, Yifei Huang, Yoichi Sato, Dima Damen

机构 * University of Bristol(布里斯托尔大学) The University of Tokyo(东京大学)

AI总结 提出N体问题,从单人物体中心视频预测N人并行执行任务,通过结构化提示策略引导视觉语言模型推理3D环境、物体使用和时间依赖,在EPIC-Kitchens和HD-EPIC数据集上显著提升动作覆盖率并降低冲突。

Comments accepted at ECCV Workshop, project webpage: https://zhifanzhu.github.io/ego-nbody

URL PDF HTML 收藏
2511.17492 2026-08-14 cs.CV 版本更新

EvDiff: Event-Based Video Reconstruction using One-Step Diffusion Models

EvDiff:高质视频与事件相机

Weilun Li, Lei Sun, Ruixi Gao, Qi Jiang, Yuqin Ma, Kaiwei Wang, Ming-Hsuan Yang, Luc Van Gool, Danda Pani Paudel

机构 * Zhejiang University(浙江大学) INSAIT UC Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

AI总结 EvDiff通过基于事件的扩散模型和替代训练框架,从单色事件流生成高质量彩色视频,提升视频生成的保真度和现实感。

Comments Replacement note: This manuscript has been transferred from the CVPR format to the ECCV 2026 format, with the corresponding title and template updated accordingly. The technical content remains largely unchanged from the previous version. (Current version: 21 pages, 6 figures, and 3 tables.) Accepted by ECCV 2026

URL PDF HTML 收藏
2608.12203 2026-08-13 cs.CV 新提交

GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors

GeoFlow:基于几何对齐先验的高效驾驶视频生成

Jiazheng Liu, Hang Li, Jiawei Zhang, Jiahe Li, Xiaohan Yu, Shengyin Fan, Jin Zheng, Xiao Bai

机构 * Beihang University(北京航空航天大学) Macquarie University(麦考瑞大学) Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)

AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。

Comments Accepted at ECCV 2026

URL PDF HTML 收藏
2608.12179 2026-08-13 cs.CV 新提交

Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs

Map-Det3D:面向流输入的多视图3D目标检测的度量前馈3D重建先验

Yung-Hsu Yang, Luigi Piccinelli, Samuel Rota Bulò, Sunghwan Hong, Denis Rozumny, Johannes Schönberger, Zuria Bauer, Hermann Blum, Peter Kontschieder, Marc Pollefeys

机构 * ETH Zürich(苏黎世联邦理工学院) Meta Reality Labs(元宇宙实验室) University of Bonn(波恩大学)

AI总结 Map-Det3D是一种在线多视图3D目标检测模型,通过将短时间窗口映射为多视图并利用前馈度量3D重建模型作为几何骨干,直接在度量3D空间预测边界框,实现了稳定的单目视频3D检测,且具有良好的在线性能与鲁棒迁移性。

Comments ECCV 2026

URL PDF HTML 收藏
2608.12051 2026-08-13 cs.CV 新提交

Do Not Forget the Obvious - RISC: A Risk-Informed Slice-Coverage Protocol for Safe Autonomous Driving

勿忽视显而易见的内容——RISC:一种用于安全自动驾驶的风险感知切片覆盖协议

Fabian Hüger

机构 * CARIAD SE

AI总结 该研究提出RISC协议,将安全问题转化为风险切片,通过风险引导选择提升自动驾驶关键故障发现率,可应用于多类自动驾驶子系统,补充现有测试验证流程。

Comments 14 pages, 3 figures, 5 tables. Accepted at the ECCV 2026 Workshop on Safe and Defensive Autonomous Driving (SDAD). Non-archival workshop paper

URL PDF HTML 收藏
2608.12045 2026-08-13 cs.CV 新提交

Localizing to Debias: A Patch-Level Benchmark and Baseline for Weakly Supervised Spatial Anomaly Detection

定位去偏:弱监督空间异常检测的补丁级基准与基线

Sara Abdulaziz, Abdulrahman Al-Abri, Giacomo D'Amicantonio, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 针对弱监督视频异常检测中存在的背景偏差问题,提出SST-WSVADL稀疏时空框架,结合动态稀疏化与运动感知正则化,发布相关数据集和评估协议,实现异常定位与场景偏差审计,性能与现有方法相当。

Comments ECCV 2026 FAILED Workshop

URL PDF HTML 收藏
2608.11985 2026-08-13 cs.CV 新提交

Auditing Frame-Level AUC in Weakly Supervised Video Anomaly Detection: Granularity, Resolution, and Scene Bias

弱监督视频异常检测中帧级AUC的审计:粒度、分辨率与场景偏差

Sara Abdulaziz, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 该研究针对弱监督视频异常检测的帧级AUC审计,发现其存在定位预测不可靠、分辨率不足、受场景偏差影响等问题,并公开了粒度感知协议。

Comments ECCV 2026 ET Workshop

URL PDF HTML 收藏
2608.11883 2026-08-13 cs.CV 新提交

Warping Earth Observations for better ice labeling in the Marginal Marginal Ice Zone

利用地球观测数据对齐优化边缘冰区的冰标记

Tom Kelly, Martin S. J. Rogers

机构 * British Antarctic Survey(英国南极调查局)

AI总结 该研究提出基于互信息对齐的架构,对齐Sentinel-1与MODIS的多模态卫星场景,构建稀疏专家标注数据集,提升海冰分类准确率,实现从稀疏监督的精确密集海冰分割。

Comments ECCV Workshop paper; BEAM 2

URL PDF HTML 收藏
2608.11844 2026-08-13 cs.CV 新提交

BoltNet: An Ultra-Lightweight Convolutional Network for On-Device Plant Species Identification

BoltNet:用于设备端植物物种识别的超轻量卷积网络

Daniel Rossi, Guido Borghi, Roberto Vezzani

机构 * University of Modena and Reggio Emilia(摩德纳与雷焦艾米利亚大学)

AI总结 针对设备端植物物种识别的需求,提出超轻量卷积网络BoltNet,结合空间重分配瓶颈与logit预采样,在Pl@ntNet300K等数据集上实现高F1分数,且在多硬件平台上效率最优。

Comments Accepted at the CVPPA (Computer Vision Problems in Plant Phenotyping and Agriculture) workshop, ECCV 2026. 17 pages, 2 figures

URL PDF HTML 收藏
2608.11815 2026-08-13 cs.LG cs.CV 新提交

Learning with Bilevel-Minimax Optimization for Efficient and Reliable Transfer Attacks

基于双层极小极大优化的高效可靠迁移攻击学习

Yaohua Liu, Yifan Guo, Jiaxin Gao

机构 * The University of Hong Kong(香港大学) Dalian University of Technology(大连理工大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 该研究提出BMAT方法,通过双层极小极大优化实现初始化、代理适配与扰动的三元耦合,在30余种受害者模型上优于10余种基线,可高效可靠地生成迁移对抗样本。

Comments Accepted by ECCV 2026. 21 pages in total. Code available at https://github.com/callous-youth/BMAT

URL PDF HTML 收藏