arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Winter Conference on Applications of Computer Vision · 会议 · Computer Vision

2025-12-10 至 2025-12-10 共收录 6
2512.08524 2025-12-10 cs.CV cs.CL

Beyond Real Weights: Hypercomplex Representations for Stable Quantization

超越真实权重:用于稳定量化 的超复数表示

Jawad Ibn Ahad, Maisha Rahman, Amrijit Biswas, Muhammad Rafsan Kabir, Robin Krambroeckers, Sifat Momen, Nabeel Mohammed, Shafin Rahman

机构 * Artificial Intelligence Department, RobotBulls Labs(机器人bulls实验室人工智能部门) Machine Intelligence Lab (MILab), North South University(北南大学机器智能实验室)

AI总结 本文提出了一种基于超复数乘法的渐进式重新参数化策略,用于压缩多模态语言模型,实现参数和计算量的显著减少,同时保持模型性能。

Comments Accepted in Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08430 2025-12-10 cs.CV cs.RO

SDT-6D: Fully Sparse Depth-Transformer for Staged End-to-End 6D Pose Estimation in Industrial Multi-View Bin Picking

SDT-6D: 全稀疏深度-变换器用于工业多视角堆叠取料的端到端6D姿态估计

Nico Leuze, Maximilian Hoh, Samed Doğan, Nicolas R. -Peña, Alfred Schoettl

机构 * Institute for Applications of Machine Learning and Intelligent Systems(机器学习与智能系统应用研究所) University of Applied Science Munich(慕尼黑应用科学大学)

AI总结 SDT-6D提出了一种基于稀疏深度-变换器的端到端6D姿态估计方法,通过分阶段热图机制和密度感知稀疏变换器块,实现高分辨率下的高效姿态预测。

Comments Accepted to WACV 2026. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08314 2025-12-10 cs.LG

Minimizing Layerwise Activation Norm Improves Generalization in Federated Learning

逐层激活范数最小化提升联邦学习中的泛化能力

M Yashwanth, Gaurav Kumar Nayak, Harsh Rangwani, Arya Singh, R. Venkatesh Babu, Anirban Chakraborty

AI总结 通过引入'平坦性'约束的优化方法,该研究在联邦学习中最小化逐层激活范数以提升模型泛化能力,实现了新的性能突破。

Comments Accepted to WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08135 2025-12-10 cs.CV

CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning

CVP:基于中央-外围视觉的多模态模型用于空间推理

Zeyuan Chen, Xiang Zhang, Haiyang Xu, Jianwen Xie, Zhuowen Tu

机构 * UC San Diego(圣迭戈大学) Lambda, Inc(Lambda公司)

AI总结 CVP通过结合中央视觉和外围视觉的启发,提出了一种多模态模型,以提升复杂3D环境的空间推理能力。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06335 2025-12-10 cs.CV

Harnessing Object Grounding for Time-Sensitive Video Understanding

利用物体接地提升时间敏感视频理解

Tz-Ying Wu, Sharath Nittur Sridhar, Subarna Tripathi

机构 * Intel(英特尔公司)

AI总结 本文提出 GO-Tokenizer 以提升视频大型语言模型的时间敏感视频理解能力,通过实时编码紧凑的物体信息,提高模型性能并减少噪声影响。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12522 2025-12-10 cs.CV

MuSACo: Multimodal Subject-Specific Selection and Adaptation for Expression Recognition with Co-Training

MuSACo: 多模态主体特定选择与适应用于带有协同训练的表情识别

Muhammad Osama Zeeshan, Natacha Gillet, Alessandro Lameiras Koerich, Marco Pedersoli, Francois Bremond, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ÉTS Montreal(LIVIA,系统工程系,蒙特利尔ÉTS) École Polytechnique, Palaiseau(巴黎政治学院,Palaiseau) Centre INRIA d’Université Côte d’Azur, Sophia Antipolis(法国阿尔卑斯大学INRIA中心,Sophia Antipolis)

AI总结 MuSACo通过多模态协同训练方法提升主体特定表情识别的准确性和鲁棒性,适用于数字健康中的个性化评估。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏