arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

IEEE TPAMI

IEEE Transactions on Pattern Analysis and Machine Intelligence · 期刊 · Computer Vision

至 收录 1562
2604.14632 2026-04-17 cs.CV

High-Speed Full-Color HDR Imaging via Unwrapping Modulo-Encoded Spike Streams

通过解调编码脉冲流实现高速全彩HDR成像

Chu Zhou, Siqi Yang, Kailong Zhang, Heng Guo, Zhaofei Yu, Boxin Shi, Imari Sato

机构 * Digital Content and Media Sciences Research Division, National Institute of Informatics(国家信息研究所数字内容与媒体科学研究中心) Pattern Recognition and Intelligent System Laboratory, School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, the National Engineering Research Center of Visual Technology, School of Computer Science, and the PKU-AI 2 Robotics Joint Lab of Embodied AI, Peking University(多媒体信息处理国家重点实验室,计算机学院,视觉技术国家工程研究中心,计算机学院,北京大学PKU-AI 2机器人联合实验室) Institute for Artificial Intelligence, the State Key Laboratory of Multimedia Information Processing, School of Computer Science, and the National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(人工智能研究院,多媒体信息处理国家重点实验室,计算机学院,视觉技术国家工程研究中心,计算机学院,北京大学) Institute for Artificial Intelligence, and the National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(人工智能研究院,视觉技术国家工程研究中心,计算机学院,北京大学)

AI总结 本文提出一种基于模运算的HDR成像系统,通过改进传感模型和解调算法实现高速全彩HDR成像,有效克服了传统方法在运动伪影与信息损失之间的权衡问题。

Comments TPAMI under review

URL PDF HTML 收藏
2604.12805 2026-04-15 cs.CV

Image-to-Image Translation Framework Embedded with Rotation Symmetry Priors

具有旋转对称先验的图像到图像翻译框架

Feiyu Tan, Heran Yang, Qihong Duan, Kai Ye, Qi Xie, Deyu Meng

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University, Shaanxi, P.R.China(西安交通大学数学与统计学学院,陕西省,中华人民共和国)

AI总结 本文提出基于旋转对称先验的图像到图像翻译框架,通过引入旋转群等价卷积实现旋转等价翻译网络,理论分析TL-Conv的等价误差,并在多种I2I任务中验证其有效性。

Comments 17 pages, 8 figures, submiting to TPAMI

URL PDF HTML 收藏
2604.12709 2026-04-15 cs.LG cs.AI cs.CV

Information-Theoretic Optimization for Task-Adapted Compressed Sensing Magnetic Resonance Imaging

信息论优化用于任务适应的压缩感知磁共振成像

Xinyu Peng, Ziyang Zheng, Wenrui Dai, Duoduo Xue, Shaohui Li, Chenglin Li, Junni Zou, Hongkai Xiong

机构 * Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

AI总结 本文提出基于信息论的任务适应压缩感知磁共振成像方法,通过最大化未采样k空间测量与临床任务间的互信息,实现不确定性预测和适应任意采样比率的灵活控制。

Comments 68 pages, 15 figures, accepted by IEEE TPAMI

URL PDF HTML 收藏
2406.14194 2026-04-07 cs.CV cs.AI

VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model

VLBiasBench: 一个用于评估大视觉-语言模型偏见的综合性基准

Sibo Wang, Xiangkui Cao, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen, Wen Gao

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology (ICT)(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Peking University(北京大学)

AI总结 本文提出VLBiasBench,通过覆盖九种社会偏见类别和两个交叉偏见类别的大规模数据集,评估大视觉-语言模型的偏见问题,基于15种开源和两种闭源模型进行广泛评估,揭示模型中的偏见特征。

Comments Accepted By TPAMI

URL PDF HTML 收藏
2406.05773 2026-04-07 cs.CV

Scalable and Generalizable Correspondence Pruning via Geometry-Consistent Pre-training

基于几何一致预训练的可扩展且可泛化的对应关系修剪

Tangfei Liao, Xiaoqin Zhang, Tao Wang, Hao Ye, Min Li, Guobao Xiao, Mang Ye

机构 * Wuhan University(武汉大学) Wenzhou University(温州大学) Nanjing University(南京大学) Xiaomi Corporation, Xiaomi Automobile Co., Ltd.(小米集团,小米汽车有限公司) Tongji University(同济大学)

AI总结 本文提出几何一致预训练方法,通过掩码内点重建任务和双流编码器提升对应关系的鲁棒性和泛化能力,在相机姿态估计、视觉定位和3D配准任务中取得显著性能提升。

Comments Accepted by TPAMI 2026

URL PDF HTML 收藏
2407.17491 2026-04-07 cs.CV cs.LG

Robust Adaptation of Foundation Models with Black-Box Visual Prompting

基于黑盒视觉提示的模型鲁棒适应

Changdae Oh, Gyeongdeok Seo, Geunyoung Jung, Zhi-Qi Cheng, Hosik Choi, Jiyoung Jung, Kyungwoo Song

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Seoul(首尔市立大学) Yonsei University(延世大学) University of Washington(华盛顿大学)

AI总结 本文提出BlackVIP方法,通过协调器和SPSA-GC组件实现无需模型参数的PTM适应,通过实验展示其在不同领域和任务中的鲁棒性,同时提供理论分析支持视觉提示方法的鲁棒性。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) 2026

URL PDF HTML 收藏
2604.02896 2026-04-06 cs.CV

EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment

EvaNet:迈向更高效且一致的红外与可见图像融合评估

Chunyang Cheng, Tianyang Xu, Xiao-Jun Wu, Tao Zhou, Hui Li, Zhangyong Tang, Josef Kittler

机构 * Jiangnan University(江南大学) University of Surrey(萨里大学)

AI总结 本文提出EvaNet框架,通过轻量网络高效近似常用指标,结合对比学习和大语言模型感知评估,实现更一致的图像融合评估。

Comments 20 figures,accepted by TPAMI

URL PDF HTML 收藏
2401.14295 2026-04-02 cs.CL cs.AI cs.LG

Demystifying Chains, Trees, and Graphs of Thoughts

解开思维链、树和图的谜团

Maciej Besta, Florim Memedi, Zhenyu Zhang, Robert Gerstenberger, Guangyuan Piao, Nils Blach, Piotr Nyczyk, Marcin Copik, Grzegorz Kwaśniewski, Jürgen Müller, Lukas Gianinazzi, Ales Kubicek, Hubert Niewiadomski, Aidan O'Mahony, Onur Mutlu, Torsten Hoefler

机构 * ETH Zurich(苏黎世联邦理工学院) Dell(戴尔) Cledar BASF SE(巴斯夫欧洲公司)

AI总结 本文通过分析提示执行流程,构建了首个结构增强的大语言模型推理方案分类法,揭示了不同结构对推理性能和成本的影响,并探讨了提示工程与语言模型生态系统的理论基础。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, Volume 47, Issue 12, pages 10967-10989 (December 2025)

URL PDF HTML 收藏
2510.08553 2026-03-31 cs.CV cs.AI cs.RO

Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation

梦想回溯:基于想象的体验检索用于记忆持久的视觉与语言导航

Yunzhe Xu, Yiyuan Pan, Zhe Liu

机构 * National Key Laboratory of Human Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(西安交通大学人机混合增强智能全国重点实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 本文提出Memoir,通过想象引导的检索机制提升记忆持久的视觉与语言导航性能,通过混合视角记忆和经验增强导航模型,在多个基准测试中实现了显著提升。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

URL PDF HTML 收藏
2507.16279 2026-03-31 cs.CV

MAN++: Scaling Momentum Auxiliary Network for Supervised Local Learning in Vision Tasks

MAN++: 用于视觉任务中监督局部学习的动量辅助网络扩展

Junhao Su, Feiyu Zhu, Hengyu Shi, Tianyang Han, Yurui Qiu, Junfeng Luo, Xiaoming Wei, Jialin Gao

机构 * Vision Intelligence in MeiTuan(美团视觉智能) AttrSense

AI总结 MAN++通过引入动态交互机制和可学习缩放偏置,提升视觉任务中监督局部学习的性能,减少GPU内存消耗并保持与端到端训练相当的精度。

Comments Accepted by TPAMI

URL PDF HTML 收藏
2409.20283 2026-03-31 cs.CV

Match Stereo Videos via Bidirectional Alignment

通过双向对齐匹配立体视频

Junpeng Jing, Ye Mao, Anlan Qiu, Krystian Mikolajczyk

机构 * Department of Electrical and Electronic Engineering, Imperial College London(伦敦帝国理工学院电气与电子工程系)

AI总结 本文提出双向对齐机制和BiDAStereo框架,解决视频立体匹配中的时间不一致问题,并引入真实场景数据集提升预测质量,达到各基准测试的最先进水平。

Comments TPAMI 2026

URL PDF HTML 收藏
2509.15219 2026-03-30 cs.CV cs.LG cs.MA cs.MM cs.RO

Out-of-Sight Embodied Agents: Multimodal Tracking, Sensor Fusion, and Trajectory Forecasting

视线外的具身智能体:多模态跟踪、传感器融合与轨迹预测

Haichao Zhang, Yi Xu, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)

AI总结 本文提出改进的视线外轨迹预测方法,通过视觉定位去噪模块提升轨迹预测性能,实验表明在Vi-Fi和JRDB数据集上达到最优效果,为自动驾驶、机器人和监控提供新方向。

Comments Published in IEEE Transactions on Pattern Analysis and Machine Intelligence (Early Access), pp. 1-14, March 23, 2026

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

URL PDF HTML 收藏
2603.23390 2026-03-25 cs.CV eess.IV

Harnessing Lightweight Transformer with Contextual Synergic Enhancement for Efficient 3D Medical Image Segmentation

利用轻量级Transformer与上下文协同增强进行高效的3D医学图像分割

Xinyu Liu, Zhen Chen, Wuyang Li, Chenxin Li, Yixuan Yuan

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR(电子工程系,香港中文大学(深圳)Hong Kong SAR) Centre for Artificial Intelligence and Robotics (CAIR), Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong SAR(人工智能与机器人中心(CAIR),香港科学与创新研究院,中国科学院,Hong Kong SAR)

AI总结 本文提出Light-UNETR,通过轻量级维度缩减注意力模块和紧凑门控线性单元提升模型效率,结合上下文协同增强策略提高数据效率,在少量标注数据下实现高效3D医学图像分割。

Comments Accepted to IEEE TPAMI

URL PDF HTML 收藏
2603.23041 2026-03-25 cs.CV cs.AI cs.LG

HUydra: Full-Range Lung CT Synthesis via Multiple HU Interval Generative Modelling

HUydra: 通过多HU区间生成建模实现全范围肺CT合成

António Cardoso, Pedro Sousa, Tania Pereira, Hélder P. Oliveira

机构 * INESC TEC, Portugal(葡萄牙INESC TEC研究院) Faculty of Engineering, University of Porto, Portugal(葡萄牙波尔图大学工程学院) Faculty of Sciences, University of Porto, Portugal(葡萄牙波尔图大学科学学院)

AI总结 本文提出一种多HU区间生成建模方法,通过训练针对特定组织的生成模型并融合输出,实现全范围肺CT合成,优于传统2D基线,提升FID和MMD等指标。

Comments Submitted to iEEE TPAMI (Transactions on Pattern Analysis and Machine Intelligence)

URL PDF HTML 收藏
2503.11067 2026-03-25 cs.IR

Variational Bayesian Personalized Ranking

变分贝叶斯个性化排序

Bin Liu, Xiaohong Liu, Qin Luo, Ziqiao Shang, Jielei Chu, Lin Ma, Zhaoyu Li, Fei Teng, Guangtao Zhai, Tianrui Li

AI总结 本文提出变分贝叶斯个性化排序(VarBPR),通过变分推断框架解决隐式反馈配对学习中的稀疏监督、噪声和曝光偏差问题,提供理论解释和曝光可控性。

Comments in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI , 2026)

URL PDF HTML 收藏
2603.19575 2026-03-24 cs.CV

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) PengCheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

URL PDF HTML 收藏
2603.20290 2026-03-24 cs.CV cs.RO eess.IV

Transparent Fragments Contour Estimation via Visual-Tactile Fusion for Autonomous Reassembly

通过视觉-触觉融合实现透明碎片轮廓估计以实现自主重装

Qihao Lin, Borui Chen, Yuping Zhou, Jianing Wu, Yulan Guo, Weishi Zheng, Chongkun Xia

机构 * School of Advanced Manufacturing, Sun Yat-sen University(中山大学先进制造学院) School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

AI总结 本文提出基于视觉-触觉融合的透明碎片轮廓估计框架,通过构建TransFrag27K数据集和TransFragNet网络,结合触觉信息与视觉线索,实现碎片轮廓估计与重装,验证了方法的有效性。

Comments 17 pages, 22 figures, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence

URL PDF HTML 收藏
2507.17343 2026-03-23 cs.CV cs.LG cs.MM

Principled Multimodal Representation Learning

原理化的多模态表征学习

Xiaohao Liu, Xiaobo Xia, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文提出PMRL框架,通过优化表示矩阵的主导奇异值实现多模态的同时对齐,采用基于softmax的损失函数和实例对比正则化,提升表征稳定性与分离性,在多种任务中优于基线方法。

Comments Accepted by IEEE TPAMI 2026

URL PDF HTML 收藏
2603.18598 2026-03-20 cs.CV

Complementary Text-Guided Attention for Zero-Shot Adversarial Robustness

互补文本引导注意力用于零样本对抗鲁棒性

Lu Yu, Haiyang Zhang, Changsheng Xu

机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of the Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出TGA-ZSR和Comp-TGA方法,通过局部注意力细化模块和全局注意力约束模块提升CLIP模型的零样本对抗鲁棒性,实验显示在16个数据集上分别提升9.58%和11.95%。

Comments Accepted to TPAMI 2026. arXiv admin note: substantial text overlap with arXiv:2410.21802

URL PDF HTML 收藏
2506.00030 2026-03-20 cs.LG

Modality Equilibrium Matters: Minor-Modality-Aware Adaptive Alternating for Cross-Modal Memory Enhancement

模态均衡至关重要:面向跨模态记忆增强的次要模态感知自适应交替方法

Xiang Shi, Rui Zhang, Jiawei Liu, Yinpeng Liu, Qikai Cheng, Wei Lu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院)

AI总结 本文提出一种基于Shapley值的自适应交替训练框架,通过优先考虑次要模态平衡融合,引入记忆模块和跨模态映射机制,提升多模态学习性能,在四个基准数据集上取得SOTA结果。

Comments Accepted by TPAMI

URL PDF HTML 收藏
2603.17455 2026-03-19 cs.CV

FACE-net: Factual Calibration and Emotion Augmentation for Retrieval-enhanced Emotional Video Captioning

FACE-net:事实校准与情感增强用于检索增强的情感视频描述

Weidong Chen, Cheng Ye, Zhendong Mao, Peipei Song, Xinyan Liu, Lei Zhang, Xiaojun Chang, Yongdong Zhang

AI总结 本文提出FACE-net框架,通过统一架构协同挖掘事实与情感语义,提供适应性指导以生成准确描述,解决事实-情感偏置问题。

Comments Submitted to TPAMI. 16 pages, 9 figures

URL PDF HTML 收藏
2603.16569 2026-03-18 cs.LG

Deep Tabular Representation Corrector

深度表格表示校正器

Hangting Ye, Peng Wang, Wei Fan, Xiaozhuang Song, He Zhao, Dandan Gun, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Ministry of Education, China(教育部知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) CSIRO’s Data61 and Monash University(CSIRO的数据61与莫纳什大学)

AI总结 本文提出TRC方法,通过两个任务提升深度表格模型的表示,无需修改参数,有效解决表示偏移和冗余问题。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

URL PDF HTML 收藏
2603.01535 2026-03-17 cs.CV

Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing

通过外观和几何属性编辑评估语义分割模型

Zijin Yin, Bing Li, Kongming Liang, Hao Sun, Zhongjiang He, Zhanyu Ma, Jun Guo

AI总结 本文提出Gen4Seg数据生成管道,通过生成具有不同属性变化的挑战样本来评估语义分割模型,构建了Pascal-EA和COCO-EA两个新基准,发现开放词汇模型在几何变化下不比封闭集方法更鲁棒,数据增强技术在提升外观变化鲁棒性上有限。

Comments Accepted to IEEE TPAMI 2026

URL PDF HTML 收藏
2509.19115 2026-03-17 cs.CV

Track-On2: Enhancing Online Point Tracking with Memory

Track-On2:通过记忆增强在线点跟踪

Görkay Aydemir, Weidi Xie, Fatma Güney

AI总结 本文提出Track-On2,一种基于Transformer的高效在线长时跟踪模型,通过架构优化和内存利用提升性能与效率,适用于实时和流式应用。

Comments TPAMI 2026

URL PDF HTML 收藏
2410.08950 2026-03-17 cs.LG cs.AI

On the Adversarial Transferability of Generalized "Skip Connections"

关于通用“跳跃连接”的对抗迁移性

Yisen Wang, Yichuan Mo, Dongxian Wu, Mingjie Li, Xingjun Ma, Zhouchen Lin

AI总结 本文研究了跳跃连接在对抗场景下的迁移性,提出Skip Gradient Method (SGM)提升攻击迁移性,并验证其在多种模型和攻击场景下的有效性。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

URL PDF HTML 收藏
2404.00712 2026-03-17 cs.LG cs.AI cs.CY cs.IR

Survey of Computerized Adaptive Testing: A Machine Learning Perspective

计算机自适应测试综述:机器学习视角

Yan Zhuang, Qi Liu, Haoyang Bi, Zhenya Huang, Weizhe Huang, Jiatong Li, Junhao Yu, Zirui Liu, Zirui Hu, Yuting Hong, Zachary A. Pardos, Haiping Ma, Mengxiao Zhu, Shijin Wang, Enhong Chen

AI总结 本文从机器学习角度综述了计算机自适应测试,探讨了测量模型、题目选择算法、题库构建与测试控制等核心问题,分析了当前方法的优劣与挑战,旨在推动更高效、公平的自适应测试系统。

Comments accepted by IEEE TPAMI 2026

URL PDF HTML 收藏
2603.13674 2026-03-17 cs.LG cs.AI stat.ML

Locally Linear Continual Learning for Time Series based on VC-Theoretical Generalization Bounds

基于VC理论泛化界限的局部线性持续学习用于时间序列

Yan V. G. Ferreira, Igor B. Lima, Pedro H. G. Mapa S., Felipe V. Campos, Antonio P. Braga

机构 * Department of Electronic Engineering, Universidade Federal de Minas Gerais(米纳斯格拉斯联邦大学电子工程系) Graduate Program in Electrical Engineering, Universidade Federal de Minas Gerais(米纳斯格拉斯联邦大学电气工程研究生项目)

AI总结 本文提出SyMPLER模型,通过动态分段线性近似实现非平稳环境下时间序列预测,利用统计学习理论的泛化界限自动决定新增局部模型时机,兼顾准确性和可解释性。

Comments 12 pages. Accepted at IEEE Transactions on Pattern Analysis and Machine Intelligence

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, Early Access, 2026

URL PDF HTML 收藏
2507.11099 2026-03-12 cs.CV

A Survey on Interpretability in Visual Recognition

视觉识别中可解释性的综述

Qiyang Wan, Chengzhi Gao, Ruiping Wang, Xilin Chen

AI总结 本文综述了视觉识别中可解释性的发展,从意图、对象、呈现和方法学角度建立多维分类法,总结了关键评估指标,并探讨了多模态大语言模型的可解释性及实际应用。

Comments 20 pages, 8 figures, 7 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

URL PDF HTML 收藏
2603.06993 2026-03-10 cs.CV

AdaGen: Learning Adaptive Policy for Image Synthesis

AdaGen: 为图像合成学习自适应策略

Zanlin Ni, Yulin Wang, Yeguo Hua, Renping Zhou, Jiayi Guo, Jun Song, Bo Zheng, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学)

AI总结 AdaGen通过学习自适应策略提升图像合成性能,采用强化学习优化调度过程,实现更高效的生成效果和可控的保真度-多样性权衡。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Journal version of arXiv:2409.00342 (ECCV 2024). Code is available at: https://github.com/LeapLabTHU/AdaGen

URL PDF HTML 收藏
2603.04099 2026-03-05 cs.CV cs.AI

Efficient Point Cloud Processing with High-Dimensional Positional Encoding and Non-Local MLPs

高效点云处理与高维位置编码及非局部MLP

Yanmei Zou, Hongshan Yu, Yaonan Wang, Zhengeng Yang, Xieyuanli Chen, Kailun Yang, Naveed Akhtar

机构 * School of Artificial Intelligence and Robotics, Quanzhou Institute of Industrial Design and Machine Intelligence Innovation, Hunan University(人工智能与机器人学院、泉州工业设计与智能机械创新研究院、湖南大学) College of Engineering and Design, Hunan Normal University(工程与设计学院、湖南师范大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院、国防科技大学) School of Computing and Information Systems, The University of Melbourne(计算与信息学院、墨尔本大学)

AI总结 本文提出了一种基于高维位置编码和非局部MLP的点云处理方法,通过两阶段抽象和细化框架提升效率与效果。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Source code is available at https://github.com/zouyanmei/HPENet_v2.git

URL PDF HTML 收藏