arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2608.19598 2026-08-21 cs.CV cs.AI cs.CL cs.MM 新提交 70%

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

PEA-DPO:用于多模态大语言模型对齐的感知增强型直接偏好优化

Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态大语言模型偏好优化存在的视觉不敏感性问题,提出PEA-DPO框架,利用视觉偏好信号缓解该问题,提升多模态对齐效果并减少幻觉。

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17414 2026-08-19 cs.CV cs.PL 新提交 70%

REChart: Reasoning-Efficient Chart Editing with Large Reasoning Models

REChart:基于大型推理模型的推理高效图表编辑方法

Yuanbang Liu, Chenxi Ruan, Yihan Hou, Qiong Luo, Wei Zeng

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 REChart是两阶段训练框架,通过过程级监督提升图表编辑的保真度与推理效率,在两个基准上实现同规模开源模型最优性能,推理token用量降低79.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06458 2026-08-19 cs.IR cs.CV cs.LG 70%

PixRec: Leveraging Visual Context for Next-Item Prediction in Sequential Recommendation

PixRec: 利用视觉上下文进行序列推荐中的下一项预测

Sayak Chakrabarty, Souradip Pal

机构 * Department of Computer Science, Northwestern University(北western大学计算机科学系) Elmore Family School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 PixRec通过整合视觉信息提升序列推荐的准确性,利用视觉-语言模型在电子商务中实现更精准的下一项预测。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14829 2026-08-18 eess.IV cs.CV 新提交 70%

Modality-Invariant Coarse-to-Fine Retinal Image Registration

模态无关的由粗到细视网膜图像配准

Bo Wen, Nehal Nailesh Mehta, Melanie Tran, Dirk-Uwe Bartsch, William Freeman, Truong Nguyen

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有视网膜配准方法依赖模态的局限,提出可泛化的两阶段模态无关框架,含稀疏特征匹配模型与MI-RAFT网络,在多模态视网膜图像配准中性能优于现有方法。

Comments This paper is a submission to IEEE Transactions on Image Processing (TIP-40498-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14662 2026-08-18 eess.SP cs.AI cs.LG 新提交 70%

Does the Heart Show Your Pain? Tackling the X-ITE Pain Challenge with Self-Supervised ECG Representation Learning

心脏能反映你的疼痛吗?用自监督心电表示学习应对X-ITE疼痛挑战赛

Dominika Kunc, Przemysław Kazienko, Stanisław Saganowski

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本研究针对X-ITE疼痛挑战赛,结合自监督心电表示学习与多模态预训练,分析疼痛识别中的心电信号特性,为可穿戴疼痛监测提供了基础。

Comments 5 pages, 3 Figures, 1 Table, appear in the Proceedings of the 13th International Conference on Affective Computing and Intelligent Interaction Workshops and Demos (ACIIW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14198 2026-08-17 cs.LG cs.CL 新提交 70%

MINT: A Universal Zero-Shot Predictor for Transaction Data

MINT:一种用于交易数据的通用零样本预测器

Parameswaran Kamalaruban, Viktor Drobnyi, Maeve Madigan, Julia Rozanova, David Sutton, Stuart Burrell

机构 * Visa Inc.(维萨公司)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13974 2026-08-17 cs.CV 新提交 70%

ProFocus: Interpreting Affective Experience in Artistic Images with Progressive Visual Focusing

ProFocus:通过渐进式视觉聚焦解释艺术图像中的情感体验

Zhiyan Zhang, Zicheng Yan, Jianqi Chen, Peipei Song, Shanshan Wang, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Anhui University(安徽大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究针对现有方法无法捕捉艺术情感细微线索的问题,提出ProFocus框架,通过层级艺术评论家与渐进式提示融合模块,在ArtEmis数据集上实现了更优的情感识别与解释性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28969 2026-08-12 cs.CV 版本更新 70%

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

SafeNexus:在多模态大语言模型(MLLMs)中发现与调控模态通用安全神经元

Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin, Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 SafeNexus是一种跨模态安全对齐框架,通过定位并调控模态通用安全神经元,提升多模态大语言模型在跨模态威胁下的安全性,且能保留模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09907 2026-08-11 cs.CV 新提交 70%

DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning

DistMoE:用于分布式指令调优的混合专家模型中无需私有数据排练的路由机制

Mainak Singha, Niccolò Biondi, Elisa Ricci, Subhankar Roy

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Bergamo(贝加莫大学)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态大语言模型分布式私有数据场景,提出DistMoE混合专家方法,通过公共锚定专家组合阶段实现无需排练的路由,在视觉-语言基准上取得灵活复用与适配的竞争力性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08630 2026-08-11 cs.CV 新提交 70%

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

VLZip:用于交错长上下文建模的统一视觉与文本压缩方法

Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06122 2026-08-10 cs.LG cs.AI 版本更新 70%

Is Self-Pretraining really useful to improve diagnosis in medical Time Series?

自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?

Omar Coser, Antonio Orvieto, Paolo Soda, Loredana Zollo

机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) Umeå University(于默奥大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。

Comments 21 pages, 7 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06146 2026-08-07 cs.AI 新提交 70%

PaDoc: Layout-Grounded Parallel Decoding for Document Parsing

PaDoc:基于布局的文档并行解码方法

Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin Wang, Chong Sun, Chen Li, Jing Lyu, Chun Yuan

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出PaDoc,一种基于布局的文档并行解码解析器,在OmniDocBench Full数据集上取得优异性能,且在A800 GPU上显著提升端到端文档解析的吞吐量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05671 2026-08-07 cs.CV 新提交 70%

URNet: A Unified Reparameterized Network for Efficient RGB-D Semantic Segmentation

URNet:用于高效RGB-D语义分割的统一重参数化网络

Guoan Xu, Zhengxue Wang, Yang Xiao, Ligeng Chen, Guangwei Gao, Dongchen Zhu

机构 * University of Technology Sydney(悉尼科技大学) Nanjing University of Science and Technology(南京理工大学) Honor Device Co., Ltd.(荣耀终端有限公司) Shanghai Institute of Microsystem and Information Technology, CAS(中国科学院上海微系统与信息技术研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有RGB-D语义分割方法的不足,提出URNet,通过单编码器实现多模态特征提取与跨模态融合,采用RepBlock、LGA和PMD,在多基准上达到最优性能且高效。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27771 2026-08-07 cs.LG cs.CV 版本更新 70%

NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

NormGuard: 流匹配强化学习中保持奖励的范数约束

Tianlin Pan, Lianyu Pang, Cheng Da, Huan Yang, Changqian Yu, Kun Gai, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。

Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03185 2026-08-05 cs.CV 新提交 70%

CRIL-U-Net: Compact Ratio-Interaction Learning for Focal Cortical Dysplasia Segmentation from T1w and FLAIR MRI

CRIL-U-Net:用于从T1w和FLAIR MRI中分割局灶性皮质发育不良的紧凑比率交互学习网络

Soumen Ghosh, Amit Soni Arya, Tilottama Goswami, Subhojit Mandal, John Phamnguyen, Rajat Vashistha

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 该研究针对II型局灶性皮质发育不良MRI自动分割难题,提出CRIL-U-Net模型,在85例患者与25例对照的五折交叉验证中,其性能显著优于传统及注意力型U-Net。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08199 2026-08-05 cs.CV cs.RO 版本更新 70%

Fusion-Poly: A Polyhedral Framework Based on Spatial-Temporal Fusion for 3D Multi-Object Tracking

Fusion-Poly: 一种基于时空融合的多边形框架用于3D多目标跟踪

Xian Wu, Yitao Wu, Xiaoyu Li, Zijia Li, Lijun Zhao, Lining Sun

机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人与系统国家重点实验室,哈尔滨工业大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Fusion-Poly通过整合异步LiDAR和相机数据,提出一种时空融合框架,提升3D多目标跟踪的轨迹一致性与更新频率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02449 2026-08-04 cs.CV cs.RO 新提交 70%

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理

Ambarish Govindarajulu Kaliamurthi, Kaikai Liu

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。

Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26555 2026-07-30 cs.CL 新提交 70%

Where Detectors Fail: Closing the Tail-Domain Gap with Expert-Guided Mutual Distillation

检测器何时失效:通过专家引导的互蒸馏缩小尾域差距

Xuan Feng, Guihong Liu, Tianlong Gu, Shuai Zhao, Xuemin Wang, Chenzhong Bin, Yang Liu, Bo An

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CL

AI总结 针对多模态假新闻检测器跨域泛化差的问题,提出专家引导的互蒸馏方法,构建域平衡基准Weibo_Balanced,在四个数据集上实现SOTA准确率并大幅降低域偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26395 2026-07-30 cs.CV 新提交 70%

Registration-Grounded Spectral Fusion for Unregistered WLI/NBI Endoscopic Lesion Segmentation

基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割

Pengyu Jie, Wanquan Liu, Rui He, Pengcheng Li, Weiping Wen, Deyu Meng, Junwei Han, Chenqiang Gao

机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23181 2026-07-28 cs.CV 新提交 70%

Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation

迈向视觉语言导航的双脑最小充分表示

Yihao Wu, Chenyi Xu, Liqi Yan, Chenhuan Cai, Geyong Min, Bin Lin, Fangli Guan, Jianhui Zhang, Pan Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) University of Zurich(苏黎世大学) University of Exeter(埃克塞特大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对视觉语言导航中存在的问题,提出BrainNav框架,包含逻辑锚定模型等三个组件,通过将语义意图与空间感知对齐,提升智能体在复杂任务中的表现,在实验中相比之前最优方法有改进,为鲁棒的视觉语言导航提供有效基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22716 2026-07-28 cs.CV cs.LG 新提交 70%

Visual Token Compression Enhances Robustness of MLLMs

视觉令牌压缩增强多模态大语言模型的鲁棒性

Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 研究如何增强多模态大语言模型的鲁棒性,核心方法是通过测量视觉令牌与语言特征空间的距离来识别并剪枝分布外视觉令牌,该方法能有效防御越狱攻击、减轻幻觉,提升模型在通用数据集上的表现。

Comments 20 pages, 16 figures. Accepted at ACM Multimedia 2026. Code: https://github.com/Eurek001/OOD-VTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21179 2026-07-24 cs.CV 新提交 70%

Out of Sight, Still in Mind: Token Compression for Omni-LLMs

视而不见,仍记于心:全模态大语言模型的令牌压缩

Suho Yoo, Youngjoon Jang, Hyebin Cho, Joon Son Chung

机构 * KAIST(韩国科学技术院) VGG, University of Oxford(牛津大学视觉几何组)

专题命中 多模态训练与对齐 :audio-visual(abstract);omni-modal(abstract);分类 cs.CV

AI总结 研究旨在降低Omni-LLMs推理时输入令牌成本,提出无需训练的ReMo框架,通过跨模态重分配信息压缩视觉令牌,在Qwen2.5-Omni上实验,去除54%输入令牌且准确率无损失,甚至略超全令牌模型。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21863 2026-07-23 cs.CV 版本更新 70%

Prompt-Calibrated SAM 3 for Open-Vocabulary Remote Sensing Semantic Segmentation

Prompt-Calibrated SAM 3 用于开放词汇遥感语义分割

Yanghui Song, Nanqing Liu, Haonan Yin, Yingjie Gao, Chengfu Yang, Qi Ming

机构 * School of Information Science and Technology, Yunnan Normal University(云南师范大学信息科学与技术学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出ProC-SAM3方法,通过离线提示池、缓存文本嵌入和存在引导残差融合,解决开放词汇遥感语义分割中提示语义覆盖不足、冗余编码和噪声传播问题,在8个基准上平均mIoU达56.1%。

Comments 5 pages, 5 figures. Accepted for publication in IEEE Geoscience and Remote Sensing Letters (GRSL)

Journal ref IEEE Geoscience and Remote Sensing Letters, vol. 23, 2026, Art. no. 3713378

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13976 2026-07-17 cs.CV 版本更新 70%

CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition

CF-Net:用于矛盾/犹豫识别的具有说话者归一化和确定性加权的冲突融合

Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对无约束视频中矛盾和犹豫检测的挑战,提出CF-Net,用特定主干编码多模态流,经归一化和冲突融合模块处理,结合多种训练方法,在相关数据集上取得了较好成绩。

Comments 6 pages, 3 figures, 3 tables, 26 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09749 2026-07-14 eess.SP cs.AI cs.LG 新提交 70%

MorphologyFM: A Foundation Model for Morphology-Aware Representation Learning from ECG and Pulse Oximetry Waveforms

MorphologyFM:一种用于从心电图和脉搏血氧波形中进行形态感知表示学习的基础模型

Saiyang Feng, Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 研究针对现有生理波形方法未保留临床意义波形形态的问题,提出多模态基础模型MorphologyFM,通过形态感知自监督学习目标预训练,结合多种技术学习相关表示,在多下游任务中表现优于其他方法,证明联合建模更具可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09143 2026-07-13 cs.CV 新提交 70%

Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing

编织光与时间:用于密集RGB-事件解析的统一谐波-几何表示学习

Chenxu Peng, Chongtian zhou, Dicheng Liu, Bo-Wen Yin, Yimian Dai, Xialei Liu, Ming-Ming Cheng, Xiang Li

机构 * NKIARI(鹏城实验室) VCIP, CS, Nankai University(南开大学视觉计算与图像处理研究室) AAIS, Nankai University(南开大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 研究针对RGB-事件解析中统一主干应用的挑战,提出Evita统一主干,嵌入几何视差校正等协同学习模块,构建N-ImageNetV2及预训练协议,经多基准评估,其实现新指标,在实时多模态上精度-延迟权衡表现卓越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10946 2026-07-10 cs.IT cs.AI cs.LG eess.SP math.IT 版本更新 70%

ToDMA: Large Model-Driven Massive Token Communications for Semantic Multiple Access

ToDMA:用于语义多址接入的大模型驱动海量令牌通信

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Robert Schober, Deniz Gündüz

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) University of Surrey(Surrey大学) Friedrich-Alexander-University Erlangen-Nurnberg(埃森哲-亚琛工业大学) Imperial College London(伦敦帝国理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出ToDMA,一种大模型驱动的语义多址接入方案,将无源随机接入与上下文感知令牌处理结合,用于海量令牌通信。通过压缩感知检测令牌及估计信道状态信息,利用上下文模型恢复冲突令牌,能降低接入延迟并保持令牌恢复与语义重建质量。

Comments Submitted to IEEE journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04098 2026-07-07 cs.CV 新提交 70%

Sparse4D-Radar: An Efficient and Robust Framework for Surround-View 3D Object Detection via 4D Radar-Camera Fusion

Sparse4D-Radar:一种通过4D雷达-相机融合实现高效且稳健的环视3D目标检测框架

Fuyuan Ai, Yuchen Tan, Jiehui Chen, Zhiwei Xu, Chunyi Song

机构 * State Key Laboratory of Ocean Sensing and Ocean College, Zhejiang University(浙江大学海洋传感与海洋学院海洋传感技术国家重点实验室) Engineering Research Center of Oceanic Sensing Technology and Equipment, Ministry of Education, Zhejiang University(浙江大学海洋传感技术与装备教育部工程研究中心) Donghai Laboratory(东海实验室) Ocean College, Institute of Marine Electronics and Intelligent Systems, Zhejiang University(浙江大学海洋学院海洋电子与智能系统研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对4D成像雷达在环视感知缺乏成熟方案的问题,提出Sparse4D-Radar框架。设计可变形融合模块等,经实验验证该框架在环视3D检测性能上达先进水平,兼顾精度、鲁棒性与效率。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31496 2026-07-01 cs.CV 新提交 70%

HVPNet: A Bio-Inspired Network for General Salient and Camouflaged Object Detection

HVPNet:一种用于通用显著和伪装目标检测的仿生网络

Jiawei Xu, Qiangqiang Zhou, Zhouping Li, Yanjiao Shi, Yugen Yi, Jiacong Yu

机构 * School of Artificial Intelligence, Jiangxi Normal University(江西师范大学人工智能学院) Faculty of Business Information, Shanghai Business School(上海商学院商务信息学院) School of Computer Science and Information Engineering, Shanghai Institute of Technology(上海应用技术大学计算机科学与信息工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 受人类视觉过程启发,提出简单通用的仿生架构HVPNet,通过视网膜整合模块和皮层解码器实现多模态特征高效融合,在7个任务22个数据集上取得精度-效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 70%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏