arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 220 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 220 篇

2608.09474 2026-08-11 cs.CV 新提交 57%

FaLCon: Facet-Anchored Retrieval with Late Consensus for Sim2Real Text-Based Person Anomaly Search

FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索

Hieu Dinh Trung Pham, Phuong Huu Vu Tran, Thuan Duc Mai, Son Nguyen Minh Le, Khang Le Minh, Hoang Vo, Minh-Chi Phung, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology(信息技术大学) Ho Chi Minh city University of Science(胡志明市科学大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08883 2026-08-11 cs.AI 新提交 57%

AquiLLM: An Architecture for Supporting Tacit Knowledge Capture in Research Groups

AquiLLM:支持研究群体中隐性知识捕获的架构

Jack Stark, Srinath Saikrishnan, Vikram Seenivasan, Bernie Boscoe, Andrew Lizarraga, Tuan Do

机构 * Southern Oregon University(南俄勒冈大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 AquiLLM是一款采用开放权重模型的开源模块化RAG-LLM框架,经领域专家反馈优化了架构与功能,可支持研究群体捕获隐性知识,助力AI贴合科研实践。

Comments Accepted for publication in the NGEN-AI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08757 2026-08-11 cs.SD eess.AS 新提交 57%

Steering dense music retrieval with open-vocabulary concept discovery

基于开放词汇概念发现的密集音乐检索控制

Julien Guinot, Alain Riou, Elio Quinton, György Fazekas

专题命中 跨模态检索 :multimodal(abstract);分类 eess.AS

AI总结 本研究提出一种轻量无需训练的开放词汇概念发现方法,用于可控音乐检索,可恢复与概念音频示例对齐更紧密的稀疏特征,实现更优的编辑强度与内容保留权衡。

Comments Accepted to ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05149 2026-08-06 cs.CV 新提交 57%

CoCo-IR: Contextual Composed Image Retrieval

CoCo-IR:上下文组合图像检索

Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding, Madhuri Shanbhogue, Kaifeng Chen, Zhe Li, Mojtaba Seyedhosseini, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind) OpenAI

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对现有图像检索系统无法处理多轮交互的局限,提出CoCo-IR任务,构建基于LMM的模型并开发自主数据引擎,在CIRCO和自建CoCo-IR基准上取得最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04768 2026-08-06 cs.CV 新提交 57%

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03524 2026-08-05 cs.AI 新提交 57%

Dr. AGENTONOMICS: A Didactic Experiment of AGENTONOMICS

Dr. AGENTONOMICS:AGENTONOMICS的教学实验

Fengjunjie Pan, Alois Knoll

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究介绍了AGENTONOMICS框架的首个应用Dr. AGENTONOMICS,将其作为教学智能体,提出其可拓展为多角色系统并探讨其对多中心AI经济的意义。

Comments Technical report, Technical University of Munich

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03150 2026-08-05 cs.AI 新提交 57%

UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval

UniGD:面向工业检索的统一生成-判别框架

Shujie Ji, Yawei Kong, Yilin Zhao, Li Wang, Xialong Liu, Peng Jiang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 UniGD是整合检索与相关性评分的统一框架,通过CAGE、CAM、HAM解决工业检索问题,在快手平台及NQ320K、MS300K数据集上均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03120 2026-08-05 cs.CV 新提交 57%

SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

SeCo-SBIR:用于零样本草图-图像检索的语义一致提示学习

Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu, Tu Minh Phuong

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 SeCo-SBIR是解决CLIP适配ZS-SBIR时域适配与泛化矛盾的语义一致提示学习框架,结合多模态提示、一致性约束与多目标损失,在三类ZS-SBIR基准上达最优性能。

Comments ACMMM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02457 2026-08-04 cs.IR cs.AI 新提交 57%

Syntax Meets Semantics: Understanding Scientific Formulae

语法与语义融合:理解科学公式

Yuni Susanti, Moritz Schubotz

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 本研究针对科学公式语法与语义表征不匹配问题,采用图编码器、文本编码器结合对比学习实现跨模态对齐,显著提升了学术信息检索中的跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01954 2026-08-04 cs.CV 新提交 57%

StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

StyleForge:基于超图场中反事实推理的室内家具风格生成

Lingwei Dang, Shishuo Shang, Pan Liu, Jiajia Cheng, Ziyan Qiu, Zhenhao Zhang, Yufei Zhu, Shenghui Huang, Qingxin Xiao, Yun Hao, Juntong Li, Qingyao Wu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01665 2026-08-04 cs.AI cs.SD 新提交 57%

Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

排序前分配:面向通用大模型(OmniLLMs)的解耦令牌压缩

Zhenghui Guo, Yilin Yang, Yuanbin Man, Miao Yin, Weidong Shi, Rabimba Karanjai, Omprakash Gnawali, Chengming Zhang

机构 * University of Houston(休斯顿大学) The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 针对通用大模型令牌压缩的偏向音频分配问题,提出无需训练的Macer压缩器,先分配音视频预算再按模态排序,降本同时在多基准上保持性能,在OmniVinci-9B上提升达12.9个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01560 2026-08-04 cs.CL cs.SD 新提交 57%

Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding

判别轴,而非数据量:对比语料库能为音频嵌入模型带来什么启示

Abdul Basit Tonmoy

机构 * Eximius Labs(埃克西米厄斯实验室) Wabash College(沃巴什学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 该研究发现对比音频嵌入模型编码的属性由语料库结构而非规模决定,通过调整语料标注多样性可提升情感识别性能,同时平衡关键词检测能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27779 2026-07-31 cs.CV 新提交 57%

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索

Tomer Erez, Moshe Kimhi, Chaim Baskin, Ehud Rivlin

机构 * Technion – Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27766 2026-07-31 cs.CL cs.IR cs.LG 新提交 57%

Gradient-free Task-Conditioned Retrieval for On-Device In-Context Learning

面向设备内上下文学习的无梯度任务条件检索

Xinyu Luo, Hui Liu, Yihua Shao, Junyi Yang, Arindam Basu, Haoliang Li

机构 * City University of Hong Kong(香港城市大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 该研究提出无梯度框架CoRA,实现设备内任务条件检索,无需检索器微调等操作,在多数据集及树莓派5部署中展现有效性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25407 2026-07-29 cs.CV 新提交 57%

ANFI: Rethinking Neighbor Feature Interaction in Person Re-ID

ANFI:重新思考行人重识别中的邻居特征交互

Xulin Li, Yan Lu, Bin Liu, Jiaze Li, Qinhong Yang, Tao Gong, Qi Chu, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 该研究针对行人重识别中基于邻居方法仅依赖亲和关系、受噪声邻居影响的问题,提出ANFI方法,不仅建模亲和关系与差异关系,还用自适应加权,通过新邻域相似度导出差异关系,经噪声关系监督训练,实验证明其在多种设置下的优越性。

Comments accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21057 2026-07-24 cs.CV 新提交 57%

Achieving Text-based Person Retrieval with Any Granularity

实现任意粒度的基于文本的行人检索

Jialong Zuo, Hanyu Zhou, Dongyue Wu, Yongtai Deng, Mengdan Tan, Nong Sang, Changxin Gao, Xiang Bai

机构 * National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院多光谱信息智能处理技术国家重点实验室) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 该研究针对基于文本的行人检索中查询粒度不确定问题提出新范式,构建多粒度数据集和评估基准,提出CMAM框架,通过多种策略实现粒度感知检索,实验证明其性能优于现有方法,为行人检索系统奠定基础。

Comments TPAMI-2026 Accepted Paper

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026, pp. 1-18

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20984 2026-07-24 cs.CV 新提交 57%

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

用于不确定性感知文本到视频检索的分布对齐桥

Kyeongmo Chae, Jihoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆北国立大学电子与电气工程学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 研究文本到视频检索问题,提出分布对齐桥(DAB)框架,将其视为分布对齐任务,通过高斯分布建模考虑不确定性,用受扩散启发的桥和分布感知对比损失优化,在多基准测试中显著优于现有基线并提供校准排名。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20238 2026-07-23 cs.CV 新提交 57%

Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training

并非所有补丁都一样:可见-红外预训练中的采样很重要

Qiwei Ma, Bin Deng, Junjie Zhu, Qiangjuan Huang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li

机构 * Yuelushan Center for Industrial Innovation(岳麓山工业创新中心) Intelligent Game and Decision Lab(智能游戏与决策实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对可见-红外预训练,提出重要性感知采样(IAS)方法,通过从红外结构线索导出权重、学习重要性掩码及采用补丁课程学习策略调整训练重点,在多个VIS-IR基准实验中比基线有改进。

Comments 13 pages, 11 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19830 2026-07-23 cs.CL 新提交 57%

VizRAG: Enhancing Retrieval-Augmented Generation with Hypergraph Visualization

VizRAG:通过超图可视化增强检索增强生成

Yanbin Wei, Yang Chen, Renling Gan, Ziru Liu, Xinyu Fu, Chun Kang, Ning Lu, Rui Liu, Yu Zhang, James Kwok

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究院) Beihang University(北京航空航天大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 研究旨在增强检索增强生成,核心方法是通过视觉线索将超图感知整合到RAG系统中,引入VizRAG支持视觉超图结构感知,实验证明该方法显著优于基线,验证了超图可视化用于RAG系统的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19270 2026-07-22 cs.LG cs.AI 新提交 57%

GUIDED Network-Agnostic Feature Initialization for Spatial Transferability in GNN-based Models

基于GNN的模型中用于空间可迁移性的引导式网络无关特征初始化

Alessandro Scalese, Santhanakrishnan Narayanan, Constantinos Antoniou

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究针对交通分配问题中GNN模型空间泛化差的问题,提出网络无关初始化层GUIDED,通过在虚拟链路注入需求标量属性标准化输入空间。实验表明其能提升模型性能、鲁棒性及参数效率,减少训练时间,为相关空间问题提供通用蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19200 2026-07-22 cs.MM 新提交 57%

Enhancing Relation Modeling with Social Attributes for Social Media Popularity Prediction

利用社交属性增强关系建模以进行社交媒体人气预测

Bolun Zheng, Yuhao Luo, Wei Zhu, Ning Xu, An-An Liu, Lingyu Zhu, Canjin Wang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 针对社交媒体人气预测中检索准确率低的问题,提出关系增强检索增强框架RE-Rag,通过语义属性检索器和关系引导预测器,基于语义内容和社交属性建模UGC相似度,实验证明该方法在预测准确率和检索效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19111 2026-07-22 cs.CV 新提交 57%

GATE-3D: Geometry-Aware Test-time Adaptive Reranking for Open-Set 3D Shape Retrieval

GATE-3D:用于开放集3D形状检索的几何感知测试时自适应重排

Hao Wu, Heyi Lin, Zilin Wang, Huizai Yao, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对开放集3D形状检索中几何与外观特征融合问题,提出GATE-3D轻量级查询自适应重排方法,通过捕捉模态不一致特征预测分数调整排名,实验表明该方法优于外观检索且更稳健,提升了mAP等指标,还发现线性路由在低数据时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19046 2026-07-22 cs.CV 新提交 57%

Contrastive On-Policy Distillation

对比策略蒸馏

Jiacheng Ruan, Jun Tang, Wenzhen Yuan, Ting Liu, Shuai Bai, Dayiheng Liu, Zhibo Yang, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 研究提出对比策略蒸馏框架COPD,通过冻结教师模型在不同指令下对学生状态评分,以对数概率差为优势信号指导更新,减少推理长度,提升效率,且能集成到自蒸馏框架实现自对比监督。

Comments Work in progress. 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18688 2026-07-22 cs.CV 新提交 57%

Dual-Edged Homogeneous-Modality Similarity: Towards Visible-Infrared Modality-Incomplete Person Re-Identification with Modality Adaptive Matching

双边同质模态相似性:迈向具有模态自适应匹配的可见-红外模态不完整行人重识别

Xin Xu, Shuhao Zhan, Wei Liu, Zheng Wang, Kui Jiang, Chia-Wen Lin

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 研究开放世界场景下可见-红外模态不完整行人重识别问题,提出模态自适应匹配Transformer(MAMT),通过散度Transformer模块和共享Transformer模块提取特征,经模态自适应匹配模块动态融合,在新构建基准上实验,证明方法有效且具适应性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18666 2026-07-22 cs.CL cs.SD 新提交 57%

Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

融合嵌入:文本、图像、视频和音频的统一嵌入空间

Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham, Arman Luthra

机构 * Eximius Labs(卓越实验室) Wabash College(瓦贝什学院) Skop Intelligence Co.(斯科普智能公司)

专题命中 跨模态检索 :audio-visual(abstract);分类 cs.CL

AI总结 研究旨在构建文本、图像、视频和音频统一嵌入空间。提出融合嵌入家族,第一代训练参数少的连接器,第二代添加模态门控深度适配器,无需成对视听数据实现音频-图像检索,探索设计空间并公开相关资源。

Comments 23 pages, 5 figures. Models: https://huggingface.co/EximiusLabs/fusion-embedding-1-2b-preview and https://huggingface.co/EximiusLabs/fusion-embedding-2-2b-preview. Code: https://github.com/Eximius-Labs/fusion-embedding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16321 2026-07-21 cs.CV cs.IR 新提交 57%

Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations

超越语义的艺术:用于多关系表示的层状信息对比学习

Ludovica Schaerf, Antonio Purificato, Piera Riccio, Fabrizio Silvestri, Noa Garcia

机构 * University of Zurich(苏黎世大学) Max Planck Institute Bibliotheca Hertziana(马克斯·普朗克赫兹iana图书馆研究所) Sapienza University of Rome(罗马第一大学) Amazon(亚马逊) University of Amsterdam(阿姆斯特丹大学) The University of Osaka(大阪大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对视觉语言模型丢失艺术作品多关系结构的问题,引入受层理论启发的CANVAS框架,通过多嵌入和对比损失学习关系感知多模态表示,在新基准测试中表现优于基线,证明多关系对齐在艺术理解中兼具理论与实践价值。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14256 2026-07-17 cs.AI cs.MA 新提交 57%

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation

基于多级智能数据管理的自动硬示例合成

Genglin Liu, Muye Zhang, Krishnamurthy Viswanathan, Nichole J. Hansen, Blaž Bratanič, Nathan L Clement, Shalini Ghosh, Ariel Fuxman

机构 * UCLA(加州大学洛杉矶分校) Google(谷歌)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究多模态大语言模型在内容安全审核任务中易受攻击的问题,提出自动智能红队框架,利用多智能体架构合成对抗示例,无需人工干预,提高模型鲁棒性,降低公共图像安全基准中的误报率。

Comments 23 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12621 2026-07-15 cs.CV cs.IR 新提交 57%

Towards Vision-Free CIR: Attribute-Augmented Scoring and LLM-Based Reranking for Zero-Shot Composed Image Retrieval

迈向无视觉的合成图像检索:基于属性增强评分和基于大语言模型的重排的零样本合成图像检索

Ryotaro Shimada, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

机构 * The University of Tokyo(东京大学) Kioxia Corporation(铠侠株式会社)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 研究如何让无视觉方法有效处理合成图像检索任务,通过属性增强混合评分和基于大语言模型的重排两项关键技术构建框架,在开放域CIRR数据集实验中优于现有零样本方法,在FashionIQ上凸显语义推理与视觉匹配权衡,消融研究验证技术有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07720 2026-07-13 cs.LG cs.AI 新提交 57%

Omni-Sleep: A Sleep Foundation Model via Hierarchical Contrastive Learning of CNS-ANS Dynamics

全睡眠:一种通过中枢神经系统-自主神经系统动态分层对比学习的睡眠基础模型

Zhoujie Hou, Song Wang, Kexin Lou, Mo Wang, Chen Wei, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) Omni-Intelligence(全知智能) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 介绍全睡眠模型,利用CNS/ANS划分,通过分层对比学习的三个目标进行拓扑约束表示学习,在多中心多模态PSG数据预训练后用于睡眠分期和多疾病分类,性能优于基线,凸显生理层次对睡眠表示学习的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07383 2026-07-09 cs.CV 新提交 57%

MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG

MMAgent-R$^2$:用于智能mRAG的重排与拒绝学习

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Yang, Bing Li, Chunfeng Yuan, Kang Rong, Fengyun Rao, Jing Lyu, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超智能安全重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) PeopleAI Inc.(人智公司) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对KB-VQA中现有mRAG方法在处理视觉相似实体时的不足,提出MMAgent-R$^2$框架,集成视觉重排和主动拒绝机制,设计复合奖励函数,经GRPO训练实现联合优化,实验证明其在多任务中性能达最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏