FiGuRO: Intrinsic Dimension Estimation for Multi-Modal Data
FiGuRO:面向多模态数据的本征维度估计
专题命中 跨模态检索 :multi-modal(title,abstract)
AI总结 本研究提出FiGuRO框架,用于在模型容量与超参数约束下估计单/多模态数据的本征维度,可实现共享与私有信息解耦,性能优于现有技术且可应用于单模态预训练模型。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
FiGuRO:面向多模态数据的本征维度估计
专题命中 跨模态检索 :multi-modal(title,abstract)
AI总结 本研究提出FiGuRO框架,用于在模型容量与超参数约束下估计单/多模态数据的本征维度,可实现共享与私有信息解耦,性能优于现有技术且可应用于单模态预训练模型。
重新思考特定领域的基于文本的图像检索
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 针对现有TBIR基准的单匹配假设无法适配监控等特定领域的问题,构建了SecMM-TBIR基准,提出SAFT框架解决特定领域TBIR的语义压缩问题,在SecMM-TBIR上平均提升mAP@20达7.8点且优化通用领域性能。
Comments 13 pages
用于专利匹配的自知识检索增强生成框架
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL
AI总结 针对专利匹配的LLM方法存在成本高、易遗忘等问题,本文提出自知识RAG框架,结合FAISS检索与生成式匹配机制,在真实专利数据集上提升了检索匹配准确率。
Comments Accepted by IEEE CSCWD 2026
Proteo-R1:用于从头蛋白质设计的推理基础模型
专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI
AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。
Journal ref ICML 2026
HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试
机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) ; Tsinghua University(清华大学) ; Chinese Academy of Sciences(中国科学院) ; University of British Columbia(不列颠哥伦比亚大学) ; Renmin University of China(中国人民大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。
Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)
MRIComp4Flow:用于训练多模态生成模型的三维脑部MRI压缩
机构 * Technical University of Munich (TUM)(慕尼黑工业大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Imperial College London(帝国理工学院) ; Florida State University(佛罗里达州立大学) ; Institute for Advanced Study, TUM (TUM-IAS)(慕尼黑工业大学高等研究院) ; TUM University Hospital(慕尼黑工业大学医院)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究针对大规模多模态MRI的存储与I/O问题,采用JPEG2000或JPEG-LS压缩三维脑肿瘤MRI,在20:1压缩率下训练Wavelet Flow Matching模型,证实其合成质量与未压缩数据训练的模型相当,为可扩展三维MRI生成建模提供了实用方案。
Comments Accepted: MICCAI 2026 SASHIMI workshop
LaViT:对齐潜在视觉思维以进行多模态推理
机构 * City University of Hong Kong(香港城市大学) ; University of Science and Technology of China(中国科学技术大学) ; Utrecht University(乌特勒支大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 LaViT通过对齐潜在视觉思维提升多模态推理能力,实现视觉感知增强和模型性能突破。
TimeRoute:面向多模态推荐的时间感知模态路由与扩散模型
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI
AI总结 TimeRoute通过时间感知模态路由器和带FiLM的双流去噪扩散图重构器,解决多模态推荐的模态时间尺度不匹配问题,在三个公开数据集上提升了推荐指标。
机构 * Department of Computer Science University of Iowa(计算机科学系 印第安纳大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
Comments 22 pages, 14 figures, 7 tables
Journal ref International Conference on Learning Representations (ICLR), 2026
面向临床增强型医疗报告生成的语言对齐与视觉 grounded 的偏好优化
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对现有医疗报告生成方法的临床事实错误与视觉-语言对齐不足问题,提出DPO-Clin框架,通过ECD模块、M²DPO及反事实偏好数据构建提升模型可靠性,在多医学数据集上取得优异性能。
Comments Accepted by ECCV 2026
FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Michigan State University(密歇根州立大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。
Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures
DreamOmni3:基于涂鸦的编辑与生成
机构 * CUHK(香港中文大学) ; ByteDance Inc(字节跳动公司) ; HKUST(香港科技大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 DreamOmni3通过结合文本、图像和自由手绘涂鸦,实现更灵活的图形用户界面编辑与生成,解决了复杂编辑任务中的数据创建和框架设计问题。
Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)
专题命中 多模态生成 :MLLM(abstract_cn)
AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。
InterPruner:面向多模态目标检测的、基于泰勒隐式准则与语言先验调制器的交互式结构化剪枝框架
机构 * Beijing University of Technology(北京工业大学) ; Southwest University(西南大学) ; China University of Geosciences Wuhan(中国地质大学(武汉)) ; Tsinghua University(清华大学) ; Beijing Institute of Technology(北京理工大学) ; Yunnan Normal University(云南师范大学) ; Beijing Forestry University(北京林业大学) ; Ghent University(根特大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出首个面向红外-可见光目标检测器的交互式结构化通道剪枝框架InterPruner,结合TIC、MIRA、SPCA方法,在FLIR数据集剪枝50%通道时mAP提升0.6%,代码将发布于GitHub。
复杂城市场景中基于证据的可信多模态推理与评估基准
机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) ; Tencent CDG(腾讯云与智慧产业事业群) ; Institute of Information Engineering, CAS(中国科学院信息工程研究所)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。
Comments Accepted by IJCV
Checkup2Action:面向患者行动的多模态临床检查报告数据集
机构 * Durham University(杜伦大学) ; University of Oxford(牛津大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。
PRMU:面向多模态大语言模型中以人为中心的知识遗忘的无语料基准
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 针对现有多模态大语言模型(MLLMs)遗忘方法依赖语料的局限,提出无语料基准PRMU及基线SGPE,实验显示SGPE在目标遗忘、局部性保留等方面权衡更优。
E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。
缓解严重跨模态错位:通过显式特征域仿射配准实现端到端可见光-红外目标检测
机构 * Beijing University of Technology(北京工业大学) ; Central South University(中南大学) ; Beijing Electronics Science & Technology Institute(北京电子科学技术研究所) ; China Aerospace Science & Industry Corporation(中国航天科技集团) ; Beijing Institute of Technology(北京理工大学) ; Information Support Force Engineering University(信息支援部队工程大学) ; Trunk Technology (Beijing) Co., Ltd.(trunk技术(北京)有限公司)
专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV
AI总结 针对可见光-红外目标检测的严重跨模态错位问题,提出JFRDet网络,含CMAA、IGCF、AQCG模块,构建DVMA基准,在该基准上达到69.7% mAP₅₀的SOTA性能。
StructReward:用于自修正多模态推理的高效结构化过程奖励
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。
Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally
跨模态拓扑从稀疏电压快照解码电池故障
专题命中 多模态评测 :cross-modal(title,abstract)
AI总结 本研究针对EV电池安全瓶颈,提出跨模态诊断框架DeFault,通过将电压序列展开为相空间拓扑解码故障,在99辆EV的1640万条数据上对四种故障类型平均准确率达0.96,无需新增传感器即可实现高可解释性故障诊断。
Comments 33 pages, 12 figures
多模态质量与扩展自旋分布的原初黑洞蒸发:对有效相对论粒子数的宇宙学印记
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 该研究构建FRISHBEE代码实现多模态质量函数与扩展自旋分布,计算原初黑洞蒸发对有效相对论粒子数$\Delta N_{\rm eff}$的影响,发现质量分布和自旋会改变$\Delta N_{\rm eff}$,其可作为原初黑洞形成通道的判别依据。
PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准
机构 * Jilin University(吉林大学) ; National Taiwan University(国立台湾大学)
专题命中 多模态评测 :multimodal(abstract,comments);分类 cs.CV、cs.AI
AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。
Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)
CARE:用于可靠医学视觉问答的置信感知推理
机构 * Ant Group(蚂蚁集团) ; University of Michigan(密歇根大学) ; City University of Hong Kong(香港城市大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对医学多模态大语言模型的置信度校准问题,提出CARE框架,通过双阶段流程优化准确率与校准度,在三个医学VQA基准上取得最优性能,为临床决策支持提供可信基础。
Comments Accepted by MICCAI 2026
ECHO:具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手ECHO,其核心聊天机器人、安全层、语音评估模块均达特定性能指标,且可在消费级硬件运行,符合数据保护法规。
Comments 5 pages
科学实验场景建模:数据集与模型
机构 * College of Computer Science and Engineering, Shandong University of Science and Technology(山东科技大学计算机科学与工程学院) ; School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) ; ABC FINTECH Company Limited(ABC金融科技有限公司) ; NOVA Information Management School, Universidade Nova de Lisboa(里斯本新大学NOVA信息管理学院) ; School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
AI总结 针对现有SGG基准忽略科学实验场景的问题,构建首个物理实验场景SGG数据集PhysScene,并提出跨模态双路径生成器CM-DPG,在PhysScene和VG150上取得具竞争力的SGG性能。
Comments The authors have identified issues that require substantial revision and have therefore decided to withdraw the current version
LLM推理的周期表:推理范式、方法与失败模式的结构化综述
机构 * Singapore Institute of Technology(新加坡理工大学) ; Nvidia AI Center (SNAIC)(英伟达人工智能中心(SNAIC)) ; MIDAS Lab, IIIT Delhi(IIIT德里MIDAS实验室) ; MIDAS Lab, IIT Mandi(IIT曼迪MIDAS实验室) ; Owl Autonomous Imaging, Inc.(Owl自主成像公司) ; College of Computing & Data Science, NTU Singapore(新加坡南洋理工大学计算与数据科学学院) ; NVIDIA AI Technology Centre, Singapore(英伟达新加坡人工智能技术中心) ; Department of Computer Science and Engineering, IIT Kanpur(IIT坎普尔计算机科学与工程系)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 本文系统综述了300多篇论文,提出LLM推理研究的结构化分类法,涵盖多种推理范式,分析方法论趋势,并总结常见限制与失败模式,旨在为开发更鲁棒、可解释和可泛化的推理系统提供参考。
微服务系统的异常检测与根因分析
机构 * Viet Nam National University Ho Chi Minh City - University of Technology (HCMUT)(越南国家大学胡志明城-技术大学(HCMUT)) ; School of Computing Technologies(计算技术学院) ; College of Science, Technology, Engineering and Maths(科学、技术、工程和数学学院) ; Royal Melbourne Institute of Technology (RMIT University)(皇家墨尔本理工学院(RMIT大学))
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 针对微服务系统异常检测与根因分析的五大局限性,提出端到端方法BARO、EventADL和TORAI,并构建基准RCAEval,通过实验验证有效性与鲁棒性。
Comments This is the pre-print of my PhD thesis, submitted to RMIT University
情境图预测:用户建模的结构化视角推断
机构 * Flybits Labs, Creative AI Hub(Flybits实验室、创意人工智能中心) ; University of Toronto(多伦多大学) ; Toronto Metropolitan University(多伦多 Metropolitan 大学) ; MIT Media Lab(MIT媒体实验室)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 情境图预测通过结构化视角推断提升用户建模能力,揭示潜在状态推断比表层提取更困难。
Comments Accepted to PILA 2026: Workshop on Personal Intelligence in the Agentic AI Era, at KDD 2026, 5 pages
切换时机的判定:生成对抗网络自适应极小极大训练的E-过程
专题命中 多模态评测 :multimodal(abstract)
AI总结 本研究将GAN训练的切换时机判定转化为序列假设检验问题,提出基于E-过程的自适应训练流程,在多模态合成分布与图像数据集上表现优于或匹配最优固定比例基线。