Group Affect Prediction Using Multimodal Distributions
专题命中 多模态评测 :multimodal(title);分类 cs.CV
Comments This research paper has been accepted at Workshop on Computer Vision for Active and Assisted Living, WACV 2018
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态评测 :multimodal(title);分类 cs.CV
Comments This research paper has been accepted at Workshop on Computer Vision for Active and Assisted Living, WACV 2018
专题命中 多模态评测 :multimodal(title);分类 cs.CV
Comments Asian Conference on Computer Vision (ACCV16), Nov 2016, Taipei, Taiwan
专题命中 多模态评测 :cross-modal(title);分类 cs.CV
Comments This is the extended version (invited IJCV submission) with new results of our previous submission (arXiv:1507.02879)
专题命中 多模态评测 :multimodal(title);分类 cs.CV
Comments Final version submitted to IROS'2015, results unchanged, reformulation of some text passages in abstract and introduction
专题命中 多模态评测 :multi-modal(title);分类 cs.CV
专题命中 多模态评测 :multimodal(title);分类 cs.CV
Comments This paper has been withdrawn by the author due to publication
专题命中 多模态评测 :multimodal(title);分类 cs.CV
Comments 8 pages, double column
专题命中 多模态评测 :multimodal(title,journal_ref)
Comments 14 pages Journal paper 14 figures 3 tables
Journal ref Khavas ZR, Asl BM. Robust heartbeat detection using multimodal recordings and ECG quality assessment with signal amplitudes dispersion. Computer methods and programs in biomedicine. 2018 Sep 1;163:169-82
并非真正的多语言:脚本一致性作为VLM评估中缺失的维度
机构 * RediMinds Inc.(RediMinds公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Independent Researcher(独立研究员)
专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。
FedCoRe:医疗联邦学习中针对缺失模态的目标自适应补全方法
机构 * NVIDIA(英伟达)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对医疗联邦学习中客户端存在缺失模态的问题,提出FedCoRe框架,通过学习表示或对数空间修正,在呼吸恶化任务中恢复了ECG和CXR缺失导致的部分性能损失。
Comments Accepted to the 7th Workshop on Distributed, Collaborative & Federated Learning, DeCaF 2026, MICCAI, Strasbourg, France
RISE:跨三维跟踪与结构化视觉-语言推理的路边基础设施序列理解
专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本研究提出RISE框架,结合仅图像的三维跟踪方法与结构化视觉-语言推理,构建含33910个问答对的RISE-VQA数据集,通过RISE-Bench评估任务,揭示相关挑战并验证域自适应与时间上下文的益处。
我们能否防御AI生成视频对现实世界危机事件的攻击?对检测器、生成器及社交传播的系统性评估
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 本研究推出RA-Bench基准,系统评估AI生成视频检测器、生成器及社交传播特性,发现现有检测器泛化性差、难以检测逼真生成视频,需鲁棒检测器。
Comments 63 pages, 20 figures, 32 tables
LakeQuest:用于跨数据湖的有基础问答的三领域基准测试
机构 * University of Waterloo(滑铁卢大学)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 介绍LakeQuest基准测试,用于评估跨数据湖的有基础问答。它跨越三个领域,含9846个QA对及证据指针,能暴露系统故障模式。通过基线评估发现高质量检索不能保证正确推理,凸显未来智能QA系统需强大发现和跨文件组合机制。
Comments 24 pages, 4 figures, 18 tables. Accepted at the Conference on Language Modeling (COLM) 2026
非小细胞肺癌组织学的虚拟扫描:探究合成PET的判别能力
机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) ; Umeå University(于默奥大学) ; Università Vita-Salute San Raffaele(圣拉斐尔生命健康大学)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对NSCLC组织学分类问题,提出用3D Pix2Pix GAN合成PET特征并结合MINT框架的多模态方法,在714人数据集上使AUC和GMean显著提升,为无实体PET的临床场景提供特征增强策略。
OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准
专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CL、cs.AI
AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。
SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分
专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。
DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试
机构 * Louisiana State University(路易斯安那州立大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。
Comments CVPR 2026 Findings accepted paper
MatPhaseBench:用于材料相图理解的语义引导基准测试
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Manchester(曼彻斯特大学) ; Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所) ; China University of Geosciences(中国地质大学)
专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 介绍用于材料相图理解的MatPhaseBench基准测试,从文献选图与文字构建,有复杂科学图像理解、图文全面对齐、高质量人工监督文本采集三个关键特性,实验显示当前VLM距专家理解有差距。
TriViewBench: 多视图结构推理中受控复杂度缩放
机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。
Comments 26 pages, 8 figures
ProductConsistency:通过SFT和RL改进基于指令的图像编辑中的产品身份保持
机构 * Fractal Analytics
专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 针对基于指令的图像编辑中产品特征保持不足的问题,提出ProductConsistency数据集和循环一致性奖励,结合监督微调与强化学习,显著提升产品一致性、文本渲染和视觉质量。
Comments CVPR HiGen 2026
语义路由器:通过单一对抗扰动劫持多模态大语言模型的可行性研究
机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) ; School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出语义感知通用扰动(SAUP),作为语义路由器同时劫持多个无状态决策,通过理论分析和SORT优化策略实现,在Qwen上对五个目标达到66%攻击成功率。
Comments Accepted to ICML 2026
ATN3D:面向极端稀疏性的密度感知激光雷达-雷达早期3D目标检测
机构 * University of California, Berkeley(加州大学伯克利分校) ; Tsinghua University(清华大学)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对远距离稀疏感知下早期融合丢失信息、通道监督不均衡的问题,提出ATN3D框架,通过密度感知融合、占用门控邻域聚合、证据条件通道自注意力和距离感知损失,在VoD数据集上显著提升远距离检测性能。
FieldWorkArena:面向真实作业任务的代理AI基准测试
机构 * Fujitsu Limited(富士通株式会社) ; Fujitsu Research of America(富士通美国研究部) ; Carnegie Mellon University(卡内基梅隆大学) ; Master’s Student, The University of Tokyo(东京大学硕士研究生) ; Agent Research Collective(代理研究集体)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出FieldWorkArena,用于评估代理AI在真实制造业和零售环境中的性能,通过现场采集的数据和实地访谈设计任务,验证多模态大语言模型的评估可行性。
Comments 27 pages, 10 figures, 7 tables [ICPR 2026 Accepted] Changes from previous version: added supplemental material
笛卡尔捷径:在极坐标空间中重新评估视觉推理
机构 * Stanford University(斯坦福大学) ; Google Research(谷歌研究院)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 针对多模态大语言模型在视觉推理中利用笛卡尔坐标捷径的问题,提出Polaris-Bench基准,将任务转换至极坐标空间,揭示模型缺乏拓扑不变性视觉推理。
Flame3D: 无需3D特定训练的3D场景零样本组合推理
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 Flame3D通过可组合的空间工具和训练自由框架,实现3D场景的零样本组合推理,支持动态空间合成和外部数据整合,展示了在ScanQA和Compose3D上的竞争力。
PulseLM:PPG-文本学习的基础数据集和基准
机构 * Singapore Management University(新加坡管理大学) ; Queen Mary University of London(伦敦玛丽女王大学) ; Eindhoven University of Technology(埃因霍温理工大学) ; University of Cambridge(剑桥大学)
专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI
AI总结 PulseLM通过统一的问答框架连接原始PPG波形与自然语言,包含100万标准化PPG片段及250万问题-答案对,为研究语言基础生理推断和多模态模型基准提供标准化基础。
Comments PulseLM v2
双重因果推断:整合后门调整与工具变量学习用于医疗视觉问答
机构 * School of Microelectronics, Tianjin University(天津大学微电子学院) ; Department of Orthopedics, Affiliated Kunshan Hospital of Jiangsu University(江苏大学附属昆山医院骨科部) ; Department of Clinical Laboratory, The Third Central Hospital of Tianjin(天津第三中心医院临床实验室) ; School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出双重因果推断框架,通过整合后门调整和工具变量学习,解决医疗视觉问答中多模态数据中的内在偏见问题,提升模型的诊断推理可靠性。
GTPBD-MM:一种具有多模态的全球梯田地块和边界数据集
机构 * Sun Yat-sen University(中山大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; China Agricultural University(中国农业大学) ; Southwest Jiaotong University(西南交通大学) ; Northeastern University(东北大学) ; National Supercomputing Center in Shenzhen(深圳国家超算中心)
专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM
AI总结 本文提出GTPBD-MM数据集,用于复杂梯田地块提取,结合高分辨率影像、文本描述和DEM数据,提出ETTerra模型,通过文本和地形信息提升提取精度。
Comments 15 pages, 11 figures. Submitted to ACM Multimedia 2026 Dataset Track
他们所见,而不仅仅是他们看的地方:通过VLMs和NLP度量的语义扫视路径相似性
机构 * Northwestern University(西北大学) ; Radiology, Northwestern University(西北大学放射学系)
专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL
AI总结 本文提出一种整合视觉语言模型的语义扫视路径相似性框架,通过控制视觉上下文生成文本描述,利用NLP度量计算语义相似性,揭示空间差异下的内容一致性。
Comments Accepted at ETRA 2026 GenAI workshop
超越表面伪影:跨模态捕捉共享的潜在伪造知识
机构 * The University of Sydney(悉尼大学) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; National University of Singapore(新加坡国立大学)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种跨模态伪造检测框架MAF,通过解耦模态特定风格,提取跨模态的潜在伪造知识,并定义了两个维度评估模型泛化能力,推动多模态防伪技术发展。