Is the Red Square Big? MALeViC: Modeling Adjectives Leveraging Visual Contexts
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at EMNLP-IJCNLP 2019
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at EMNLP-IJCNLP 2019
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 15 pages, 10 figures. To appear in IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2018
专题命中 其他多模态 :multimodal(abstract);multi-modal(abstract)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM
Comments 10 pages, in submission
体育领域的大模型综述
机构 * Renmin University of China(中国人民大学) ; Sichuan University(四川大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 该文综述体育领域大模型的任务应用、数据集基准,分析挑战与未来方向,为大模型驱动的体育智能研究与发展提供基础。
Comments 36 pages, 4 figures, 6 tables. Accepted to Findings of ACL 2026
解析仇恨表情包:预设语境与虚假主张
机构 * Syracuse University(Syracuse大学)
专题命中 其他多模态 :cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 本文针对仇恨表情包检测中忽略仇恨本质的问题,提出含PCM与FACT模块的SHIELD框架,实验显示其检测性能优于现有最优方法,且可用于假新闻检测等任务。
Comments Accepted to SDM 2026
用于青光眼检测的平衡软专家混合模型
机构 * University of Louisiana at Lafayette(路易斯安那大学拉斐特分校) ; School of Computing and Informatics(计算与信息学院)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对青光眼检测,提出含三个专家及负载平衡损失的平衡软专家混合模型,解决多模态学习问题,其性能通过AUC衡量,超越多种基线和模型,还可推广至其他疾病检测。
Comments 18 pages, 5 figures
GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) ; University of Science and Technology Beijing(北京科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。
Comments Accepted by ACM MM 2026
在注意力流形中分离语义注意力与结构偏差
机构 * Fudan University(复旦大学) ; Singapore Management University(新加坡管理大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究多模态大语言模型中注意力机制对无信息视觉 tokens 关注过多的问题,提出无需训练的 SPAR 方法,通过净化噪声和重分配注意力,有效恢复真实视觉基础且计算开销小。
MOSS 语音转录与说话人识别技术报告
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、eess.AS
AI总结 MOSS转录与识别通过端到端多模态大语言模型,实现了说话人属性化和时间戳化的转录,解决了现有系统在上下文窗口、长距离说话人记忆和时间戳输出方面的不足。
使用以主题和参与者为中心的分解方法进行具有情感动态的对话摘要
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对对话摘要问题,提出基于改进分层智能体链方法的框架,从主题和参与者两个视角分解对话,结合自动推断情感生成摘要,并引入情感轨迹指标评估,实验表明其框架能生成含语义和情感内容的摘要,凸显方法有效性。
为随机梯度MCMC学习探索
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种元学习策略,使SGMCMC能够高效探索多模态后验分布,提升采样效率并优于传统SGMCMC方法。
Journal ref Proceedings of the 41st International Conference on Machine Learning, Proceedings of Machine Learning Research 235:24015-24039, 2024
通用算法隐式学习
专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对当前元学习方法局限性,引入理论框架定义实际通用性及算法显隐式学习。提出基于Transformer的TAIL算法,有随机投影等创新,在少样本基准测试中性能领先,能推广到未见领域和模态,处理更多类别任务且节省计算成本。
Comments Accepted at ICML 2026
利用街景图像和视觉大语言模型预测遗产价值以支持治理:风险、伦理与政策影响
机构 * RISE Research Institutes of Sweden AB(瑞典RISE研究机构) ; Malmö University(马尔默大学) ; Forschungszentrum Jülich GmbH(朱利奇研究中心) ; Uppsala University(乌普萨拉大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究利用街景图像和视觉大语言模型评估瑞典建筑遗产价值,以支持建筑翻新计划的制定,探讨了方法中的问题、潜在改进以及使用LLM数据的伦理风险。
Doc-CoB:通过视觉链式框推理增强文档理解
机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知与智能系统重点实验室,浙江大学) ; Alibaba Group(阿里巴巴集团) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出Doc-CoB框架,通过粗到细的布局感知视觉推理,结合多模态大语言模型,逐步聚焦查询相关布局区域,提升文档理解性能。
动态模型合并的轻量级方法
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出DiDi-Merging方法,通过可微分的秩分配平衡共享和专家参数,实现更高效的动态模型合并,在参数量上显著优于现有方法。
轨迹感知的自适应推理在目标检测模型中
机构 * Department of Electrical and Computer Engineering, National Technical University of Athens, Greece(电子与计算机工程系,国家技术大学亚历山大学院,希腊) ; Department of Product and Systems Design Engineering, University of the Aegean, Syros, Greece(产品与系统设计工程系,爱琴海大学,西罗斯,希腊)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出利用GPS轨迹数据优化目标检测模型的推理过程,通过引入早退机制减少计算成本,提升实时感知效率。
Comments Accepted to the MuseKDE workshop of the IEEE MDM 2026 conference
通过意图欺骗突破前沿基础模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种多轮欺骗方法,通过模拟良性意图和模型一致性,引导模型生成有害输出,并揭示了未被注意到的para-jailbreaking漏洞。
Comments Accepted at CVPR 2026 Findings Track
变分视觉问答用于不确定性感知的选择性预测
机构 * TU Darmstadt(图宾根大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出变分VQA方法,通过变分贝叶斯方法提升视觉问答和视觉推理任务的可靠性,尤其在低误差容忍度下表现优异,且优于AdamW训练模型。
Comments TMLR April 2026 version. 13 pages main paper, 31 pages with appendix. Updated bibliography
Journal ref Transactions on Machine Learning Research (2026)
多模态思维模型中的实时视觉归因流
机构 * Seil Kang ; Woojung Han ; Junhyeok Kim ; Jinyeong Kim ; Youngeun Kim ; Seong Jae Hwang
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种用于多模态思维模型实时视觉归因流的近似框架,通过学习从注意力特征中直接估计语义区域的因果效应,实现轻量级学习而非暴力计算的高保真归因。
FineSteer: 一种用于大语言模型推理时细粒度引导的统一框架
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出FineSteer框架,通过条件引导和细粒度向量合成两个阶段实现高效引导,保留模型效用并提升引导效果,实验显示其在安全性和真实性基准上表现优异。
Comments Accepted by ACL 2026 (Main)
在多模态大语言模型中实现模态专精以在缺失模态下实现鲁棒的虚假新闻检测
机构 * Soochow University(苏州大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; The Hong Kong University of Science and Technology(香港科技大学) ; FiT, Tencent(腾讯FiT) ; Alibaba Group(阿里巴巴集团) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; School of Education, Zhejiang Normal University(浙江师范大学教育学院)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出在多模态大语言模型中通过头级专精机制提升鲁棒性,以应对缺失模态下的虚假新闻检测,通过保留模态专精能力与利用稀疏单模注释提升检测性能。
Squeeze Evolve:无验证者演化的统一多模型协调
机构 * UC Berkeley(加州大学伯克利分校) ; UT Austin(德克萨斯大学奥斯汀分校) ; Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学) ; Together AI
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Squeeze Evolve框架,通过动态分配模型能力提升无验证者演化的多样性与效率,实验证明其在多个基准测试中显著降低成本并提升性能。
Comments 40 Pages, Project Page: https://squeeze-evolve.github.io/
RayMamba:基于射线对齐的长距离3D目标检测串行化
机构 * School of Computer Science and Technology, Nanjing University of Science and Technology(南京理工大学计算机科学与技术学院)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 RayMamba通过射线对齐策略优化稀疏场景下的3D目标检测,提升远距离场景的上下文建模效率,实现mAP和NDS的显著提升。
面向小规模MLLMs的漫画中忠实推理方法
机构 * Duke Kunshan University(昆山杜克大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种两阶段框架,通过MoCoT和VERA提升小规模MLLMs在漫画理解中的推理忠实性,实验表明在4B参数范围内表现优异,优于7B基线,提升四个小模型12.1%。
REN:基于解剖学的专家混合模型用于间质性肺病诊断
机构 * Department of Computer Science, Northwestern University McCormick School of Engineering and Applied Science(西北大学麦考密克工程与应用科学学院计算机科学系) ; Division of Pulmonary and Critical Care Medicine, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院肺与危重症医学科) ; Division of Rheumatology, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院风湿病科) ; Simpson Querrey Lung Institute for Translational Science, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院辛普森·奎雷转化科学肺研究所) ; Department of Electrical and Computer Engineering, Northwestern University McCormick School of Engineering and Applied Science(西北大学麦考密克工程与应用科学学院电气与计算机工程系) ; Machine & Hybrid Intelligence Lab, Department of Radiology, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院放射科机器与混合智能实验室)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出REN模型,通过解剖学指导的专家混合框架提升间质性肺病诊断性能,结合多模态门控机制和深度学习特征,实现更精确的病理变化建模。
Comments 13 pages, 4 figures, 5 tables
超越静态视觉标记:结构化的顺序视觉推理
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出结构化顺序视觉推理方法,通过构建视觉重要性图谱并按判别顺序进行推理,提升多模态模型的视觉认知能力。
在多媒体场景中,有害视觉内容操纵对虚假信息检测的重要性
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学高级技术学院)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、cs.MM
AI总结 本文提出一种新颖的多模态虚假信息检测方法,通过捕捉视觉内容操纵特征和意图特征,提升虚假信息检测性能。
人工智能时代的人机交互、探索与可视化:挑战与机遇
机构 * Northeastern Univ., USA(东北大学) ; Ohio State Univ., USA(俄亥俄州立大学) ; Columbia Univ., USA(哥伦比亚大学) ; Athena RC, Greece(雅典娜研究组) ; Tsinghua Univ., China(清华大学) ; Xi’an Jiaotong-Liverpool Univ., China(西安交通大学利物浦大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、cs.MM
AI总结 本文探讨人工智能发展带来的挑战,分析用户与数据互动的新方式,并提出构建以人为中心的AI系统的新方向。
FERRET:扩展依赖的红队框架
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 FERRET框架通过多方面的扩展机制,提升多模态对抗对话的有效性和效率,优于现有红队方法。