EVA: Towards a universal model of the immune system
EVA:朝着免疫系统通用模型迈进
专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 EVA是首个跨物种多模态免疫学基础模型,通过整合转录组和组织学数据,提升免疫疾病研究的转化应用能力。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
EVA:朝着免疫系统通用模型迈进
专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 EVA是首个跨物种多模态免疫学基础模型,通过整合转录组和组织学数据,提升免疫疾病研究的转化应用能力。
Singpath-VL 技术报告
机构 * LBP Singpath AI Lab(LBP Singpath人工智能实验室)
专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
AI总结 Singpath-VL通过合成数据集和多阶段微调,提升宫颈细胞学中的细粒度形态感知与诊断分类能力。
秩序从混沌:从 glitchy 游戏视频中理解物理世界
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Peking University(北京大学) ; University of Toronto(多伦多大学) ; Sun Yat-sen University(孙中山大学)
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
AI总结 本文提出 PhysGame 数据集和 GameBench 基准,通过利用游戏视频中的 glitch 异常,提升物理推理能力,实验显示在多个基准上取得显著提升。
Comments Accepted by TMLR
城市真实环境中的导航:探索从大规模知识中涌现的导航
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出稀疏关联视觉导航任务,通过CityNav基准评估MLLMs在真实城市环境中的导航能力,并提出VoP方法提升导航性能。
Comments Accepted at EACL 2026 (ORAL)
SOMA-1M: 一种大规模SAR-光学多分辨率对齐数据集用于多任务遥感
机构 * School of Remote Sensing Information Engineering, Wuhan University(遥感信息工程学院,武汉大学) ; Hubei LuoJia Laboratory(湖北珞珈实验室) ; Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, Ministry of Natural Resources(粤港澳大湾区自然资源数据协同应用技术创新中心,自然资源部)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 SOMA-1M是首个大规模SAR-光学多分辨率对齐数据集,用于提升多任务遥感图像处理的性能和准确性。
MedAD-R1: 通过一致性强化策略优化实现可解释医学异常检测中的一致推理
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) ; Zhejiang Expressway Co., Ltd.(浙江高速公路有限公司) ; School of Science and Engineering, Chinese University of Hong Kong(香港中文大学科学与工程学院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
AI总结 MedAD-R1通过一致性强化策略优化实现医学异常检测中的可解释推理,提升模型的可信度和可解释性。
Comments 9 pages, 4 figures
头感知视觉裁剪:通过注意力引导的子图像增强细粒度VQA
机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 通过注意力引导的子图像增强细粒度VQA,提出无需训练的HAVC方法,利用优化的注意力头提升视觉定位精度。
Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)
PixFoundation: 我们在像素级视觉基础模型的方向正确吗?
专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
AI总结 PixFoundation提出新的基准测试,揭示像素级基础模型在视觉问答中的不足,并提出可解释性工具分析接地机制。
Comments Under Review
LiViBench:面向交互式直播视频理解的多模态基准测试
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 LiViBench是首个面向交互式直播视频的多模态基准测试,通过定制化两阶段指令微调和视频到评论检索模块,提升模型对直播视频的理解能力,并在多个基准测试中取得优异成绩。
Comments AAAI 2026 Main Track
Enginuity:构建一个复杂的工程图多领域开放数据集
机构 * Oak Ridge National Laboratory(奥克伍德国家实验室)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 Enginuity是一个开放的多领域工程图数据集,旨在通过结构注释帮助AI处理工程图解析和科学发现。
Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Ai4 Science
MLLMs是否看到我们看到的?分析AI系统中可视化素养障碍
机构 * University of Toronto(多伦多大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.AI
AI总结 本研究分析了MLLMs在可视化素养中的障碍,揭示了两种机器特定的障碍,并展示了模型在复杂可视化任务上的表现差异。
DoPE: 伪装导向扰动封装用于学术诚信的人可读AI敌对文档
机构 * Arizona State University(亚利桑那州立大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL
AI总结 DoPE通过在考试文档中嵌入语义伪装,利用MLLM pipelines的渲染-解析差异,实现对AI自动解决的预防和检测,提升学术诚信保障。
通过定量和定性指标评估自我纠正的视觉代理
机构 * The Thørväld Group(Thørväld集团) ; Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) ; Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) ; Tsinghua University(清华大学) ; Palmer Research Laboratories(帕勒姆研究实验室) ; The Kumquat Consortium(昆夸特联盟)
专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。
UVE: MLLMs是否能作为AI生成视频的统一评估器?
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ; ByteDance Seed(字节跳动种子) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文探讨使用多模态大语言模型作为AI生成视频的统一评估器的可行性,并通过UVE-Bench基准测试评估了18种MLLMs的性能。
推动自适应多阶段视频异常推理:一个基准数据集和方法
机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) ; Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。
激励MLLMs实现类似心内科医生的推理以实现可解释的超声心动图诊断
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出CRT和CardiacMind,通过引入心内科医生的思维模式,提升MLLMs在超声心动图诊断中的推理能力,实现48%的诊断性能提升。
LangHOPS: 语言引导的层次开放词汇部件分割
机构 * INSAIT ; Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧里迪斯基") ; ETH Zurich(苏黎世联邦理工学院) ; TU Munich(慕尼黑技术大学) ; Toyota Motor Europe(丰田欧洲公司)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 LangHOPS通过多模态大语言模型实现开放词汇物体-部件实例分割,取得领域内和跨数据集的优异性能。
Comments 10 pages, 5 figures, 14 tables, Neurips 2025
对人类图像伪造的总体方法
机构 * Michigan State University(密歇根州立大学)
专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
AI总结 HuForDet通过双分支架构,结合异构专家和多模态大语言模型,实现了对人类图像伪造的全面检测,提升了对各类伪造的检测性能和鲁棒性。
Comments 6 figures, 5 tables
基于儿童自体输入的建模 grounded 词学习的鲁棒性研究
机构 * Center for Data Science, New York University(纽约大学数据科学中心) ; Department of Psychology, New York University(纽约大学心理学系)
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CL
AI总结 本文通过分析儿童自体输入数据,验证了多模态神经网络在 grounded 词学习中的鲁棒性,并揭示了不同儿童经验对学习模式的影响。
TopoBDA: 向贝塞尔可变形注意力迈进:道路拓扑理解
机构 * Graduate School of Informatics, Middle East Technical University(信息学院,中东部技术大学) ; Togg/Trutek AI Team(Togg/Trutek人工智能团队)
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
AI总结 TopoBDA通过贝塞尔可变形注意力提升道路拓扑理解,结合多模态数据增强性能。
Comments Project page: https://artest08.github.io/TopoBDA.github.io/
Journal ref Neurocomputing, Vol. 670, 132360 (2026)
DermoGPT: 开放权重和开放数据用于基于形态的皮肤病学推理大语言模型
机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) ; Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL
AI总结 DermoGPT通过开放权重和数据提升皮肤病学推理的MLLM性能,实现与专家诊断流程的一致性。
DST-Calib: 一种双路径、自监督、无目标的激光雷达-摄像头外参校准网络
机构 * Department of Control Science & Engineering, the College of Electronics & Information Engineering, Tongji University(控制科学与工程系,电子与信息工程学院,同济大学) ; Department of Mechanical Engineering, the School of Mechanical Engineering, Tongji University(机械工程系,机械工程学院,同济大学) ; School of Robotics, Hunan University(机器人学院,湖南大学) ; College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科学技术大学) ; Department of Control Science & Engineering, the College of Electronics & Information Engineering, Shanghai Research Institute for Intelligent Autonomous Systems, the State Key Laboratory of Intelligent Autonomous Systems, and Frontiers Science Center for Intelligent Autonomous Systems, Tongji University(控制科学与工程系,电子与信息工程学院,上海智能自主系统研究院,智能自主系统国家重点实验室,智能自主系统前沿科学中心,同济大学) ; National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学)
专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 DST-Calib通过双路径自监督方法,无需目标实现激光雷达与摄像头的高效外参校准,提升泛化能力。
通过合成数据对齐时间序列,利用大语言模型进行增强的理解与推理
机构 * Tsinghua University(清华大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.AI
AI总结 ChatTS通过合成数据生成方法,首次实现了多变量时间序列的多模态大语言模型,显著提升了时间序列的理解与推理性能。
Comments accepted by VLDB' 25
RoadSceneVQA: 用于智能交通系统 roadside 系统的视觉问答基准测试
专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
AI总结 RoadSceneVQA 通过大规模标注数据和 CogniAnchor 融合模块,提升多模态大语言模型在交通感知与推理任务中的性能。
Comments 10 pages, 6 figures, accepted by AAAI 2026. The model is also called Dream, to the other me in the world forever
EmoCaliber: 通过置信度 verbalization 和校准推进可靠的视觉情绪理解
机构 * IIE, Chinese Academy of Sciences(中国科学院信息研究所) ; Nankai University(南开大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 EmoCaliber通过置信度 verbalization 和校准提升视觉情绪理解的可靠性。
DocR1: 证据页面引导的GRPO用于多页文档理解
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 DocR1通过证据页面引导的GRPO框架,提升多页文档理解能力,实现高质量模型训练与多任务性能突破。
TeleEgo:在真实场景中评估第一人称AI助手的基准测试
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)
专题命中 多模态评测 :multi-modal(abstract);omni-modal(abstract);分类 cs.CV
AI总结 TeleEgo是一个用于评估第一人称AI助手在真实场景中多模态处理能力的基准测试,通过长持续时间流媒体数据和严格评估指标,推动未来具有更强流媒体记忆能力的助手发展。
BioAnalyst: 一种用于生物多样性的基础模型
机构 * Nederlandse Organisatie voor Toegepast Natuurwetenschappelijk Onderzoek – TNO(荷兰应用自然科学研究院 – TNO) ; Eindhoven University of Technology(埃因霍温理工大学) ; Amazon(亚马逊) ; University of Groningen(格罗宁根大学) ; Helmholtz Center for Environmental Research – UFZ(环境研究赫尔姆霍茨中心 – UFZ) ; SURF
专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 BioAnalyst是一种针对生物多样性分析和保护规划的多模态基础模型,通过预训练和微调实现物种分布建模和生态预测。
机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) ; Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) ; SZU-AFS Joint Innovation Center for AI Technology(深圳大学-腾讯优图联合创新中心) ; Shenzhen University(深圳大学) ; School of Electronic and Computer Engineering(电子与计算机工程学院) ; Peking Univerisity(北京大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
RoboDriveVLM:一种面向自动驾驶鲁棒视觉-语言模型的新型基准与基线
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 RoboDriveVLM提出了一种新型基准和基线,用于评估视觉-语言模型在自动驾驶中的鲁棒性,通过模拟多种腐蚀场景提升系统可靠性。