arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-13 至 2026-01-13 共收录 92 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 13 篇

2511.17068 2026-01-13 cs.CV cs.AI 62%

ReBrain: Brain MRI Reconstruction from Sparse CT Slice via Retrieval-Augmented Diffusion

ReBrain: 通过检索增强扩散模型从稀疏CT切片重建脑部MRI

Junming Liu, Yifei Sun, Weihua Cheng, Yujin Kang, Yirong Chen, Ding Wang, Guosun Zeng

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 ReBrain通过检索增强扩散模型从稀疏CT切片重建脑部MRI,利用BBDM和ControlNet实现结构连续性,提升稀疏条件下的跨模态重建性能。

Comments 16 pages, 12 figures, 7 tables; Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07221 2026-01-13 cs.CV 57%

Language-Grounded Multi-Domain Image Translation via Semantic Difference Guidance

基于语义差异指导的多领域图像翻译

Jongwon Ryu, Joonhyung Park, Jaeho Han, Yeong-Seok Kim, Hye-rin Kim, Sunjae Yoon, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Hyundai Mobis Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 LACE通过语义差异指导实现多领域图像翻译,结合全局语义与局部结构特征融合及多领域控制机制,提升视觉翻译的保真度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07219 2026-01-13 cs.CV 57%

VENUS: Visual Editing with Noise Inversion Using Scene Graphs

VENUS: 使用场景图进行视觉编辑的噪声反演

Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University(越南国家大学) University of Dayton(戴维森大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 VENUS是一种无需训练的场景图引导图像编辑框架,通过噪声反演和拆分提示策略提升图像编辑的保真度和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06965 2026-01-13 cs.CV 57%

Unified Personalized Understanding, Generating and Editing

统一的个性化理解、生成与编辑

Yu Zhong, Tianwei Lin, Ruike Zhu, Yuqian Yuan, Haoyu Zheng, Liang Liang, Wenqiao Zhang, Feifei Shao, Haoyuan Li, Wanggui He, Hao Jiang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 OmniPersona是首个统一LMMs的端到端个性化框架,通过结构解耦的概念标记和显式知识重播机制,实现个性化理解、生成和图像编辑的一致可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06605 2026-01-13 cs.CV 57%

Sissi: Zero-shot Style-guided Image Synthesis via Semantic-style Integration

Sissi:通过语义-风格整合实现零样本风格引导图像合成

Yingying Deng, Xiangyu He, Fan Tang, Weiming Dong, Xucheng Yin

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Sissi通过语义-风格整合实现零样本风格引导图像合成,采用上下文学习框架提升风格化效果与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07823 2026-01-13 eess.SY cs.RO cs.SY 50%

Video Generation Models in Robotics -- Applications, Research Challenges, Future Directions

机器人中的视频生成模型——应用、研究挑战与未来方向

Zhiting Mei, Tenny Yin, Ola Shorinwa, Apurva Badithela, Zhonghe Zheng, Joseph Bruno, Madison Bland, Lihan Zha, Asher Hancock, Jaime Fernández Fisac, Philip Dames, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学) Temple University(Temple 大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文综述了视频生成模型在机器人学中的应用、研究挑战及未来方向,探讨了其在物理模拟、动作预测和策略评估中的作用及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07307 2026-01-13 cs.NI 50%

Low-Altitude Satellite-AAV Collaborative Joint Mobile Edge Computing and Data Collection via Diffusion-based Deep Reinforcement Learning

低空卫星-无人机协同联合移动边缘计算与数据采集 via 基于扩散的深度强化学习

Boxiong Wang, Hui Kang, Jiahui Li, Geng Sun, Zemin Sun, Jiacheng Wang, Dusit Niyato, Shiwen Mao

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出基于扩散的深度强化学习方法,用于低空卫星-无人机协同联合移动边缘计算与数据采集,以提高效率和性能。

Comments 18 pages, 12 figures, accepted by IEEE TMC

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15716 2026-01-13 cs.RO 50%

DiffPF: Differentiable Particle Filtering with Generative Sampling via Conditional Diffusion Models

DiffPF: 基于条件扩散模型的可微粒子滤波器通过生成采样

Ziyu Wan, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,国立新加坡大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 DiffPF通过条件扩散模型实现高精度后验采样,提升动态系统状态估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 29 篇

2601.07014 2026-01-13 eess.AS cs.SD 85%

DIVINE: Coordinating Multimodal Disentangled Representations for Oro-Facial Neurological Disorder Assessment

DIVINE:协调多模态解耦表示以评估口面部神经系统疾病

Mohd Mujtaba Akhtar, Girish, Muskaan Singh

机构 * Veer Bahadur Singh Purvanchal University(韦尔·巴哈杜尔·辛格·普瓦兰恰尔大学) UPES(UPES大学) Ulster University(乌斯特大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 eess.AS

AI总结 DIVINE通过多模态解耦和多任务学习,实现对口面部神经系统疾病的高精度评估,达到98.26%的准确率。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01592 2026-01-13 cs.CR cs.CV 85%

OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs

OpenRT: 一种用于多模态大语言模型的开源红队框架

Xin Wang, Yunhao Chen, Juncheng Li, Yixu Wang, Yang Yao, Tianle Gu, Jie Li, Yan Teng, Yingchun Wang, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 OpenRT框架通过模块化设计和高吞吐量运行时,系统性评估多模态大语言模型的安全性,揭示了前沿模型在复杂攻击下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24160 2026-01-13 cs.CV 83%

Towards Open-Vocabulary Industrial Defect Understanding with a Large-Scale Multimodal Dataset

面向大规模多模态数据集的开放词汇工业缺陷理解

TsaiChing Ni, ZhenQi Chen, YuanFu Yang

机构 * Institute of Intelligent Systems, National Yang Ming Chiao Tung University(智能系统研究所,国立阳明交通大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出IMDD-1M大规模多模态数据集,训练了适用于工业场景的视觉-语言基础模型,通过高效微调实现领域适应,提升工业检测与生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06750 2026-01-13 cs.CV cs.AI cs.CL 82%

Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models

医疗多模态大语言模型的视点临床意图理解能力基准测试

Shaonan Liu, Guo Yu, Xiaoling Luo, Shiyi Zheng, Wenting Chen, Jie Liu, Linlin Shen

机构 * Shenzhen University(深圳大学) Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MedGaze-Bench,首个评估医疗多模态大语言模型视点临床意图理解能力的基准测试,通过三维意图框架和陷阱QA机制,揭示现有模型在手术、急救和诊断任务中对意图理解的不足。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07344 2026-01-13 cs.CV cs.AI 81%

PulseMind: A Multi-Modal Medical Model for Real-World Clinical Diagnosis

PulseMind: 一种多模态医学模型用于真实世界临床诊断

Jiao Xu, Junwei Liu, Jiangwei Lao, Qi Zhu, Yunpeng Zhao, Congyun Jin, Shinan Liu, Zhihong Lu, Lihe Zhang, Xin Chen, Jian Wang, Ping Wang

机构 * Ant Group(蚂蚁集团)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 PulseMind通过整合多模态数据集和定制训练框架,提升真实世界临床诊断的准确性与实用性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06944 2026-01-13 cs.CV cs.AI 81%

SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models

SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准

Yuhang Su, Mei Wang, Yaoyao Zhong, Guozhang Li, Shixing Li, Yihan Feng, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。

Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06757 2026-01-13 cs.CL cs.AI 81%

MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues

MTMCS-Bench: 多轮对话中多模态大语言模型上下文安全性的评估

Zheyuan Liu, Dongwhi Kim, Yixin Wan, Xiangchi Yuan, Zhaoxuan Tan, Fengran Mo, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Georgia Institute of Technology(佐治亚理工学院) University of Montreal(蒙特利尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MTMCS-Bench评估多模态大语言模型在多轮对话中的上下文安全性,揭示了安全与效用之间的权衡及现有防护措施的不足。

Comments A benchmark of realistic images and multi-turn conversations that evaluates contextual safety in MLLMs under two complementary settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07778 2026-01-13 cs.LG cs.AI 79%

DT-ICU: Towards Explainable Digital Twins for ICU Patient Monitoring via Multi-Modal and Multi-Task Iterative Inference

DT-ICU:通过多模态和多任务迭代推理实现ICU患者监测的可解释数字孪生

Wen Guo

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 DT-ICU通过多模态和多任务迭代推理实现ICU患者监测的可解释数字孪生,提升了预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07576 2026-01-13 cs.HC cs.CV 79%

A Multimodal Dataset of Student Oral Presentations with Sensors and Evaluation Data

面向学生口头陈述的多模态数据集,包含传感器和评估数据

Alvaro Becerra, Ruth Cobos, Roberto Daza

机构 * Universidad Autonoma de Madrid, School of Engineering(马德里自治大学工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SOPHIAS是一个包含学生口头陈述的多模态数据集,整合了传感器和评估数据,用于研究多模态行为与表现的关系及自动化反馈工具的开发。

Comments Article under review in the journal Scientific Data. GitHub repository of the dataset at: https://github.com/dataGHIA/SOPHIAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09195 2026-01-13 cs.CV 79%

Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives

迈向可信的皮肤科多模态大语言模型:一种基准和多模态评估器用于诊断叙述

Yuhao Shen, Jiahe Qian, Shuping Zhang, Zhangtianyi Chen, Tao Lu, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DermBench和DermEval用于评估皮肤科多模态大语言模型的诊断叙述,通过结合基准和自动评估器,实现临床意义的可重复评估,验证模型性能与专家评分的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18411 2026-01-13 cs.RO cs.CV 79%

SeePerSea: Multi-modal Perception Dataset of In-water Objects for Autonomous Surface Vehicles

SeePerSea:用于自主水面车辆的水下物体多模态感知数据集

Mingi Jeong, Arihant Chadda, Ziang Ren, Luyang Zhao, Haowen Liu, Monika Roznere, Aiwei Zhang, Yitao Jiang, Sabriel Achong, Samuel Lensgraf, Alberto Quattrini Li

机构 * Department of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) IQT Labs(IQT实验室) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Computer Science, University of Maryland College Park(马里兰大学计算机科学系) The Institute for Human and Machine Cognition and The University of West Florida(人机认知研究所与西佛罗里达大学) School of Computing, Binghamton University(宾夕法尼亚州立大学计算学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 SeePerSea数据集为自主水面车辆提供多模态水下物体感知数据,通过训练测试现有深度学习算法,推动海洋自主技术发展。

Comments Topic: Special Issue on ICRA 2024 Workshop on Field Robotics

Journal ref IEEE Transactions on Field Robotics 2 (2025) - 737-752

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19024 2026-01-13 cs.CV 79%

A Survey of Multimodal Hallucination Evaluation and Detection

多模态幻觉评估与检测综述

Zhiyuan Chen, Yuecong Min, Jie Zhang, Bei Yan, Jiahao Wang, Xiaozhen Wang, Shiguang Shan

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Trustworthy Technology and Engineering Laboratory(可信技术与工程实验室) Huawei(华为公司)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文综述了多模态幻觉评估与检测方法,分析了幻觉分类、评估基准、检测技术及未来研究方向。

Comments 40 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06645 2026-01-13 eess.SP cs.LG 78%

A Multimodal Deep Learning Framework for Predicting ICU Deterioration: Integrating ECG Waveforms with Clinical Data and Clinician Benchmarking

一种多模态深度学习框架用于预测ICU恶化:整合ECG波形与临床数据及医生基准测试

Juan Miguel López Alcaraz, Xicoténcatl López Moran, Erick Dávila Zaragoza, Claas Händel, Richard Koebe, Wilhelm Haverkamp, Nils Strodthoff

机构 * AI4Health Division, Carl von Ossietzky Universität Oldenburg(AI4Health部门,奥尔登堡大学) CAPASITS, Secretariat of Health of the State of Colima(CAPASITS,科利马州卫生秘书处) Department of Interventional Cardiology, Hospital Puerta de Hierro Colima(介入心脏病学部,科利马医院) Institute for Medical Informatics and Statistics, Kiel University and University Hospital Schleswig-Holstein(医学信息学与统计研究所,基尔大学和石勒苏益格-荷尔斯泰因大学医院) Department of Anesthesiology, Intensive Care Medicine, Emergency Medicine, and Pain Therapy, Carl von Ossietzky Universität & Klinikum Oldenburg(麻醉学、重症医学、急诊医学和疼痛治疗部,奥尔登堡大学及奥尔登堡诊所) Department of Cardiology, Angiology and Intensive Care Medicine, Charité Campus Mitte, German Heart Center of the Charité-University Medicine Berlin(心内科、血管科和重症医学部,Charité梅尔特校区,Charité-大学医学中心柏林德国心脏中心)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究提出一种多模态深度学习框架MDS ICU,通过整合ECG波形与临床数据,提升ICU恶化预测的准确性,并在医生和大语言模型中表现优异。

Comments 23 pages, 8 figures, source code under https://github.com/AI4HealthUOL/MDS-ICU

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04643 2026-01-13 cs.CE 78%

MMFCTUB: Multi-Modal Financial Credit Table Understanding Benchmark

MMFCTUB:多模态金融信用表理解基准

Cui Yakun, Yanting Zhang, Zhu Lei, Jian Xie, Zhizhuo Kou, Hang Du, Zhenghao Zhu, Sirui Han

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 MMFCTUB是一个多模态金融信用表理解基准,通过最小监督流程和容量驱动问题评估模型在信用表理解任务中的结构感知、领域知识利用和数值计算能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25263 2026-01-13 cs.CV 70%

LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation

LangHOPS: 语言引导的层次开放词汇部件分割

Yang Miao, Jan-Nico Zaech, Xi Wang, Fabien Despinoy, Danda Pani Paudel, Luc Van Gool

机构 * INSAIT Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧里迪斯基") ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑技术大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 LangHOPS通过多模态大语言模型实现开放词汇物体-部件实例分割,取得领域内和跨数据集的优异性能。

Comments 10 pages, 5 figures, 14 tables, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13772 2026-01-13 cs.SD cs.AI cs.LG cs.MM eess.AS 67%

Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models

Jailbreak-AudioBench: 对大型音频语言模型中 jailbreak 威胁的深入评估与分析

Hao Cheng, Erjia Xiao, Jing Shao, Yichi Wang, Le Yang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学) Beijing University of Technology(北京理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 Jailbreak-AudioBench 通过构建工具箱、数据集和基准,深入评估大型音频语言模型中 jailbreak 威胁,并促进安全防护机制的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22200 2026-01-13 cs.RO 67%

EnvoDat: A Large-Scale Multisensory Dataset for Robotic Spatial Awareness and Semantic Reasoning in Heterogeneous Environments

EnvoDat:一种大规模多感官数据集,用于机器人空间感知和异构环境中的语义推理

Linus Nwankwo, Bjoern Ellensohn, Vedant Dave, Peter Hofer, Jan Forstner, Marlene Villneuve, Robert Galler, Elmar Rueckert

机构 * Chair of Cyber-Physical System, Montanuniversität Leoben, Austria(智能物理系统系,莱布恩矿业大学,奥地利) Theresianische Militarakademie, Austria(特里西亚军事学院,奥地利) Chair of Subsurface Engineering, Montanuniversität Leoben, Austria(地下工程系,莱布恩矿业大学,奥地利)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract)

AI总结 EnvoDat是一个大规模多感官数据集,用于提升机器人在复杂异构环境中的空间感知和语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06106 2026-01-13 cs.LG cs.AI cs.CL cs.CV cs.MA 67%

Judge Model for Large-scale Multimodality Benchmarks

大规模多模态基准的判断模型

Min-Han Shih, Yu-Hsin Wu, Yu-Wei Chen

机构 * Department of Electrical and Computer Engineering, Viterbi School of Engineering, University of Southern California(电气与计算机工程系,维特比工程学院,南加州大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种多模态判断模型,用于评估多种任务,通过聚合多模态判断并生成诊断反馈,展示了其在多模态AI研究中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00840 2026-01-13 cs.DL cs.AI cs.CV 62%

A Global Atlas of Digital Dermatology to Map Innovation and Disparities

数字皮肤学全球地图:映射创新与差距

Fabian Gröger, Simone Lionetti, Philippe Gottfrois, Alvaro Gonzalez-Jimenez, Lea Habermacher, Labelling Consortium, Ludovic Amruthalingam, Matthew Groh, Marc Pouly, Alexander A. Navarini

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 SkinMap通过构建全球数字皮肤学地图,量化数据集新颖性、冗余和代表性缺口,揭示皮肤科数据覆盖的结构性不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07620 2026-01-13 cs.CV 57%

PARL: Position-Aware Relation Learning Network for Document Layout Analysis

PARL:面向文档布局分析的位置感知关系学习网络

Fuyuan Liu, Dianyu Yu, He Ren, Nayu Liu, Xiaomian Kang, Delai Qiu, Fa Zhang, Genpeng Zhen, Shengping Liu, Jiaen Liang, Wei Huang, Yining Wang, Junnan Zhu

机构 * Unisound AI Technology Co.Ltd(Unisound人工智能技术有限公司) MAIS, Institute of Automation, CAS(MAIS,自动化研究所,中国科学院) Beihang University(北航) School of Computer Science and Technology, Tiangong University(天工大学计算机科学与技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 PARL提出一种无OCR的纯视觉框架,通过位置敏感性和关系结构建模文档布局,实现高效且鲁棒的布局分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07232 2026-01-13 cs.AI 57%

Yes FLoReNce, I Will Do Better Next Time! Agentic Feedback Reasoning for Humorous Meme Detection

是的,Florne,我下次会做得更好!用于幽默表情包检测的代理反馈推理

Olivia Shanhong Liu, Pai Chet Ng, De Wen Soh, Konstantinos N. Plataniotis

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 Florne通过闭环反馈机制提升表情包幽默检测的适应性和解释质量。

Comments LaMAS@AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04350 2026-01-13 cs.CL 57%

RIGOURATE: Quantifying Scientific Exaggeration with Evidence-Aligned Claim Evaluation

RIGOURATE:利用证据对齐声明评估量化科学夸大

Joseph James, Chenghao Xiao, Yucheng Li, Nafise Sadat Moosavi, Chenghua Lin

机构 * The University of Sheffield, UK(谢菲尔德大学) Durham University, UK(杜ham大学) University of Surrey, UK(萨里大学) The University of Manchester, UK(曼彻斯特大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 RIGOURATE通过证据对齐评估量化科学声明的夸大程度,提升证据检索和夸大检测能力,促进更透明的科学交流。

详情

展开后加载摘要…

URL PDF HTML 收藏