arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-09 至 2026-02-09 共收录 43 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2602.06184 2026-02-09 cs.CV cs.CL 79%

PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining

PhenoLIP:将表型本体知识整合到医学视觉-语言预训练中

Cheng Liang, Chaoyi Wu, Weike Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 PhenoLIP通过整合表型本体知识提升医学视觉-语言模型的表型识别与跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06799 2026-02-09 cs.CL 57%

Visual Word Sense Disambiguation with CLIP through Dual-Channel Text Prompting and Image Augmentations

通过双通道文本提示和图像增强的CLIP实现视觉词义消歧

Shamik Bhattacharya, Daniel Perkins, Yaren Dogan, Vineeth Konjeti, Sudarshan Srinivasan, Edmon Begoli

机构 * 2 The Bredesen Center for Interdisciplinary Research 3 Department of Electrical Engineering \& Computer Science, University of Tennessee, Knoxville, TN 37916 4 Oak Ridge National Laboratory (ORNL), Oak Ridge, TN 37830

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出通过CLIP和双通道提示与图像增强实现视觉词义消歧,提升MRR和命中率,验证了精确提示的有效性。

Comments 9 pages, 6 figures, pending journal/workshop submission

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2602.06139 2026-02-09 cs.CV 87%

EgoAVU: Egocentric Audio-Visual Understanding

EgoAVU:第一人称音频视觉理解

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

机构 * Meta University of Maryland, College Park(马里兰大学College Park分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 EgoAVU通过生成第一人称音频视觉叙述和问题,提升多模态大语言模型在第一人称视频理解中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06647 2026-02-09 cs.CL eess.AS 62%

Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features

在波涛间阅读:利用跨句音频特征实现鲁棒性话题分割

Steffen Freisinger, Philipp Seeberger, Tobias Bocklet, Korbinian Riedhammer

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出利用跨句音频特征进行鲁棒性话题分割,通过多模态方法提升分割性能,并在多个数据集上验证了其有效性。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06270 2026-02-09 cs.CL 57%

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

VowelPrompt:通过元音层面的语调增强从文本中听出语音情感

Yancheng Wang, Osama Hanna, Ruiming Xie, Xianfeng Rui, Maohao Shen, Xuedong Zhang, Christian Fuegen, Jilong Wu, Debjyoti Paul, Arthur Guo, Zhihong Lei, Ozlem Kalinli, Qing He, Yingzhen Yang

机构 * Meta Superintelligence Labs(Meta超智能实验室) Arizona State University(亚利桑那州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 VowelPrompt通过元音层面的语调增强,提升LLM在语音情感识别中的表现并生成可解释的解释。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06047 2026-02-09 cs.HC cs.AI 57%

Git for Sketches: An Intelligent Tracking System for Capturing Design Evolution

Git for Sketches: 一种智能追踪系统用于捕捉设计演变

Sankar B, Amogh A S, Sandhya Baranwal, Dibakar Sen

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 DIMES系统通过智能版本控制捕捉设计演变,利用sGIT和生成式AI提升概念探索和知识传递效率。

Comments 49 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 2 篇

2511.08585 2026-02-09 cs.AI cs.CV 62%

Simulating the Visual World with Artificial Intelligence: A Roadmap

用人工智能模拟视觉世界:一条路线图

Jingtong Yue, Ziqi Huang, Zhaoxi Chen, Xintao Wang, Pengfei Wan, Ziwei Liu

机构 * Robotics Institute Carnegie Mellon University(卡内基梅隆大学机器人研究所) S-Lab Nanyang Technological University(南洋理工大学S实验室) Kling Team Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于隐式世界模型和视频渲染器的视频基础模型,用于模拟物理动态、智能体交互和任务规划,涵盖四代视频生成技术,应用于机器人、自动驾驶和互动游戏等领域。

Comments Project page: https://world-model-roadmap.github.io/ Github Repo: https://github.com/ziqihuangg/Awesome-From-Video-Generation-to-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06129 2026-02-09 cs.LG cs.AI 57%

Urban Spatio-Temporal Foundation Models for Climate-Resilient Housing: Scaling Diffusion Transformers for Disaster Risk Prediction

城市时空基础模型用于气候韧性住房:扩散变换器的扩展用于灾害风险预测

Olaf Yunus Laitinen Imanov, Derya Umut Kulali, Taner Yilmaz

机构 * Technical University of Denmark(技术大学) Eskisehir Technical University(埃斯基谢普大学) Afyon Kocatepe University(阿夫yon卡奥塔佩大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出Skjold-DiT模型,通过整合时空城市数据预测建筑气候风险,并结合交通网络结构提升灾害响应能力。

Comments 10 pages, 5 figures. Submitted to IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2602.06056 2026-02-09 cs.MM cs.AI cs.CL cs.CV 85%

Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space

分析扩散模型和自回归视觉语言模型在多模态嵌入空间中的表现

Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao

机构 * Nanyang Technological University(南洋理工大学) Yale University(耶鲁大学) NYU Shanghai(纽约大学上海分校) Alibaba-NTU Singapore Joint Research Institute(阿里-国立新加坡大学联合研究机构) University of the Chinese Academy of Sciences(中国科学院大学) Center for Data Science(数据科学中心) New York University(纽约大学)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文研究了多模态扩散模型在多模态嵌入任务中的表现,发现其在分类、VQA和检索任务中均逊于自回归VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06654 2026-02-09 cs.IR cs.AI 79%

Multimodal Generative Retrieval Model with Staged Pretraining for Food Delivery on Meituan

具有分阶段预训练的多模态生成检索模型用于美团外卖

Boyu Chen, Tai Guo, Weiyu Cui, Yuqing Li, Xingxing Wang, Chuan Shi, Cheng Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种具有分阶段预训练的多模态生成检索模型,通过分阶段任务优化和语义ID利用,提升美团外卖检索性能与商业收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06652 2026-02-09 cs.AI cs.CV 62%

Same Answer, Different Representations: Hidden instability in VLMs

相同答案,不同表示:VLMs中的隐藏不稳定性

Farooq Ahmad Wani, Alessandro Suglia, Rohit Saxena, Aryo Pradipta Gema, Wai-Chung Kwan, Fazl Barez, Maria Sofia Bucarelli, Fabrizio Silvestri, Pasquale Minervini

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) CNRS(法国国家科学研究中心) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) i3S(i3S研究所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究揭示了视觉语言模型中隐藏的不稳定性,通过引入新的评估框架发现模型在内部表示漂移、鲁棒性与决策边界等方面存在显著问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00382 2026-02-09 econ.GN cs.AI q-fin.EC stat.AP stat.ML 57%

Adventures in Demand Analysis Using AI

利用人工智能进行需求分析的冒险

Philipp Bach, Victor Chernozhukov, Sven Klaassen, Martin Spindler, Jan Teichert-Kluge, Suhas Vijaykumar

机构 * Freie Universität Berlin(柏林自由大学) Massachusetts Institute of Technology(麻省理工学院) University of Hamburg(汉堡大学) UC San Diego(圣地亚哥大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文利用AI生成多模态产品表示,提升需求分析的预测准确性与因果推断的可信度。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2506.11924 2026-02-09 cs.CV 79%

Aligned Novel View Image and Geometry Synthesis via Cross-modal Attention Instillation

通过跨模态注意力安装实现对齐的新视角图像和几何合成

Min-Seop Kwak, Junho Kim, Sangdoo Yun, Dongyoon Han, Taekyung Kim, Seungryong Kim, Jin-Hwa Kim

机构 * NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能学院) SNU AIIS(首尔国立大学人工智能研究所)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散的框架,通过跨模态注意力蒸馏实现新视角图像和几何的对齐生成,提升几何鲁棒性和重建质量。

Comments Project page at https://cvlab-kaist.github.io/MoAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06166 2026-02-09 cs.CV 79%

M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning

M3:通过多模态、多智能体和多轮视觉推理实现高保真的文本到图像生成

Bangji Yang, Ruihan Guo, Jiajun Fan, Chaoran Cheng, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 M3通过多智能体和多轮视觉推理提升开源模型的文本到图像生成能力,超越商业系统并实现最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06597 2026-02-09 cs.LG 78%

DiTS: Multimodal Diffusion Transformers Are Time Series Forecasters

DiTS:多模态扩散变换器是时间序列预测器

Haoran Zhang, Haixuan Liu, Yong Liu, Yunzhong Qiu, Yuxuan Wang, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 DiTS通过双流Transformer块处理时间序列的内生和外生变量依赖,实现高效生成预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06494 2026-02-09 cs.CV 57%

DreamHome-Pano: Design-Aware and Conflict-Free Panoramic Interior Generation

DreamHome-Pano: 基于设计意识和无冲突的全景室内生成

Lulu Chen, Yijiang Hu, Yuanqing Liu, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 DreamHome-Pano通过引入Prompt-LLM和无冲突控制架构,实现了高保真的全景室内生成,平衡了美学质量和结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06419 2026-02-09 cs.CV 57%

Learning Human Visual Attention on 3D Surfaces through Geometry-Queried Semantic Priors

通过几何查询的语义先验学习人类在3D表面上的视觉注意

Soham Pahari, Sandeep C. Kumain

机构 * UPES Dehradun(德里敦大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SemGeo-AttentionNet,通过几何查询语义先验,有效建模人类在3D表面的视觉注意,实现了显著性检测与扫描路径生成的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 13 篇

2510.19585 2026-02-09 cs.CL cs.AI cs.CV cs.DL 82%

Detecting Latin in Historical Books with Large Language Models: A Multimodal Benchmark

利用大语言模型检测历史书籍中的拉丁文:一个多模态基准测试

Yu Wu, Ke Shu, Jonas Fischer, Lidia Pivovarova, David Rosson, Eetu Mäkelä, Mikko Tolonen

机构 * University of Helsinki(赫尔辛基大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出利用大语言模型检测历史文献中的拉丁文片段,并通过多模态数据集评估模型性能,揭示了零样本模型在拉丁文识别中的有效性及局限性。

Comments Accepted by the EACL 2026 main conference. Code and data available at https://github.com/COMHIS/EACL26-detect-latin

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06743 2026-02-09 cs.CV 79%

Clinical-Prior Guided Multi-Modal Learning with Latent Attention Pooling for Gait-Based Scoliosis Screening

具有潜在注意力池的临床先验引导多模态学习用于基于步态的脊柱侧弯筛查

Dong Chen, Zizhuang Wei, Jialei Xu, Xinyang Sun, Zonglin He, Meiru An, Huili Peng, Yong Hu, Kenneth MC Cheung

机构 * Orthopaedic Centre, The University of Hong Kong - Shenzhen Hospital, Shenzhen, China(香港大学深圳医院骨科中心) Translational Medicine Centre, The University of Hong Kong - Shenzhen Hospital, China(香港大学深圳医院转化医学中心) Department of Orthopaedics and Traumatology, Li Ka Shing Faculty of Medicine, The University of Hong Kong, Hong Kong, China(香港大学李嘉成医学院骨科及创伤外科学院) Huawei, China(华为)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于步态的脊柱侧弯筛查方法,通过多模态学习和潜在注意力池化机制,结合临床先验知识,实现了可解释的特征表示和高精度的筛查性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06158 2026-02-09 cs.CV 79%

MGP-KAD: Multimodal Geometric Priors and Kolmogorov-Arnold Decoder for Single-View 3D Reconstruction in Complex Scenes

MGP-KAD:多模态几何先验与科莫戈罗夫-阿诺德解码器用于复杂场景中的单视图3D重建

Luoxi Zhang, Chun Xie, Itaru Kitahara

机构 * Doctoral Program in Empowerment Informatics, University of Tsukuba, Japan(赋能信息学博士项目,茨ukuba大学,日本) Center for Computational Science, Tsukuba, Ibaraki, Japan(计算科学中心,茨ukuba,Ibaraki,日本)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MGP-KAD通过整合多模态特征与几何先验,结合科莫戈罗夫-阿诺德网络解码器,提升复杂场景中单视图3D重建的精度与细节保持能力。

Comments 6 pages. Published in IEEE International Conference on Image Processing (ICIP) 2025

Journal ref Proc. IEEE International Conference on Image Processing (ICIP), 2025, pp. 1564-1569

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21355 2026-02-09 cs.LG 78%

SMMILE: An Expert-Driven Benchmark for Multimodal Medical In-Context Learning

SMMILE:一个多模态医学上下文学习的专家驱动基准

Melanie Rieff, Maya Varma, Ossian Rabow, Subathra Adithan, Julie Kim, Ken Chang, Hannah Lee, Nidhi Rohatgi, Christian Bluethgen, Mohamed S. Muneer, Jean-Benoit Delbrouck, Michael Moor

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Lund University(隆德大学) Jawaharlal Institute of Postgraduate Medical Education and Research(贾瓦哈拉尔·尼赫鲁医学教育与研究学院) UCSF(加州大学旧金山分校) University of Zurich(苏黎世大学) University Hospital Zurich(苏黎世大学医院) HOPPR

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 SMMILE是一个专家驱动的多模态医学上下文学习基准,评估了15个MLLMs在医学任务中的多模态ICL能力,发现其表现有限且易受无关示例和最近性偏见影响。

Comments NeurIPS 2025 (Datasets & Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06369 2026-02-09 cs.CV cs.AI 62%

Revisiting Salient Object Detection from an Observer-Centric Perspective

重新审视以观察者为中心的显著物体检测

Fuxi Zhang, Yifan Wang, Hengrun Zhao, Zhuohan Sun, Changxing Xia, Lijun Wang, Huchuan Lu, Yangrui Shao, Chen Yang, Long Teng

机构 * Dalian University of Technology(大连理工大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OC-SOD方法,通过考虑观察者偏好和意图,实现个性化显著性预测,并构建首个OC-SOD数据集和代理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04692 2026-02-09 cs.CV cs.AI 62%

DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking

DRMOT:用于RGBD参照多目标跟踪的数据集和框架

Sijia Chen, Lijuan Ma, Yanqiu Yu, En Yu, Liman Liu, Wenbing Tao

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DRMOT任务,通过融合RGB、深度和语言信息,构建DRSet数据集并提出DRTrack框架,提升多目标跟踪的3D感知能力。

Comments https://github.com/chen-si-jia/DRMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06203 2026-02-09 cs.CV cs.AI cs.LG cs.RO 62%

AnyThermal: Towards Learning Universal Representations for Thermal Perception

AnyThermal:迈向热感知的通用表示学习

Parv Maheshwari, Jay Karhade, Yogesh Chawla, Isaiah Adu, Florian Heisen, Andrew Porco, Andrew Jong, Yifei Liu, Santosh Pitla, Sebastian Scherer, Wenshan Wang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Biological Systems Engineering, University of Nebraska-Lincoln(内布拉斯加大学林肯分校生物系统工程系) Mechanical Engineering, Penn State University(宾夕法尼亚州立大学机械工程系) School of Engineering and Design, Technical University of Munich(慕尼黑技术大学工程与设计学院) Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 AnyThermal通过蒸馏视觉基础模型的特征表示,实现跨环境和任务的通用热感知表示学习,取得显著性能提升。

Comments Accepted at IEEE ICRA (International Conference on Robotics & Automation) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06363 2026-02-09 cs.CV 57%

Robust Pedestrian Detection with Uncertain Modality

具有不确定模态的鲁棒行人检测

Qian Bie, Xiao Wang, Bin Yang, Zhixi Yu, Jun Chen, Xin Xu

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出AUNet,通过自适应不确定性感知网络在不确定输入下实现鲁棒行人检测,结合UMVR和MAI模块提升跨模态信息融合效果。

Comments Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract here is shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00734 2026-02-09 eess.SP cs.AI cs.LG 57%

EEG-MACS: Manifold Attention and Confidence Stratification for EEG-based Cross-Center Brain Disease Diagnosis under Unreliable Annotations

EEG-MACS: 用于基于EEG的跨中心脑部疾病诊断的流形注意力与置信度分层

Zhenxi Song, Ruihan Qin, Huixia Ren, Zhen Liang, Yi Guo, Min Zhang, Zhiguo Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen People's Hospital(深圳人民医院) Shenzhen University(深圳大学) Shenzhen Bay Laboratory(深圳湾实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 EEG-MACS通过流形注意力与置信度分层技术,提升跨中心脑部疾病诊断的准确性与鲁棒性。

Comments 15 pages, 9 figures. Oral presentation at ACM MM 2024

Journal ref In Proceedings of the 32nd ACM International Conference on Multimedia (ACM MM '24), pp. 340-349, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06904 2026-02-09 astro-ph.CO 50%

Non-spherical BUFFALOs: a weak lensing view of the Frontier Field clusters and associated systematics

非球形 BUFFALOs:从弱透镜视图看前沿场簇及相关系统误差

A. Niemiec, A. Acebron, B. Beauchesne, M. Jauzac, J. M. Diego, D. Eckert, D. Harvey, A. M. Koekemoer, D. J. Lagattuta, M. Limousin, G. Mahler, N. Patel, S. Tam, J. F. V. Allingham, R. Cen, A. Faisst, D. Perera, M. Sereno

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本研究通过高分辨率成像和光谱学分析,揭示了前沿场星系团中弱透镜测量的系统误差来源,特别是复杂结构对质量估计的影响。

Comments 19 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06631 2026-02-09 cs.CY 50%

Estimating Exam Item Difficulty with LLMs: A Benchmark on Brazil's ENEM Corpus

利用LLM估算考试题目难度:在巴西ENEM语料库上的基准测试

Thiago Brant, Julien Kühn, Jun Pang

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文研究了LLM在估算考试题目难度上的表现,发现其在单模态问题上表现中等,但对多模态问题和人口统计数据提示的适应性有限,建议采用评估后再生成的流程进行负责任的评估设计。

Comments 42 pages, 19 figures. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06451 2026-02-09 cs.LG 50%

BrokenBind: Universal Modality Exploration beyond Dataset Boundaries

BrokenBind: 超越数据集边界的通用模态探索

Zhuo Huang, Runnan Chen, Bo Han, Gang Niu, Masashi Sugiyama, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Hong Kong Baptist University(香港 Baptist 大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) The University of Tokyo(东京大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 BrokenBind提出了一种超越数据集边界的通用模态探索方法,通过结合不同数据集的模态实现灵活且通用的多模态学习。

Comments 17 pages, 8 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08076 2026-02-09 cs.DB 50%

Heterogeneity in Entity Matching: A Survey and Experimental Analysis

实体匹配中的异质性:调查与实验分析

Mohammad Hossein Moslemi, Amir Mousavi, Behshid Behkamal, Mostafa Milani

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文调查了实体匹配中的异质性问题,分析了不同异质性类型对匹配任务的影响,并评估了现有方法的局限性,提出了多模态匹配、人机协作等未来研究方向。

Comments Accepted at Data & Knowledge Engineering (DKE)

详情

展开后加载摘要…

URL PDF HTML 收藏