arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-01 至 2026-01-01 共收录 57 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 1 篇

2510.10969 2026-01-01 cs.CV 83%

Bringing The Consistency Gap: Explicit Structured Memory for Interleaved Image-Text Generation

弥合一致性差距:用于交错图像-文本生成的显式结构化记忆

Zeteng Lin, Xingxing Li, Wen You, Xiaoyang Li, Zehan Lu, Yujun Cai, Jing Tang

机构 * Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) University of Queensland(昆士兰大学)

专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 IUT-Plug通过显式结构化记忆机制解决多模态生成中的上下文漂移问题,提升长序列一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2512.23881 2026-01-01 cs.SD cs.AI cs.CR 57%

Breaking Audio Large Language Models by Attacking Only the Encoder: A Universal Targeted Latent-Space Audio Attack

通过仅攻击编码器打破音频大语言模型:一种通用的目标潜在空间音频攻击

Roee Ziv, Raz Lapid, Moshe Sipper

机构 * Ben Gurion University of the Negev(贝纳乔大学奈夫分校) Deepkeep

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种针对音频大语言模型编码器的通用潜在空间攻击方法,通过操纵音频潜在表示实现目标输出,展示了编码器层面的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17609 2026-01-01 cs.SD cs.LG 50%

Audio Super-Resolution with Latent Bridge Models

基于潜在桥模型的音频超分辨率

Chang Li, Zehua Chen, Liyuan Wang, Jun Zhu

机构 * Department of CST, Tsinghua University, Beijing, China(计算机科学与技术系,清华大学,北京,中国) Shengshu AI, Beijing, China(盛舒人工智能,北京,中国) USTC, Hefei, China(中国科学技术大学,合肥,中国)

专题命中 音频语音多模态 :any-to-any(abstract)

AI总结 本文提出基于潜在桥模型的音频超分辨率方法,通过压缩音频到潜在空间并设计桥模型,实现高质量的任意到48kHz和192kHz音频上采样。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2504.18785 2026-01-01 cs.LG 78%

ALF: Advertiser Large Foundation Model for Multi-Modal Advertiser Understanding

ALF:多模态广告商基础模型用于多模态广告商理解

Santosh Rajagopalan, Jonathan Vronsky, Songbai Yan, S. Alireza Golestaneh, Shubhra Chandra, Min Zhou

机构 * Google(谷歌)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 ALF通过多模态Transformer架构和多任务优化,实现了广告商行为理解的高精度和高召回率,显著提升了欺诈检测和政策识别的性能。

Comments KDD 2026 ADS Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24321 2026-01-01 cs.CV cs.RO 77%

UniAct: Unified Motion Generation and Action Streaming for Humanoid Robots

UniAct:面向人形机器人的统一动作生成与动作流

Nan Jiang, Zimo He, Wanhe Yu, Lexi Pang, Yunhao Li, Hongjie Li, Jieming Cui, Yuhan Li, Yizhou Wang, Yixin Zhu, Siyuan Huang

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) School of Foreign Languages, Peking University(外语学院,北京大学) School of EECS, Peking University(电子工程与科学学院,北京大学) Huazhong University of Science and Technology(华中科技大学) State Key Lab of General AI(通用人工智能国家重点实验室) Nat’l Eng. Research Center of Visual Technology(视觉技术国家工程研究中心) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学) Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,北京大学-武汉人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniAct通过统一感知与控制框架,实现人形机器人在多模态指令下的高效动作生成与实时执行,提升零样本跟踪成功率19%。

Comments Project page: https://jnnan.github.io/uniact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18113 2026-01-01 cs.CV 77%

Chrono: A Simple Blueprint for Representing Time in MLLMs

Chrono: 一种用于多模态大语言模型中表示时间的简单蓝图

Hector Rodriguez, Boris Meinardus, Anil Batra, Anna Rohrbach, Marcus Rohrbach

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 Chrono提出了一种简单通用的序列蓝图,用于提升多模态大语言模型在视频时间定位和 grounded 视频问答任务中的性能。

Comments Code: https://github.com/sudo-Boris/mr-Blip. Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23361 2026-01-01 cs.CV 74%

OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions

OmniVCus: 基于多模态控制条件的前馈主体驱动视频定制

Yuanhao Cai, He Zhang, Xi Chen, Jinbo Xing, Yiwei Hu, Yuqian Zhou, Kai Zhang, Zhifei Zhang, Soo Ye Kim, Tianyu Wang, Yulun Zhang, Xiaokang Yang, Zhe Lin, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Adobe Research(Adobe研究) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 OmniVCus通过多模态控制条件和改进的嵌入机制实现高效的多主体视频定制。

Comments NeurIPS 2025; A data construction pipeline and a diffusion Transformer framework for controllable subject-driven video customization

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24243 2026-01-01 cs.CV 70%

MambaSeg: Harnessing Mamba for Accurate and Efficient Image-Event Semantic Segmentation

MambaSeg: 利用Mamba实现准确且高效的图像事件语义分割

Fuqiang Gu, Yuanke Li, Xianlei Long, Kangping Ji, Chao Chen, Qingyi Gu, Zhenliang Ni

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 MambaSeg通过双分支框架和双维交互模块,实现高效准确的多模态语义分割,适用于快速运动和低光条件下的图像事件分割任务。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24834 2026-01-01 cs.AI 57%

GenZ: Foundational models as latent variable generators within traditional statistical models

GenZ:在传统统计模型中通过可解释的语义特征作为潜在变量生成器的基础模型

Marko Jojic, Nebojsa Jojic

机构 * Arizona State University(亚利桑那州立大学) Microsoft Research(微软研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 GenZ通过可解释的语义特征连接基础模型与统计模型,实现更精准的预测,其在房地产价格预测和电影推荐中均取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25046 2026-01-01 physics.optics 50%

Extreme nonlinear optics in optical fibers

光学纤维中的极端非线性光学

Mario Ferraro, Bertrand Kibler, Pierre Béjot, Frédéric Gérome, Benoit Debord, Fetah Benabid, Fabio Mangini, Stefan Wabnitz

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文研究了光学纤维中极端非线性光学现象,探讨了等离子体生成、超连续谱展宽及多模脉冲传播等核心方法,展示了其在通信和量子科学中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2512.24064 2026-01-01 cs.CV cs.MM 84%

Neighbor-aware Instance Refining with Noisy Labels for Cross-Modal Retrieval

具有噪声标签的邻居感知实例细化用于跨模态检索

Yizhi Liu, Ruitao Pu, Shilin Xu, Yingke Chen, Quan-Hui Liu, Yuan Sun

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出了一种新的跨模态学习框架NIRNL,通过引入噪声标签和邻居感知机制,提升模型在高噪声环境下的检索性能。

Comments 9 pages, 4 figures, and AAAI-26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22251 2026-01-01 cs.LG cs.AI 57%

Interpretable Perturbation Modeling Through Biomedical Knowledge Graphs

通过生物医学知识图谱进行可解释的扰动建模

Pascal Passigan, Kevin Zhu, Angelina Ning

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于生物医学知识图谱的可解释扰动建模方法,通过整合多模态嵌入和图注意力网络,提升对药物-细胞对基因表达扰动的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20290 2026-01-01 cs.CR 50%

APT-CGLP: Advanced Persistent Threat Hunting via Contrastive Graph-Language Pre-Training

APT-CGLP: 通过对比图-语言预训练实现高级持续威胁狩猎

Xuebo Qiu, Mingqi Lv, Yimei Zhang, Tieming Chen, Tiantian Zhu, Qijie Song, Shouling Ji

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 APT-CGLP通过对比图-语言预训练实现高级持续威胁狩猎,提升跨模态语义匹配的准确性和效率。

Comments Accepted by SIGKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2512.24165 2026-01-01 cs.CV 79%

DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models

DiffThinker: 向基于扩散模型的生成多模态推理迈进

Zefeng He, Xiaoye Qu, Yafu Li, Tong Zhu, Siyuan Huang, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 DiffThinker通过基于扩散模型的生成方法,在多模态推理任务中实现了更高效的视觉推理和更精确的空间处理,显著优于现有模型。

Comments Project page: https://diffthinker-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04000 2026-01-01 cs.IT cs.LG math.IT 78%

Distributed Information Bottleneck Theory for Multi-Modal Task-Aware Semantic Communication

多模态任务感知语义通信的分布式信息瓶颈理论

Yujie Zhou, Cheng Peng, Rulong Wang, Yong Xiao, Yingyu Li, Guangming Shi, Ping Zhang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(电子信息与通信学院,华中科技大学) Peng Cheng Laboratory(鹏城实验室) Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔)) School of Mechanical Engineering and Electronic Information, China University of Geosciences(机械工程与电子信息学院,中国地质大学) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种多模态任务感知语义通信的分布式信息瓶颈框架,通过量化模态贡献来优化资源利用,提升通信效率与任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24271 2026-01-01 cs.CV cs.AI 73%

Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation

驯服幻觉:通过反事实视频生成提升MLLMs的视频理解

Zhe Huang, Hao Wen, Aiming Hao, Bingze Song, Meiqi Wu, Jiahong Wu, Xiangxiang Chu, Sheng Lu, Haoqian Wang

机构 * Tsinghua University(清华大学) Beihang University(北航) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 通过反事实视频生成和对比训练,提升MLLMs对视频的理解能力并减少幻觉。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25072 2026-01-01 cs.RO cs.AI cs.LG 57%

Coordinated Humanoid Manipulation with Choice Policies

协调的人形机器人操作与选择策略

Haozhi Qi, Yen-Jen Wang, Toru Lin, Brent Yi, Yi Ma, Koushil Sreenath, Jitendra Malik

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出选择策略,通过模块化遥控和模仿学习,实现人形机器人在无结构环境中的协调操作与高效学习。

Comments Code and Website: https://choice-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22681 2026-01-01 cs.CV 57%

CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation

CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成

ZhenQi Chen, TsaiChing Ni, YuanFu Yang

机构 * National Yang Ming Chiao Tung University

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24200 2026-01-01 cs.GR 50%

PartMotionEdit: Fine-Grained Text-Driven 3D Human Motion Editing via Part-Level Modulation

PartMotionEdit: 通过部分级调制实现细粒度文本驱动的3D人体运动编辑

Yujie Yang, Zhichao Zhang, Jiazhou Chen, Zichao Wu

专题命中 多模态生成 :cross-modal(abstract)

AI总结 PartMotionEdit通过部分级调制实现细粒度文本驱动的3D人体运动编辑,提升局部运动的精确控制与语义对齐能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 15 篇

2512.23897 2026-01-01 cs.NI 88%

Wireless Multimodal Foundation Model (WMFM): Integrating Vision and Communication Modalities for 6G ISAC Systems

无线多模态基础模型(WMFM):为6G ISAC系统集成视觉与通信模态

Mohammad Farzanullah, Han Zhang, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract)

AI总结 本文提出基于对比学习的无线多模态基础模型WMFM,通过联合学习无线信道系数和视觉图像,实现6G ISAC系统的高效多模态学习与应用。

Comments Journal Paper, 13 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13142 2026-01-01 cs.CV cs.CL cs.LG cs.MM cs.RO 82%

Holistic Evaluation of Multimodal LLMs on Spatial Intelligence

多模态大语言模型在空间智能方面的综合评估

Zhongang Cai, Yubo Wang, Qingping Sun, Ruisi Wang, Chenyang Gu, Wanqi Yin, Zhiqian Lin, Zhitao Yang, Chen Wei, Oscar Qian, Hui En Pang, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Jiaqi Li, Xiangyu Fan, Hanming Deng, Lewei Lu, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出EASI框架,用于评估多模态大语言模型在空间智能方面的综合表现,揭示GPT-5在SI中的优势与不足,并展示专有模型在困难任务上的劣势。

Comments Codebase: https://github.com/EvolvingLMMs-Lab/EASI/ ; Leaderboard: https://huggingface.co/spaces/lmms-lab-si/EASI-Leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24605 2026-01-01 cs.CV 79%

MoniRefer: A Real-world Large-scale Multi-modal Dataset based on Roadside Infrastructure for 3D Visual Grounding

MoniRefer: 一种基于道路基础设施的现实世界大规模多模态数据集用于3D视觉定位

Panquan Yang, Junfei Huang, Zongzhangbao Yin, Yingsong Hu, Anni Xu, Xinyi Luo, Xueqi Sun, Hai Wu, Sheng Ao, Zhaoxing Zhu, Chenglu Wen, Cheng Wang

机构 * Xiamen University(厦门大学) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出MoniRefer数据集和Moni3DVG方法,用于解决户外监控场景下的3D视觉定位问题。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17126 2026-01-01 cs.CV cs.LG 79%

MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs

MM-SpuBench:迈向更好地理解多模态大语言模型中伪偏差的深入研究

Wenqian Ye, Bohan Liu, Guangtao Zheng, Di Wang, Yunsheng Ma, Xu Cao, Bolin Lai, James M. Rehg, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MM-SpuBench通过分析多模态大语言模型中的伪偏差,揭示其存在与缓解的挑战,提供公开基准以促进相关技术发展。

Comments Accepted at KDD 2026 (Dataset and Benchmark Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15272 2026-01-01 cs.CL cs.AI cs.CV 75%

OmniBench: Towards The Future of Universal Omni-Language Models

OmniBench: 向通用多语言模型的未来迈进

Yizhi Li, Yinghao Ma, Ge Zhang, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Queen Mary University of London(伦敦大学玛丽女王学院) Hongkong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OmniBench提出了一种评估通用多语言模型三模态处理能力的基准,揭示了现有模型在多模态推理中的不足,并提出OmniInstruct数据集以改进训练方法。

Comments Accepted by The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24119 2026-01-01 cs.CV 74%

GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation

GeoBench: 通过分层评估重新思考多模态几何问题解决

Yuan Feng, Yue Yang, Xiaohan He, Jiatong Zhao, Jianlong Chen, Zijun Chen, Daocheng Fu, Qi Liu, Renqiu Xia, Bo Zhang, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 GeoBench通过分层评估框架,系统评估几何问题解决能力,揭示任务复杂度对性能的影响及子目标分解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24340 2026-01-01 cs.CV cs.AI cs.CL 67%

DermaVQA-DAS: Dermatology Assessment Schema (DAS) & Datasets for Closed-Ended Question Answering & Segmentation in Patient-Generated Dermatology Images

DermaVQA-DAS:皮肤科评估方案(DAS)及用于患者生成皮肤科图像中封闭式问答与分割的数据库

Wen-wai Yim, Yujuan Fu, Asma Ben Abacha, Meliha Yetisgen, Noel Codella, Roberto Andres Novoa, Josep Malvehy

机构 * Microsoft Health AI(微软健康人工智能) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Hospital Clinic of Barcelona(巴塞罗那医院诊所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DermaVQA-DAS引入了皮肤科评估方案DAS,支持封闭式问答与分割任务,通过专家标注数据集和多模态模型评估,提升患者为中心的皮肤科视觉语言模型研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23739 2026-01-01 cs.CL cs.AI cs.CV cs.RO 67%

Break Out the Silverware -- Semantic Understanding of Stored Household Items

拿出银器——对存储家居物品的语义理解

Michaela Levi-Richter, Reuth Mirsky, Oren Glickman

机构 * Bar Ilan University, Computer Science Department(巴伊兰大学计算机科学系) Tufts University, Department of Computer Science(塔夫茨大学计算机科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究提出NOAM模型,通过结合结构化场景理解和大语言模型推理,实现对家庭物品存储位置的语义理解,显著提升预测准确率并接近人类水平。

Comments Poster presented at the Israeli Seminar on Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23380 2026-01-01 cs.LG cs.AI cs.CV cs.NI cs.OS 62%

A unified framework for detecting point and collective anomalies in operating system logs via collaborative transformers

通过协作变换器统一检测操作系统日志中的点异常和集体异常的框架

Mohammad Nasirzadeh, Jafar Tahmoresnezhad, Parviz Rashidi-Khazaee

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CoLog通过协作变换器统一检测操作系统日志中的点异常和集体异常,实现高精度和召回率。

Comments 72 pages, 19 figures, 19 tables, accepted in scientific reports on 5 November 2025

Journal ref Scientific Reports 15, 45698 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23415 2026-01-01 cs.CV 57%

Towards Generalisable Foundation Models for Brain MRI

面向脑部MRI的通用基础模型

Moona Mazher, Geoff J. M. Parker, Daniel C. Alexander

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 BrainFound是一种针对脑部MRI设计的通用基础模型,通过扩展DINO-v2实现3D脑解剖建模,支持多模态输入并提升诊断准确性,适用于多种临床场景和研究应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24896 2026-01-01 cs.AI 57%

Semi-Automated Data Annotation in Multisensor Datasets for Autonomous Vehicle Testing

多传感器数据集中的半自动化标注:自动驾驶测试应用

Andrii Gamalii, Daniel Górniak, Robert Nowak, Bartłomiej Olber, Krystian Radlak, Jakub Winter

机构 * Warsaw University of Technology, Warsaw, Poland(华沙技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种半自动化数据标注方法,结合AI与人类专业知识,用于高效标注多传感器数据集,以支持波兰自动驾驶研究。

详情

展开后加载摘要…

URL PDF HTML 收藏