arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-24 至 2026-08-24 共收录 64 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2608.20525 2026-08-24 cs.DB 新提交 50%

Bolo: Verified Model Hub for Next-Generation AI Databases

Bolo:面向下一代AI数据库的经验证的模型中心

Yunqi Li, Ila Petrovic, Yongjoo Park

专题命中 多模态生成 :multi-modal(abstract)

AI总结 该研究针对现有模型平台无法满足AI数据库需求的问题,提出基于多阶段智能体系统的Bolo模型平台,可将不可用模型权重转化为经验证的可用推理流水线,在实验中取得良好效果。

Comments 5 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 15 篇

2608.20944 2026-08-24 cs.CV 新提交 83%

SuppreSensing: Expert-Guided Feature Recalibration and Discrepancy Augmentation for Multimodal Object Detection

SuppreSensing:面向多模态目标检测的专家引导特征重校准与差异增强

Xin Wu, Zhenyu Gao, Qiankun Zhang, Shaoyong Guo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对遥感多模态目标检测的语义异质性与模态噪声问题,本文提出SuppreSensing,通过EMFR模块、差异增强策略和ECFP模块实现最优性能,在多个数据集上达到SOTA并具备良好泛化性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20905 2026-08-24 cs.CV 新提交 83%

EmotionDialogCN: A Spontaneous Multimodal Dataset for Mandarin Emotional Dialogue

EmotionDialogCN:面向普通话情感对话的自发多模态数据集

Yi Zheng, Yifan Xu, Yan Zhou, Hejia Chen, Chunyu Qiang, Xiaoqiang Liu, Xiaohan Li, Shenze Huang, Yue Zhang, Guoying Zhao, Pengfei Wan

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 该研究推出EmotionDialogCN数据集,其规模大、情感分布贴合真实情况,采用新型采集框架减少设备干扰,可支撑多模态情感相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16633 2026-08-24 cs.CL cs.AI cs.MM 版本更新 82%

GeoExplain: Multimodal Reasoning based on Hierarchy of Visual Information in Street View

GeoExplain:基于街景图像视觉信息层次的多模态推理

Fenghua Cheng, Jinxiang Wang, Sen Wang, Zi Huang, Xue Li

机构 * The University of Queensland(昆士兰大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 针对现有多模态推理任务缺乏对不同粒度视觉线索推理的研究缺口,提出GeoExplain数据集与SightSense方法,实现街景图像的地理定位预测与可解释性说明,且方法在该数据集上表现优异。

Comments Updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20874 2026-08-24 cs.CV cs.RO 新提交 79%

Multi-Modal Traffic Sign Detection with Semantic Attributes for Autonomous Driving

面向自动驾驶的结合语义属性的多模态交通标志检测

Meda Lazar, Sourab Sridhar, Shashwata Gupta, Alexandra Tripcea, Varun Ravi, Senthil Yogamani

机构 * Arriver System Software S.r.l.(Arriver系统软件有限责任公司) Qualcomm Auto Ltd Sweden Filial(高通汽车有限公司瑞典分公司) Qualcomm Auto Ltd.(高通汽车有限公司) Qualcomm Technologies, Inc(高通技术公司)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 针对自动驾驶中交通标志检测的跨区域泛化差、远距离小目标检测弱、跟踪易受透视畸变影响的问题,提出多模态框架,结合LiDAR与相机,引入强度感知可变形融合模块、双运动模型跟踪器及语义属性分类流水线,在多国数据集上取得低漏检率,实现全球可泛化的商用级交通标志感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20384 2026-08-24 cs.AI 新提交 79%

Interpretable Multimodal Classification with Linear Discriminant Tree Ensembles

基于线性判别树集成的可解释多模态分类

Mojtaba Moattari

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究针对多模态分类器需平衡准确率与可解释性的需求,提出基于线性判别树集成的框架,在多模态情感行为分类任务中实现了优于基线模型的性能与更高的人类标注一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01626 2026-08-24 cs.DB 版本更新 78%

CogPic: A Multimodal Dataset for Early Cognitive Impairment Assessment via Picture Description Tasks

CogPic:一种通过图片描述任务进行早期认知障碍评估的多模态数据集

Liuyu Wu, Rui Feng, Jie Li, Wentao Xiang, Yi Zhang, Yin Cao, Siyang Song, Xiao Gu, Jianqing Li, Wei Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出CogPic数据集,用于通过图片描述任务进行早期认知障碍评估,该数据集包含同步的音频、视觉和语言数据,由专家神经心理学家进行临床验证,为多模态研究提供了坚实基础。

Comments 11 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20984 2026-08-24 cs.CV cs.CL cs.CY 新提交 62%

MigrationNarrate: A Dataset for Detection of Migration Narratives in YouTube Videos

MigrationNarrate:用于检测YouTube视频中移民叙事的数据集

Fatima Haouari, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 该研究推出首个用于检测英国移民叙事的多模态数据集MigrationNarrate,包含1115个YouTube视频字幕,结合预训练编码器与大语言模型开展基准测试,为移民叙事检测研究提供关键资源。

Comments This work was accepted to the main conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21360 2026-08-24 cs.CV 新提交 57%

OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

OmniAssistBench:面向全模态大语言模型(Omni-LLMs)的助手式交互基准

Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan

机构 * Nankai University(南开大学) University of Waterloo(滑铁卢大学) Nanjing University(南京大学)

专题命中 多模态评测 :omni-modal(abstract);分类 cs.CV

AI总结 针对全模态大语言模型助手式交互的评估瓶颈,构建OmniAssistBench数据集,实验显示Gemini-3-Pro、Qwen3-Omni-Instruct表现存在差距,当前模型在多轮交互等方面仍有不足。

Comments Project page: this https URL (https://xianyunsun.github.io/OmniAssistBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20851 2026-08-24 cs.SE cs.AI 新提交 57%

BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP

BC-Bench:在ERP领域特定语言中评估智能体工程

Haoran Sun, Klaus Marius Hansen

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究推出BC-Bench基准,评估智能体工程在ERP领域DSL(AL)上的表现,发现通用基准的改进未一致迁移到AL,凸显领域特定评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 57%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20807 2026-08-24 cs.AI cs.HC cs.LG 新提交 57%

Neuro-Geospatial Modelling of EEG Affective States Using Literature-Informed Environmental Context

基于文献先验环境上下文的脑电情感状态神经地理空间建模

Utsav Poudel, Jagannath Aryal, Subramaniyaswamy Vairavasundaram

机构 * The University of Melbourne(墨尔本大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出双塔式架构融合EEG-Conformer与图环境编码器,利用文献先验环境上下文提升EEG情感分类性能,在EAV基准上准确率达76.2%,为相关联合研究提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20713 2026-08-24 cs.CV 新提交 57%

AGIDefect-4K: A Richly Annotated Dataset for AI-Generated Image Defect Detection, Localization and Explanation

AGIDefect-4K:用于AI生成图像缺陷检测、定位与解释的富标注数据集

Xiangfei Sheng, Weidong Zou, Tianjiao Gu, Zhichao Yang, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文推出含4000张图像的AGIDefect-4K数据集,并提出基于多模态大语言模型的AGIDA基准框架,用于AGI缺陷检测、定位、解释及质量预测,凸显了AGI缺陷理解研究的价值。

Comments 8 pages, 6 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-24 cs.HC cs.AI 版本更新 57%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13400 2026-08-24 cs.CV 版本更新 57%

What Color Is the Text? A Benchmark for Hallucination Induced by Image-Embedded Prompt

文本是什么颜色?:一个用于评估图像嵌入提示引发幻觉的基准

Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(软件学院、人工智能研究院、北航、北京、中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University, Beijing, China(未来区块链与隐私计算先进创新中心、北航、北京、中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出Embedded Stroop范式,构建WCIT基准评估MLLMs的图像嵌入提示幻觉,发现语义可读性可主导其视觉颜色感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20983 2026-08-24 cs.SI cs.HC 新提交 50%

Beyond Truth Discovery: A Two-Stage Framework to Assess the Severity of False Claim during Disasters

超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架

Ruichen Yao, Tejna Dasari, Gulshat Baispay, Aizhan Zaurbek, Yifan Liu, Yaokun Liu, Zelin Li, Dong Wang

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。

Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 8 篇

2608.20549 2026-08-24 cs.AI 新提交 79%

Volumetric Radiology AI in the Era of Multimodal Large Language Models

多模态大语言模型时代的容积放射学人工智能

Zanting Ye, Shengyuan Liu, Xin Liu, Chenhui Wang, Zhisong Wang, Jiashuai Liu, Zipei Wang, Cheng Wang, Wentao Pan, Mengjie Fang, Di Dong, Mohammad Salmanpour, Arman Rahmim, Yu Gu, Yong Xia, Hongming Shan, Yixuan Yuan, Yefeng Zheng, Lijun Lu

机构 * Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Xi’an Jiaotong University(西安交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southern Medical University(南方医科大学) The Chinese University of Hong Kong(香港中文大学) University of British Columbia(不列颠哥伦比亚大学) Microsoft Research(微软研究院) Westlake University(西湖大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 该综述梳理截至2026年7月的200余篇文献,探讨多模态大语言模型时代容积放射学AI的表征、智能体系统及临床评估,提出相关框架以明确原生容积建模的适用场景。

Comments 9 Figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20389 2026-08-24 cs.AI 新提交 79%

Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness

表征影响检索:多模态智能体框架中技能发现与路由的案例研究

Kevin Dela Rosa

机构 * Cloudglue USA(美国Cloudglue公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 该研究以多模态智能体框架Tinycloud为案例,发现提示内技能的部分暴露会产生词汇竞争,抑制正确技能选择,其为大规模技能路由提供了小规模视角。

Comments 5 pages, 1 figure, 3 tables. Accepted at AgentSearch '26 workshop at SIGIR 2026 (Melbourne, Australia, July 24, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20379 2026-08-24 cs.AI 新提交 79%

A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications

多模态智能体框架的基础与前沿:技术及应用综述

Neel Mokaria, Rishie Raj, Dheeraj Baiju, Xiaoqian Shen, Shraman Pramanick, Kevin Qinghong Lin, Arda Senocak, Mike Zheng Shou, Philip Torr, Mohamed Elhoseiny, Yapeng Tian, Ruohan Gao, Salman Khan, Sayan Nag, Sanjoy Chowdhury, Dinesh Manocha

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本综述针对多模态在智能体框架核心模块的作用展开系统分析,梳理了其架构整合方式、应用领域及效率权衡,为通用智能系统研究指明方向。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20890 2026-08-24 cs.CV cs.RO 新提交 77%

A Collaborative Multi-Modality Interaction for VLA-based End-to-End Autonomous Driving

面向基于视觉-语言-动作(VLA)的端到端自动驾驶的协同多模态交互

Jingtao Sun, Xiaohai He, Yike Zhang, Dong Huang, Yaonan Wang, Ajmal Mian, Mike Zheng Shou

机构 * National University of Singapore (NUS)(新加坡国立大学) Hunan University(湖南大学) The University of Western Australia (UWA)(西澳大学)

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文针对现有VLA自动驾驶模型决策不可靠、多模态交互不足的问题,提出含三类核心组件的多模态交互与多轨迹规划系统,实验显示其在安全推理与场景感知上优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20975 2026-08-24 cs.AI 新提交 70%

Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models

无行为的信念:测量视觉-语言模型中心智理论到协同社会行动的转化

Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf

机构 * CIAMS, Université Paris-Saclay(巴黎萨克雷大学 CIAMS) CQSB, Sorbonne Université(索邦大学 CQSB)

专题命中 多模态Agent :multimodal(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出基准MOSAIC评估视觉-语言模型的心智理论到协同社会行动的转化,发现多数模型存在瓶颈,而带显式ToM模块的PCM-LLM表现优异,证实显式信念-行动耦合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20481 2026-08-24 cs.CR cs.AI 新提交 57%

AEGIS: Preventing Cross-Domain Resource Abuse in MCP

AEGIS:防止MCP中的跨域资源滥用

Shriti Priya, Teryl Taylor, Frederico Araujo

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20521 2026-08-24 physics.ed-ph cs.AI cs.CY 新提交 57%

Large Scale AI Grading of Handwritten Physics Assessments: Score Agreement and Olympiad Team Selection Outcomes

大规模AI手写物理评估评分:评分一致性与奥林匹克团队选拔结果

Praveen Pathak, Siddharth Tiwary, Charudatt Kadolkar, Vijay Singh, David Rakestraw, Shirish Pathare, Anwesh Mazumdar

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究评估基于GPT-5.5的AI对三类物理手写评估的评分表现,其与官方评分相关性高且能准确选拔奥林匹克团队,第二轮评分优化了一致性,AI评分可作为考官控制下的辅助评分工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06607 2026-08-24 cs.CR 版本更新 50%

Your Harness is Not Secure: Benchmarking Real-world Threat of Command Line Interface Agent

你的工具不安全:评测命令行界面智能体的现实威胁

Weidi Luo, Qiming Zhang, Tianyu Lu, Xiaogeng Liu, Bin Hu, Hung-Chun Chiu, Siyuan Ma, Yizhe Zhang, Xusheng Xiao, Yinzhi Cao, Zhen Xiang, Chaowei Xiao

专题命中 多模态Agent :multimodal(abstract)

AI总结 该研究针对CLI智能体滥用风险,推出与MITRE ATT&CK对齐的AdvCLI基准测试,评估7款CLI智能体后发现其常越过拒绝边界,可完成部分恶意OS级任务,为开发安全机制提供测试平台。

Comments Accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 9 篇

2608.21100 2026-08-24 cs.AI 新提交 89%

ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

ReFrame:多模态大语言模型中基于证据的测试时安全对齐

Wenzheng Jiang, Xuankun Rong, Yuanzhao Zhai, Dawei Feng, Huaimin Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.AI

AI总结 该研究针对现有多模态安全对齐方法不适用于闭源模型的问题,提出无需训练的ReFrame框架,通过两个智能体协作实现测试时安全对齐,在提升安全性能的同时保留多模态效用。

Comments Accepted to EMNLP 2026. 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21290 2026-08-24 cs.RO cs.CV 新提交 85%

VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation

VT-MUSE:面向操作任务的多模态统一时序视觉-触觉表示学习

Congsheng Xu, Qiaochu Yang, Fangyuan Shi, Yifan Han, Baijun Chen, Yiming Wang, Haonan Zhao, Daolin Ma, Xiaokang Yang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Xense Robotics(Xense机器人公司) BUPT(北京邮电大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出VT-MUSE视觉-触觉多模态统一时序表示学习框架,通过两阶段学习解决现有方法的跨模态依赖捕获与时序接触演化忽略问题,在仿真和真实操作任务中性能优于基线

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20999 2026-08-24 cs.CV 新提交 85%

Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs

潜在有序证据与未对齐输出:多模态大语言模型的推理时有序视角对齐

Haiming Li, Yingsheng Liu, Jingmin Zhu, Siyuan Yan, Xieji Li, Jiajun Sun, Zhen Yu, Zongyuan Ge

机构 * Monash University(莫纳什大学) Faculty of Information Technology, Monash University(莫纳什大学信息技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型有序输出未对齐问题,本文提出推理时的Ordinal Lens Alignment方法,提升有序回归任务性能且优于现有基线。

Comments EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21099 2026-08-24 cs.CV cs.AI 新提交 84%

A2DINOv3: Rethinking Multi-Modal Object Detection via Socialized Collaboration

A2DINOv3:通过社会化协作重新思考多模态目标检测

Jiekang Feng, Zhihe Fan, Yunqi Zhu, Xinjie Yao, Yueying Zhang, Yike Gao, Ranxin Li, Guanzuo Chen

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出A2DINOv3框架,通过社会化协作协议让RGB与红外分支以异构专家模式选择性交互,结合零初始化策略,在四个多模态基准上实现了多模态目标检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20958 2026-08-24 cs.AI cs.CV 新提交 81%

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

TLive-Omni:面向电商直播的全模态理解模型

Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen, Yongdong Luo, Zhuoqun Liu, Meiguang Jin, Junfeng Ma

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 多模态训练与对齐 :omni-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出专为电商直播设计的全模态理解模型TLive-Omni,通过引入Per-vGrid等技术,结合多阶段训练流程,在电商直播基准任务上表现强劲且泛化能力出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20969 2026-08-24 cs.CV 新提交 79%

Kinematic Knowledge Maps for Pattern Alignment: Structured Latent Representational Learning in Multimodal Gait Analysis

用于模式对齐的运动学知识图谱:多模态步态分析中的结构化潜在表示学习

Chen Dong, He Zonglin, Cheung Kenneth M.C

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出ScoliDetect框架,通过运动学知识图谱(KKM)实现多模态步态分析,其介导的融合结合三模态对比预训练提升了脊柱侧凸筛查的泛化性与可解释性,外部ROC-AUC达0.972。

详情

展开后加载摘要…

URL PDF HTML 收藏