arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-23 至 2026-01-23 共收录 50 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2601.16108 2026-01-23 cs.AI 74%

Multimodal Climate Disinformation Detection: Integrating Vision-Language Models with External Knowledge Sources

多模态气候虚假信息检测:整合视觉-语言模型与外部知识源

Marzieh Adeli Shamsabad, Hamed Ghodrati

机构 * CRIM

专题命中 图文多模态 :multimodal(title);分类 cs.AI

AI总结 本文提出整合视觉-语言模型与外部知识源,以提升多模态气候虚假信息检测的准确性与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01747 2026-01-23 cs.CR cs.AI cs.CV cs.LG 62%

Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization

为大型视觉-语言模型设计对抗输入使用黑盒优化

Jiwei Guan, Haibo Jin, Haohan Wang

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。

Comments EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15949 2026-01-23 cs.AI astro-ph.IM 57%

Natural Language-Driven Global Mapping of Martian Landforms

基于自然语言的火星地表全球映射

Yiran Wang, Shuoyuan Wang, Zhaoran Wei, Jiannan Zhao, Zhonghua Yao, Zejian Xie, Songxin Zhang, Jun Huang, Bingyi Jing, Hongxin Wei

机构 * School of Science, Southern University of Science and Technology(南方科技大学科学学院) China University of Geosciences(中国地质大学) University of Hong Kong(香港大学) Hubei Key Laboratory of Planetary Geology, China University of Geosciences(湖北省行星地质重点实验室,中国地质大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.AI

AI总结 MarScope通过自然语言驱动的视觉-语言框架,实现了火星地表的全球映射,实现了高效、灵活的地质分析和大规模数据探索。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2509.16994 2026-01-23 eess.AS cs.MM eess.IV 84%

Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention

关注式AV融合网络:基于混合注意力的音频-视觉质量预测

Ina Salaj, Arijit Biswas

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 本文提出一种结合学习音频特征和手工设计视频特征的混合注意力模型,用于提升音频-视觉质量预测的准确性和鲁棒性。

Comments Accepted to 51st IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 04-08 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2601.06037 2026-01-23 cs.CL cs.AI cs.CV 82%

TeleMem: Building Long-Term and Multimodal Memory for Agentic AI

TeleMem: 构建面向代理AI的长期和多模态记忆

Chunliang Chen, Ming Guan, Xiao Lin, Jiaxu Li, Luxi Lin, Qiyi Wang, Xiangyu Chen, Jixiang Luo, Changzhi Sun, Dell Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 TeleMem通过统一的长期和多模态记忆系统,提升代理AI在长对话和多模态任务中的表现,实现更高的准确率、更低的令牌使用和更快的操作速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15549 2026-01-23 cs.CV cs.AI 73%

VIOLA: Towards Video In-Context Learning with Minimal Annotations

VIOLA:迈向最小标注的视频情境学习

Ryo Fujii, Hideo Saito, Ryo Hachiuma

机构 * Keio University(Keio大学) Keio AI Research Center(Keio人工智能研究中心) NVIDIA(NVIDIA公司)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 VIOLA通过结合最小专家监督和大量未标注数据,实现高效视频情境学习,显著提升低资源环境下的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15655 2026-01-23 cs.CV cs.AI 62%

Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams

Event-VStream: 基于事件驱动的长视频流实时理解

Zhenghui Guo, Yuanbin Man, Junyuan Sheng, Bowen Lin, Ahmed Ahmed, Bo Jiang, Boyuan Zhang, Miao Yin, Sian Jin, Omprakash Gnawal, Chengming Zhang

机构 * University of Houston(德克萨斯大学休斯顿分校) The University of Texas at Arlington(德克萨斯理工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校) Temple University(特拉华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Event-VStream通过事件感知框架实现长视频流的实时理解,利用事件序列进行语义连贯的处理,提升性能并保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11551 2026-01-23 cs.CV cs.IR cs.LG 57%

Multi-event Video-Text Retrieval

多事件视频-文本检索

Gengyuan Zhang, Jisen Ren, Jindong Gu, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出多事件视频-文本检索任务,设计Me-Retriever模型,通过关键事件表示和新损失函数提升视频-文本检索性能。

Comments [fixed typos in equations] accepted to ICCV2023 Poster; some figures are not supported when viewed online, please download the file and view locally

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09822 2026-01-23 cs.RO 50%

Multi-Layered Reasoning from a Single Viewpoint for Learning See-Through Grasping

从单一视角进行多层推理以学习透视抓取

Fang Wan, Chaoyang Song

机构 * Southern University of Science and Technology(南方科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究提出了一种基于视觉的透视感知架构,通过单一视觉输入实现多模态感知,无需外部摄像头或力传感器即可学习反应抓取。

Comments 39 pages, 13 figures, 2 tables, for supplementary videos, see https://bionicdl.ancorasir.com/?p=1658, for opensourced codes, see https://github.com/ancorasir/SeeThruFinger

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 6 篇

2601.15643 2026-01-23 cs.CV 83%

Evolving Without Ending: Unifying Multimodal Incremental Learning for Continual Panoptic Perception

无止境的进化:统一多模态增量学习以实现持续全景感知

Bo Yuan, Danpei Zhao, Wentao Li, Tian Li, Zhiguo Jiang

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种统一多模态和多任务持续学习的持续全景感知模型,通过跨模态编码器和可变知识继承模块解决灾难性遗忘问题,并在多任务增量场景中实现模型进化。

Comments arXiv admin note: substantial text overlap with arXiv:2407.14242

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15820 2026-01-23 cs.CL 79%

ExDR: Explanation-driven Dynamic Retrieval Enhancement for Multimodal Fake News Detection

ExDR:基于解释的动态检索增强多模态虚假新闻检测

Guoxuan Ding, Yuqing Li, Ziyan Zhou, Zheng Lin, Daren Zha, Jiangnan Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) WeChat AI, Tencent(微信AI,腾讯)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 ExDR通过基于解释的动态检索增强生成框架,提升多模态虚假新闻检测的准确性和泛化能力。

Comments 11 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23709 2026-01-23 cs.CV cs.AI cs.LG 76%

Skin Lesion Phenotyping via Nested Multi-modal Contrastive Learning

通过嵌套多模态对比学习进行皮肤病变表型分析

Dionysis Christopoulos, Sotiris Spanos, Eirini Baltzi, Valsamis Ntouskos, Konstantinos Karantzalos

专题命中 跨模态检索 :multi-modal(title);分类 cs.CV、cs.AI

AI总结 SLIMP通过嵌套多模态对比学习,结合图像与元数据提升皮肤病变分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16125 2026-01-23 cs.CV cs.CL cs.IR 62%

Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing

重新思考组合图像检索评估:从图像编辑中获得的细粒度基准

Tingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Tongyi Lab, Alibaba Group(阿里云实验室) UCAS(中国科学院大学) HKUST(GZ)(香港科技大学(广州)) NTU(国立新加坡大学) Yale(耶鲁大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出EDIR细粒度CIR基准,通过图像编辑技术生成多样化查询,揭示现有模型在多模态任务中的能力差距与局限性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11393 2026-01-23 cs.CV 57%

Heterogeneous Uncertainty-Guided Composed Image Retrieval with Fine-Grained Probabilistic Learning

异质不确定性引导的复合图像检索与细粒度概率学习

Haomiao Tang, Jinpeng Wang, Minyi Zhao, Guanghao Meng, Ruisheng Luo, Long Chen, Shu-Tao Xia

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出异质不确定性引导范式,通过细粒度概率学习提升复合图像检索的鲁棒性和准确性。

Comments Accepted for publication and oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04259 2026-01-23 cs.HC cs.CY 50%

Cognitive AI framework 2.0: advances in the simulation of human thought

认知AI框架2.0:人类思维模拟的进展

Rommel Salas-Guerra

专题命中 跨模态检索 :multimodal(abstract)

AI总结 认知AI框架2.0通过统一的记忆架构和受控的知识更新,提升人机交互的个性化与适应性,解决可扩展性、偏见缓解和伦理合规等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 12 篇

2601.15906 2026-01-23 cs.CV 88%

Opening the Black Box: Preliminary Insights into Affective Modeling in Multimodal Foundation Models

揭开黑箱:多模态基础模型中情感建模的初步洞察

Zhen Zhang, Runhao Zeng, Sicheng Zhao, Xiping Hu

机构 * Shenzhen MSU-BIT University, Shenzhen, China(深圳MSU-BIT大学) Tsinghua University, Beijing, China(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

AI总结 本研究揭示多模态基础模型中情感建模的关键机制,发现前馈门控投影模块对情感理解和生成至关重要,通过参数高效调整实现高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15698 2026-01-23 cs.CV cs.AI 84%

Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs

超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持

Mingyu Yu, Lana Liu, Zhehao Zhao, Wei Wang, Sujuan Qin

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04548 2026-01-23 cs.CV 79%

Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model

Skywork UniPic 2.0: 通过在线强化学习构建 Kontext 模型以实现统一多模态模型

Hongyang Wei, Baixin Xu, Hongbo Liu, Size Wu, Jie Liu, Yi Peng, Peiyu Wang, Zexiang Liu, Jingwen He, Yidan Xietian, Chuanxin Tang, Zidong Wang, Yichen Wei, Liang Hu, Boyi Jiang, Wei Li, Ying He, Yang Liu, Xuchen Song, Yangguang Li, Yahui Zhou

机构 * Skywork Multimodality Team(Skywork多模态团队)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Skywork UniPic 2.0 通过在线强化学习构建 Kontext 模型,实现统一多模态模型,提升图像生成与编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15392 2026-01-23 cs.AI cs.CV cs.LG 76%

GeMM-GAN: A Multimodal Generative Model Conditioned on Histopathology Images and Clinical Descriptions for Gene Expression Profile Generation

GeMM-GAN: 一种基于组织病理图像和临床描述的多模态生成模型,用于基因表达谱生成

Francesca Pia Panaccione, Carlo Sgaravatti, Pietro Pinoli

专题命中 多模态生成 :multimodal(title);分类 cs.CV、cs.AI

AI总结 GeMM-GAN通过结合图像和文本信息生成逼真的基因表达谱,提升疾病预测准确性。

Comments 12 pages, 2 figures. Published at Image Analysis and Processing - ICIAP 2025 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15624 2026-01-23 cs.CV 70%

Explainable Deepfake Detection with RL Enhanced Self-Blended Images

可解释的深度伪造检测与强化学习增强的自混合图像

Ning Jiang, Dingheng Zeng, Yanhong Liu, Haiyang Yi, Shijie Yu, Minghe Weng, Haifeng Shen, Ying Li

机构 * 1School of Software \& Microelectronics, Peking University, Beijing, China 2Mashang Consumer Finance Co., Ltd., Chongqing, China -0.15in

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于强化学习增强的自混合图像方法,用于可解释的深度伪造检测,通过自动化数据生成和定制奖励机制提升检测性能。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16007 2026-01-23 cs.CV cs.AI 62%

PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models

PhysicsMind: 为基础多模态大语言模型和世界模型中的物理推理和预测进行仿真与现实力学基准测试

Chak-Wing Mak, Guanyu Zhu, Boyi Zhang, Hongji Li, Xiaowei Chi, Kevin Zhang, Yichen Wu, Yangfan He, Chun-Kai Fan, Wentao Lu, Kuangzhi Ge, Xinyu Fang, Hongyang He, Kuan Lu, Tianxiang Xu, Li Zhang, Yongxin Ni, Youhua Li, Shanghang Zhang

机构 * Peking University(北京大学) Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) National University of Singapore(新加坡国立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学) Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PhysicsMind是一个结合现实和仿真环境的统一基准,用于评估基础多模态大语言模型和世界模型在物理推理和预测中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15664 2026-01-23 cs.CV cs.AI 62%

Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling

Skywork UniPic 3.0:通过序列建模实现统一的多图像合成

Hongyang Wei, Hongbo Liu, Zidong Wang, Yi Peng, Baixin Xu, Size Wu, Xuying Zhang, Xianglong He, Zexiang Liu, Peiyu Wang, Xuchen Song, Yangguang Li, Yang Liu, Yahui Zhou

机构 * Skywork

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Skywork UniPic 3.0通过序列建模实现统一的多图像合成,采用新颖的训练范式和高效的数据流程,在单图像编辑和多图像合成任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16208 2026-01-23 cs.CV 57%

Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders

通过表征自编码器扩展文本到图像扩散变换器

Shengbang Tong, Boyang Zheng, Ziteng Wang, Bingda Tang, Nanye Ma, Ellis Brown, Jihan Yang, Rob Fergus, Yann LeCun, Saining Xie

机构 * New York University(纽约大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。

Comments website: https://rae-dit.github.io/scale-rae/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16024 2026-01-23 cs.CV 57%

PAINT: Pathology-Aware Integrated Next-Scale Transformation for Virtual Immunohistochemistry

PAINT: 用于虚拟免疫组化病理学的路径感知集成下尺度转换

Rongze Ma, Mengkang Lu, Zhenyu Xiang, Yongsheng Pan, Yicheng Wu, Qingjie Zeng, Yong Xia

机构 * School of Computer Science and Engineering, Northwestern Polytechnical University(计算机科学与工程学院,西北工业大学) Monash University(墨尔本大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 PAINT通过结构优先的自回归框架,提升虚拟免疫组化合成的结构保真度和临床应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15729 2026-01-23 cs.RO cs.AI cs.SY eess.SY 57%

DualShield: Safe Model Predictive Diffusion via Reachability Analysis for Interactive Autonomous Driving

DualShield: 通过可达性分析实现交互式自动驾驶的安全模型预测扩散

Rui Yang, Lei Zheng, Ruoyu Yao, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科学与技术大学(广州))

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 DualShield通过可达性分析实现交互式自动驾驶的安全模型预测扩散,结合前瞻性指导和反应性安全防护,提升安全性和任务效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15578 2026-01-23 cs.NI cs.AI cs.LG cs.RO 57%

MapViT: A Two-Stage ViT-Based Framework for Real-Time Radio Quality Map Prediction in Dynamic Environments

MapViT:一种基于视觉Transformer的两阶段框架,用于动态环境中实时无线电质量地图预测

Cyril Shih-Huan Hsu, Xi Li, Lanfranco Zanzi, Zhiheng Yang, Chrysa Papagianni, Xavier Costa Pérez

机构 * Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) NEC Laboratories Europe(NEC欧洲实验室) i2CAT Foundation(i2CAT基金会) Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级研究机构(ICREA))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 MapViT通过两阶段ViT框架实现实时动态环境中无线信号质量预测,结合预训练和微调方法提升准确性和效率,适用于资源受限的移动机器人场景。

Comments This paper has been accepted for publication at IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08893 2026-01-23 cs.LG cs.CL 57%

Spectral Generative Flow Models: A Physics-Inspired Replacement for Vectorized Large Language Models

谱生成流模型:一种受物理启发的向量大语言模型替代方案

Andrew Kiruluta

机构 * UC Berkeley(伯克利大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 谱生成流模型通过物理启发的连续场演化机制,替代传统向量大语言模型,实现长程一致性、多模态通用性和物理结构归纳偏置。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2601.15487 2026-01-23 cs.AI cs.CL cs.MA 81%

MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation

MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统

Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

机构 * ABB Inc(ABB公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。

Comments 12 pages, 2 figures, Submitted to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21143 2026-01-23 cs.CL cs.CV 81%

The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?

感知挑战:多模态大语言模型能否解决简单感知问题?

Samrajnee Ghosh, Naman Agarwal, Hemanshu Garg, Chinmay Mittal, Mausam, Parag Singla

机构 * IIT Delhi(德里印度理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 Percept-V挑战通过简单感知任务测试多模态大语言模型的表现,发现其在基本感知任务上远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10883 2026-01-23 cs.AI cs.CL 81%

Chat-TS: Enhancing Multi-Modal Reasoning Over Time-Series and Natural Language Data

Chat-TS: 提升时间序列与自然语言数据的多模态推理能力

Paul Quinlan, Qingguo Li, Xiaodan Zhu

机构 * Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程学院) Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程学院) Ingenuity Labs Research Institute, Queen’s University(皇后大学创新实验室研究 institute)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Chat-TS通过整合时间序列标记提升多模态推理能力,提供新数据集和训练策略,在保持自然语言能力的同时增强时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏