arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2409.14978 2025-01-09 cs.AI 57%

TS-HTFA: Advancing Time Series Forecasting via Hierarchical Text-Free Alignment with Large Language Models

Pengfei Wang, Huanran Zheng, Qi'ao Xu, Silong Dai, Yiqiao Wang, Wenjing Yue, Wei Zhu, Tianwen Qian, Xiaoling Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15286 2025-01-08 cs.CV 57%

3D Annotation-Free Learning by Distilling 2D Open-Vocabulary Segmentation Models for Autonomous Driving

Boyi Sun, Yuhang Liu, Xingxia Wang, Bin Tian, Long Chen, Fei-Yue Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 15 pages, 7 figures, codes are available at https://github.com/sbysbysbys/AFOV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02858 2025-01-07 cs.CV 57%

A Novel Vision Transformer for Camera-LiDAR Fusion based Traffic Object Segmentation

Toomas Tahves, Junyi Gu, Mauro Bellone, Raivo Sell

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments International Conference on Agents and Artificial Intelligence 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02032 2025-01-07 cs.CR cs.AI cs.SE 57%

Dynamic Feature Fusion: Combining Global Graph Structures and Local Semantics for Blockchain Fraud Detection

Zhang Sheng, Liangliang Song, Yanbin Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02025 2025-01-07 cs.LG cs.CV q-bio.QM 57%

RealDiffFusionNet: Neural Controlled Differential Equation Informed Multi-Head Attention Fusion Networks for Disease Progression Modeling Using Real-World Data

Aashish Cheruvu, Nathaniel Rigoni

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00851 2025-01-07 cs.CV 57%

Scale-wise Bidirectional Alignment Network for Referring Remote Sensing Image Segmentation

Kun Li, George Vosselman, Michael Ying Yang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01529 2025-01-06 cs.CV 57%

SAFER: Sharpness Aware layer-selective Finetuning for Enhanced Robustness in vision transformers

Bhavna Gopal, Huanrui Yang, Mark Horton, Yiran Chen

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00877 2025-01-06 cs.CV 57%

FGAseg: Fine-Grained Pixel-Text Alignment for Open-Vocabulary Semantic Segmentation

Bingyu Li, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20645 2024-12-31 cs.CV 57%

YOLO-UniOW: Efficient Universal Open-World Object Detection

Lihao Liu, Juexiao Feng, Hui Chen, Ao Wang, Lin Song, Jungong Han, Guiguang Ding

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20162 2024-12-31 cs.CV 57%

Multi-Modality Driven LoRA for Adverse Condition Depth Estimation

Guanglei Yang, Rui Tian, Yongqiang Zhang, Zhun Zhong, Yongqiang Li, Wangmeng Zuo

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19449 2024-12-30 cs.CL 57%

Feature Alignment-Based Knowledge Distillation for Efficient Compression of Large Language Models

Shuo Wang, Chihang Wang, Jia Gao, Zhen Qi, Hongye Zheng, Xiaoxuan Liao

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19138 2024-12-30 cs.CV cs.LG 57%

SUTrack: Towards Simple and Unified Single Object Tracking

Xin Chen, Ben Kang, Wanting Geng, Jiawen Zhu, Yi Liu, Dong Wang, Huchuan Lu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02415 2024-12-30 cs.CV 57%

Local Map Construction with SDMap: A Comprehensive Survey

Jiaqi Li, Pingfan Jia, Jiaxing Chen, Jiaxi Liu, Lei He, Keqiang Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 18 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18842 2024-12-30 cs.CV cs.LG 57%

Context-Based Semantic-Aware Alignment for Semi-Supervised Multi-Label Learning

Heng-Bo Fan, Ming-Kun Xie, Jia-Hao Xiao, Sheng-Jun Huang

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00852 2024-12-25 cs.LG cs.AI 57%

EF-LLM: Energy Forecasting LLM with AI-assisted Automation, Enhanced Sparse Prediction, Hallucination Detection

Zihang Qiu, Chaojie Li, Zhongyang Wang, Renyou Xie, Borui Zhang, Huadong Mo, Guo Chen, Zhaoyang Dong

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16547 2024-12-24 cs.AI 57%

ActPC-Chem: Discrete Active Predictive Coding for Goal-Guided Algorithmic Chemistry as a Potential Cognitive Kernel for Hyperon & PRIMUS-Based AGI

Ben Goertzel

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16524 2024-12-24 cs.CV 57%

LLaVA-SLT: Visual Language Tuning for Sign Language Translation

Han Liang, Chengyu Huang, Yuecheng Xu, Cheng Tang, Weicai Ye, Juze Zhang, Xin Chen, Jingyi Yu, Lan Xu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11145 2024-12-24 cs.CL 57%

The Superalignment of Superhuman Intelligence with Large Language Models

Minlie Huang, Yingkang Wang, Shiyao Cui, Pei Ke, Jie Tang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

Comments Under review of Science China

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07118 2024-12-24 cs.CV cs.HC cs.LG 57%

ConvMixFormer- A Resource-efficient Convolution Mixer for Transformer-based Dynamic Hand Gesture Recognition

Mallika Garg, Debashis Ghosh, Pyari Mohan Pradhan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Journal ref WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15106 2024-12-20 cs.CV 57%

Knowing Where to Focus: Attention-Guided Alignment for Text-based Person Search

Lei Tan, Weihao Li, Pingyang Dai, Jie Chen, Liujuan Cao, Rongrong Ji

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07616 2024-12-19 cs.CV 57%

PVP: Polar Representation Boost for 3D Semantic Occupancy Prediction

Yujing Xue, Jiaxiang Liu, Jiawei Du, Joey Tianyi Zhou

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07449 2024-12-18 cs.CV 57%

Semantically Grounded QFormer for Efficient Vision Language Understanding

Moulik Choraria, Xinbo Wu, Sourya Basu, Nitesh Sekhar, Yue Wu, Xu Zhang, Prateek Singhal, Lav R. Varshney

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Preprint Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11771 2024-12-17 eess.IV cs.CV 57%

Point Cloud-Assisted Neural Image Compression

Ziqun Li, Qi Zhang, Xiaofeng Huang, Zhao Wang, Siwei Ma, Wei Yan

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11281 2024-12-17 cs.AI 57%

BearLLM: A Prior Knowledge-Enhanced Bearing Health Management Framework with Unified Vibration Signal Representation

Haotian Peng, Jiawei Liu, Jinsong Du, Jie Gao, Wei Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments Accepted to AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04295 2024-12-17 cs.CV 57%

Everything to the Synthetic: Diffusion-driven Test-time Adaptation via Synthetic-Domain Alignment

Jiayi Guo, Junhao Zhao, Chaoqun Du, Yulin Wang, Chunjiang Ge, Zanlin Ni, Shiji Song, Humphrey Shi, Gao Huang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments GitHub: https://github.com/SHI-Labs/Diffusion-Driven-Test-Time-Adaptation-via-Synthetic-Domain-Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10029 2024-12-16 cs.CV 57%

Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented Samples

Yeyuan Wang, Dehong Gao, Lei Yi, Linbo Jin, Jinxia Zhang, Libin Yang, Xiaoyan Cai

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 15pages, Accepted by AAAI2025, full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09530 2024-12-13 cs.CV 57%

Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM

Han Wang, Yuxiang Nie, Yongjie Ye, Deng GuanYu, Yanjie Wang, Shuai Li, Haiyang Yu, Jinghui Lu, Can Huang

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05231 2024-12-13 cs.CY cs.CL cs.LG 57%

Evaluating GPT-4 at Grading Handwritten Solutions in Math Exams

Adriana Caraeni, Alexander Scarlatos, Andrew Lan

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

Comments Published in LAK 2025: The 15th International Learning Analytics and Knowledge Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01772 2024-12-12 cs.CL 57%

Vision-and-Language Pretraining

Thong Nguyen, Cong-Duy Nguyen, Xiaobao Wu, See-Kiong Ng, Anh Tuan Luu

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CL

Comments The content of the paper has been outdated. I would like to rewrite a new version with completely new information.

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05819 2024-12-10 cs.CV 57%

[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs

Ao Wang, Fengyuan Sun, Hui Chen, Zijia Lin, Jungong Han, Guiguang Ding

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 12 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏