arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-31 至 2026-08-31 共收录 83 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 10 篇

2502.12119 2026-08-31 cs.CV cs.AI cs.CL 版本更新 82%

PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection

PRISM:免训练多模态数据选择的自剪枝内在选择方法

Jinhe Bi, Aniri, Zengjie Jin, Yifan Wang, Danqi Yan, Wenke Huang, Xiaowen Ma, Sikuan Yan, Artur Hecker, Mang Ye, Xun Xiao, Hinrich Schuetze, Volker Tresp, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Research Center, Huawei Technologies(慕尼黑研究中心,华为技术) METEOR School of Computer Science, Wuhan University(武汉大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态大语言模型视觉指令数据冗余问题,提出一种免训练框架PRISM,通过隐式重中心化消除视觉特征各向异性导致的全局语义漂移,实现高效数据选择,在降低计算成本的同时提升模型性能。

Comments Accepted to EMNLP 2026 and selected for the ACL 2026 Best Paper Consideration

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27531 2026-08-31 cs.CR cs.CV 新提交 79%

Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

充分释放多模态攻击者的潜力:视觉语言模型的元自适应越狱攻击

Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出元自适应多模态越狱攻击(MAMJ),通过优化攻击策略提示与攻击者权重提升多模态越狱效果,在MM-SafetyBench上对多款前沿VLMs的攻击成功率显著优于基线,且可迁移至未见过的目标模型。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2026-08-31 cs.CV cs.AI 版本更新 62%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28145 2026-08-31 cs.CV 新提交 57%

Dual-Stream Semantic Guidance with Prototype Anchor Calibration for Source-Fully-Free Adaptation of Vision-Language Models

用于视觉语言模型无源域适应的带原型锚定校准的双流语义引导

Weiwei Xiang, Shun Peng, Guangyi Xiao, Hao Chen, Lei Yang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机与电子工程学院) Huaihua University(怀化学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对无源全自由域适应的双语义漂移问题,提出DSSG框架及带原型锚定校准的DSSG-PAC,在多基准上性能优于SOTA且适配时间降低18.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27550 2026-08-31 cs.RO cs.CV 新提交 57%

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

超越数据缩放:面向视觉-语言-动作模型的以表示为中心的持续预训练

Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 针对VLA模型数据扩展的瓶颈,提出以表示为中心的持续预训练方法VLAct,在多具身机器人数据上训练后,在多项基准任务中超越现有工业级系统,在未见具身迁移任务中仅用20%数据即优于全数据基线,为VLA进展提供新方向。

Comments All models and training pipelines are publicly available at this https URL (https://starvla.github.io/VLAct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27549 2026-08-31 cs.CV 新提交 57%

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

代码即世界:用于物理推理的可执行世界表征的智能体式发现

Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu

机构 * MirroS

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出Code-as-World范式,通过智能体式发现循环构建可执行世界表征,将其用于为视觉-语言模型训练提供物理监督,在QuantiPhy数据集上取得最优性能且超越领先专有模型

Comments Project Page: this https URL (https://mirros-lab.github.io/code-as-world)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26866 2026-08-31 cs.CV 版本更新 57%

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning

顺序很重要:面向视觉-语言推理的中文多面板梗图基准

Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian, Yubo Xie

机构 * Shanghai Maritime University(上海海事大学) Dalian Maritime University(大连海事大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究推出中文多面板梗图基准CMPM,评估大型视觉-语言模型对梗图的顺序感知推理能力,发现模型在打乱顺序时准确率大幅下降,Gemini 3.1 Pro和GPT-5.5表现优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20419 2026-08-31 cs.CV 版本更新 57%

Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation

谱查询-键乘积权重引导用于免训练VLM幻觉缓解

Karn Tiwari, Varnith Chordia, Prathosh A P

机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) Snap Research(Snap 研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出QK乘积引导,一种无数据、免训练、零推理成本的权重编辑方法,通过抑制中间层主导奇异模式减少对象幻觉,在三个GQA基VLM上平均降低CHAIR$_s$ 4.0%。

Comments Published at the Workshop on Actionable Interpretability at COLM 2026, EMNLP Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28387 2026-08-31 cs.AI cs.LG 版本更新 57%

Prompts Without Evidence: How Neuroimaging Mentions Shift Clinical Vision-Language Model Predictions

脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益

Doan Nam Long Vu, Simone Balloccu

机构 * Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究发现,在临床VLM评估中,提示中提及MRI可用性即可解释70-80%的性能提升,与图像数据是否存在无关,这种“脚手架效应”揭示了表面评估无法反映真实多模态推理能力。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27793 2026-08-31 cs.RO 新提交 50%

CAVE-NAV: VLM-Based Autonomous 3D Navigation in Underwater Cave Environments

CAVE-NAV:基于VLM的水下洞穴环境自主三维导航

Zhenqi Wu, Yuanjie Lu, Yisheng Zhang, Miao Yu, Xuesu Xiao, Jaejeong Shin, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学) George Mason University(乔治梅森大学) University of Maryland(马里兰大学) Seoul National University(首尔大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 该研究针对水下洞穴导航的传统方法局限,提出带CoT推理的VLM导航框架,经仿真验证可完成无碰撞的端到端三维洞穴导航。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2608.27785 2026-08-31 cs.CL cs.AI 新提交 88%

Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

音频-视觉大型语言模型中的组合式失效:跨模态冲突下的深层先验主导

Adarsh Sudheer, David Li, Omar Elbanna, Ishaan Kodarapu, Arjun Bahuguna, Vasu Sharma

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对AV-LLMs,以音频-视觉冲突为组合泛化测试,发现模型存在先验主导的组合式失效,开展可解释性分析并验证时间对齐无法提升冲突解决能力,提供了相关代码与数据。

Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14129 2026-08-31 cs.CV 版本更新 83%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments ECCV 2026 camera-ready version. Project page: this https URL (https://vision.cs.utexas.edu/projects/acpo/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28212 2026-08-31 cs.MM cs.SD 新提交 79%

MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance

MuSP-Bench:面向乐谱与演奏的高级多模态音乐理解基准测试

Milan Liessens Dujardin, Song-Ze Yu, Kevin Miao

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 研究人员推出MuSP-Bench基准测试,含490个乐谱与演奏理解问题,评估发现前沿多模态大语言模型理解乐谱困难,推理演奏音频时挑战更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06199 2026-08-31 eess.AS cs.AI cs.SD 版本更新 62%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Contents updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28040 2026-08-31 cs.CL cs.SD 新提交 57%

A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls

颤抖的声音并非总是遁词:对财报电话会议中文本与声音规避检测的基准测试

Mirae Kim, Seonghun Jeong, Youngjun Kwak

机构 * KakaoBank Corp.(Kakao银行股份有限公司) Yonsei University(延世大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 该研究针对财报电话会议问答环节,构建了含505个问答对的DualEvasion基准,发现现有多模态模型难以检测声音置信度,孤立解读声学线索,与人类性能差距显著。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12817 2026-08-31 eess.SP cs.SD 版本更新 50%

An Attention-Assisted AI Model for Real-Time Underwater Sound Speed Estimation Leveraging Remote Sensing Sea Surface Temperature Data

一种结合注意力机制的多模态数据融合模型用于实时估计水下声速

Pengfei Wu, Wei Huang, Yujie Shi, Feng Yin, Hao Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) School of Environmental Science and Engineering, Ocean University of China(中国海洋大学环境科学与工程学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种结合注意力机制的多模态数据融合卷积神经网络,用于实时估计水下声速剖面,通过提取远程感应海面温度数据与历史声速剖面特征之间的关系,提升估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2608.28008 2026-08-31 cs.CV 新提交 83%

Visual Token Coding for Video Multimodal Large Language Models

面向视频多模态大语言模型的视觉令牌编码

Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出面向视频多模态大语言模型的视觉令牌编码VTC,新增动态设计得到$VTC_{Dy}$,在Qwen3-VL等模型上实验显示其在低令牌预算下仍保持高性能,且为即插即用设计无需额外调优。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28383 2026-08-31 cs.CV cs.CL 新提交 81%

Semantic Head Specialization Guides Hybrid ViT Attention for Multimodal LLMs

语义头专业化指导多模态大语言模型的混合视觉Transformer注意力机制

Chenhong He, Lei Li, Shicheng Li, Hanglong Lv, Lingpeng Kong, Qi Liu, Tong Yang, Shuhuai Ren

机构 * Peking University(北京大学) Xiaomi Corporation(小米公司) The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 该研究针对多模态LLM中混合ViT注意力设计不足的问题,提出语义头专业化(SHS)概念,据此设计Ariadne注意力机制,在22项图像视频任务上性能与全注意力相当,计算量降低6.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28279 2026-08-31 cs.RO 新提交 78%

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

STEGNav:面向多模态终身目标导航的时空事件图推理

Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 针对现有多模态终身导航方法的局限,本文提出无训练框架STEGNav,通过时空事件图的双轴设计优化导航性能,在多个基准数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05917 2026-08-31 cs.CV cs.CL 版本更新 76%

MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering

MemoryCard: 面向长视频问答的主题感知多模态线索压缩

Qing Yang, Pengcheng Huang, Xinze Li, Zhenghao Liu, Yukun Yan, Yu Gu, Ge Yu, Gang Li, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Digital China Group(数字中国集团)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.CL

AI总结 提出MemoryCard框架,通过将长视频分割为主题事件单元并生成事件级摘要和代表性视觉时刻,以记忆卡形式增强VLMs的长视频问答能力,在相同视觉令牌预算下准确率提升高达21.8%。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28192 2026-08-31 cs.CV 新提交 57%

Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding

在视频中定位任意目标:重新思考高效的生成式时空视频定位

Hanoona Rasheed, Haania Siddiqui, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of California, Merced(加州大学默塞德分校) Apertix(阿珀蒂克斯公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对时空视频定位的自回归解码存在延迟高、误差易传播的问题,提出并行轨迹解码,在VidSTG等数据集上实现显著的延迟降低与吞吐量提升,且可零样本泛化到多项相关任务

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28144 2026-08-31 cs.AI 新提交 57%

The Shape of Power: A Multilingual Framework for Social Power Reasoning in Dialogues

权力的形态:面向对话中社会权力推理的多语言框架

Farah Atif, Sougata Saha, Monojit Choudhury

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究针对现有社会权力计算研究的语言文化局限,提出基于社会科学理论的多语言对话社会权力推理框架,构建含15836个实例的双语语料库,评估6类大模型并发现其与人类推理的差距,为跨文化社会推理提供评估设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27871 2026-08-31 cs.CV 新提交 57%

Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding

时序思维树:面向长视频理解的推理引导型视觉线索搜索

Ziling Huang, Shin'ichi Satoh

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对MLLMs长视频理解的时序组织缺失问题,提出无训练的T³框架,通过分层时序树与“回答-检索-探索”循环实现粗到细的线索搜索,在三个基准数据集上提升了Qwen2.5-VL-7B的性能。

Comments Accept by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28273 2026-08-31 cs.LG 新提交 50%

Learning to Transfer Across Modes: Towards Unified Urban Mobility Forecasting

学习跨模式迁移:面向统一的城市交通预测

Yixuan Zhao, Man Luo

机构 * University of Exeter(埃克塞特大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 针对城市多模式交通需求联合预测的挑战,提出统一框架TransMod,通过共享空间表示对齐不同粒度交通系统,实现跨模式知识迁移,在真实数据集上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2608.20756 2026-08-31 cs.CV cs.AI 版本更新 89%

Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation

Vis-Poison:多模态检索增强生成中的视觉知识投毒攻击

Rujin Liang, Zhongpu Chen, Yuhao Lei, Xin Miao

机构 * Southwestern University of Finance and Economics(西南财经大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Vis-Poison攻击,通过自动化多智能体方法构建视觉合理的被投毒图像,在黑盒设置下对多模态RAG系统实现40.16%-65.40%的攻击成功率,且对仅依赖参数知识的MLLM平均成功率超60%。

Comments Findings of EMNLP, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27865 2026-08-31 cs.PF 新提交 78%

FFSlim: An Efficient and Lightweight Format for Multi-modal Data Storage and Retrieval

FFSlim:一种用于多模态数据存储与检索的高效轻量格式

Long Yang, Yu Mao, Yuchen Shao, Yumiao Zhao, Yaqi Li, Xuan Liu, Xiaolong Shen, Tao Yu, Gezi Li, Jing Wang, Chengcheng Wan, Liang Shi

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 针对多模态数据存储检索的I/O瓶颈问题,提出轻量格式FFSlim,通过三个组件提升效率,实现高吞吐量并降低端到端训练时间

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2608.27505 2026-08-31 cs.CL cs.AI 新提交 62%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04438 2026-08-31 cs.CV cs.CL 版本更新 62%

The Telephone Game: Evaluating Semantic Drift in Unified Models

电话游戏:评估统一模型中的语义漂移

Sabbir Mollah, Rohit Gupta, Sirnam Swetha, Qingyang Liu, Ahnaf Munir, Mubarak Shah

机构 * Center For Research in Computer Vision, University of Central Florida, USA(计算机视觉研究中心,中央佛罗里达大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 该研究提出语义漂移协议(SDP)等方法,评估统一模型在交替执行图像-文本理解与生成时的语义漂移,发现现有孤立基准无法预测模型的多轮表现,为统一模型可靠性评估提供了更准确的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28086 2026-08-31 cs.IT cs.CV eess.IV 新提交 57%

Ada-TokenCom: Rate-Adaptive Token Communications via Large-Model-Driven Token Compression and Generation

Ada-TokenCom:基于大模型驱动的令牌压缩与生成的速率自适应令牌通信

Zijun Zhang, Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Mehdi Bennis, Kaibin Huang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出基于大自回归模型的速率自适应令牌通信框架Ada-TokenCom,结合下一个令牌预测与算术编码,通过混合重建/生成方案及李雅普诺夫算法优化,实现优于基线的超低比特率语义通信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22392 2026-08-31 cs.CV 版本更新 57%

iOSPointMapper: RealTime Pedestrian and Accessibility Mapping with Mobile AI

iOSPointMapper: 基于移动AI的实时行人及可达性制图

Himanshu Naidu, Yuxiang Zhang, Sachin Mehta, Anat Caspi

机构 * University of Washington(华盛顿大学) Paul G. Allen School of Computer Science and Engineering(保罗·G·艾伦计算机科学与工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 iOSPointMapper通过移动AI实现实时人行道制图,结合语义分割、LiDAR和GPS数据,提供隐私保护的数据收集与多模式交通数据整合,提升行人基础设施的可达性。

Comments Presented at the Transportation Research Board (TRB) 105th Annual Meeting, 2026. Revised manuscript with expanded methodology descriptions, clarified feature localization procedure, minor corrections and formatting updates

详情

展开后加载摘要…

URL PDF HTML 收藏