arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 141 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 17 篇

2608.30550 2026-09-01 cs.AI cs.CV 新提交 81%

GarmentWeaver: Schema-Aware Structured Synthesis for Multimodal Sewing Patterns

GarmentWeaver:面向多模态缝纫图案的模式感知结构化合成

Yinwen Lu, Weihao Luo, Yueqi Zhong

机构 * Donghua University(东华大学) Ningbo University(宁波大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GarmentWeaver是一种模式感知多模态缝纫图案生成框架,通过分层结构化建模与可行性正则化,生成更准确、可执行且仿真兼容的缝纫图案,性能优于基线方法。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29357 2026-09-01 cs.AI 新提交 79%

LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO

LiteSearch-VL:通过轨迹蒸馏和合成步级DPO实现的小型多模态搜索智能体

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能) Ohio State University(俄亥俄州立大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究提出LiteSearch-VL方案,通过轨迹蒸馏和合成步级DPO,在单节点预算下将多模态搜索智能体能力迁移至Qwen3-VL-2B等小型模型,使其在多模态视觉问答任务上取得接近4B模型的性能,明确小型多模态智能体的下一瓶颈是答案验证而非搜索深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29088 2026-09-01 cs.AI 新提交 79%

HANIA: Planner-Guided Multimodal Graph Evidence Selection for Grounded Question Answering

HANIA:规划器引导的多模态图证据选择用于基于证据的问答

Zafar Ali, Asad Khan, Nimbeshaho Thierry, Nabila Amir, Adam A. Q. Mohammed, Pavlos Kefalas

机构 * Southeast University(东南大学) Portland Institute(波特兰研究所) Aristotle University of Thessaloniki(亚里士多德大学) Shandong University(山东大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HANIA框架,通过规划器引导的多模态图证据选择处理ScienceQA问答任务,无需目标数据集微调或迭代检索即可实现具竞争力的多模态问答。

Comments 10 pages, 1 figure. Accepted at Graph-enhanced LLMs for trustwOrthy Web data management (GLOW), ISWC 2026 Workshops, Bari, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29681 2026-09-01 cs.CY 新提交 78%

MMMMM: A Unified Taxonomy for Investigating the Mechanisms of Multilingual MultiModal Misinformation

MMMMM:用于研究多语言多模态虚假信息机制的统一分类体系

Nadav Borenstein, Greta Warren, Desmond Elliott, Isabelle Augenstein

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 该研究针对多模态虚假信息研究的分类体系缺失与自动化不足问题,构建了7种语言的数据集与多模态虚假信息分类体系,结合VLM实现自动化标注,为针对性检测提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28696 2026-09-01 cs.CV 新提交 77%

Instruction Distillation: Text Instructions as Visual Examples

指令蒸馏:将文本指令作为视觉示例

Hardik Jindal, Soumyabrata Pal, Sayak Ray Chowdhury

机构 * IIT Kanpur(印度理工学院坎普尔分校) Adobe Research(奥多比研究院)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究针对视觉上下文学习的高成本问题,提出指令蒸馏方法,为每个训练图像生成结构化指令,在细粒度视觉分类任务中提升性能并降低推理成本,且视觉与文本ICL信号互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28707 2026-09-01 cs.CL cs.CV 新提交 73%

ReVA: A Region-Aware Visual Assistant for Visually Grounded Question Answering

ReVA:面向视觉接地问答的区域感知视觉助手

Anoop Senthil

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL

AI总结 该研究针对多模态大语言模型视觉问答中存在的物体幻觉问题,提出区域感知模型ReVA,通过双桥接结构融合整图与区域特征,在POPE数据集上将平均F1提升至82.85%,有效改善了视觉接地效果。

Comments 11 pages. Code: https://github.com/anoop675/reva

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30646 2026-09-01 cs.CL cs.AI cs.LG 新提交 62%

BiG-SURE - Bipartite Graph for Semantic Uncertainty and Reliability Estimation of LLMs

BiG-SURE - 用于大语言模型语义不确定性与可靠性估计的二分图

Debarpan Bhattacharya, Malay Phadke, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 BiG-SURE是一种基于跨温度语义一致性的二分图方法,用于黑盒LLMs/VLMs的语义不确定性与可靠性估计,在多类问答任务上提升了弃权AUROC性能。

Comments 22 pages, 9 figures

Journal ref EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29996 2026-09-01 cs.CV cs.AI cs.LG 新提交 62%

Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models

用于移除大型视觉语言模型中虚假关联的感知分区式遗忘

Aditi Sarker, Nazreen Shah, Rafi Ibn Sultan, Rhongho Jang, Dongxiao Zhu, Prashant Khanduri

机构 * Wayne State University(韦恩州立大学) IIIT Delhi(德里印度信息技术学院) Institute for AI and Data Science (AIDaS), Wayne State University(韦恩州立大学人工智能与数据科学研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出PURGE框架,通过结构化数据集构建和感知分区式遗忘,减少大型视觉语言模型的虚假关联诱导错误,同时保持或提升整体性能。

Comments 35 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29974 2026-09-01 cs.CV cs.CL 新提交 62%

SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models

SpanCalib-VLM:视觉语言模型中经过校准的幻觉跨度检测

Amanuel Gizachew Abebe, Yasmin Moslem

机构 * Shaggar Institute of Technology(沙加尔理工学院) Trinity College Dublin(都柏林圣三一学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SpanCalib-VLM混合双系统,结合多模态序列标注器与微调生成式VLM,经联合校准融合策略优化,在SHROOM-Visions任务上实现幻觉跨度的高效校准检测,公开了模型权重与代码。

Comments Shroom-Visions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29313 2026-09-01 cs.CV cs.AI 新提交 62%

Hyper3-CLIP: Hierarchy-Conditioned Hyperbolic Vision-Language Training

Hyper3-CLIP:层级条件双曲视觉-语言训练

Matin Mahmood, Antonio Rueda-Toicen, Mohamed ElBassat, Seifeldin Elkerdany, Weixing Wang, Gerard de Melo

机构 * hyper 3 labs(超3实验室) Hasso Plattner Institute(哈索·普拉特纳研究所) University of Potsdam(波茨坦大学) Faculty of Computers and Data Science, Alexandria University(亚历山大大学计算机与数据科学学院) Faculty of Computer Science and Engineering, Alamein International University(阿拉曼国际大学计算机科学与工程学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 Hyper3-CLIP结合层级条件与双曲几何,通过文本构建多粒度查询层级训练视觉-语言模型,提升图像-文本检索与多标签分类性能,在层级指标上保持竞争力。

Comments 16 pages, 2 figures, ECCV 2026 Beyond Euclidean Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29364 2026-09-01 cs.CV 新提交 61%

Sketch2Inspire: Structure-Sensitive Evaluation for Product Retrieval

Sketch2Inspire:面向产品检索的结构敏感型评估

Ge Kong

机构 * Beihang University(北京航空航天大学)

专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV

AI总结 该研究提出Sketch2Inspire资源,基于CLIP系列编码器评估多模态融合等方法,证实结构敏感检索下多模态输入增益更高,为产品检索评估提供诊断资源。

Comments 15 pages, 2 figures. PRICAI 2026 version. The paper presents Sketch2Inspire, a structure-sensitive evaluation resource for multimodal product retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30480 2026-09-01 cs.CV cs.LG 新提交 57%

VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs

VisER:用于大视觉语言模型(LVLMs)中物体幻觉检测的视觉证据与依赖关系

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems(计算与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 VisER 是一种无训练双向指标,通过视觉证据与视觉依赖两个互补视角检测 LVLMs 的物体幻觉,在 AUROC、AUPR 指标上优于多个基线方法。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30209 2026-09-01 cs.CV 新提交 57%

DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection

DICS:探索数据内在一致性用于视觉指令选择

Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Token Hub, Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出基于数据内在一致性(DIC)的自适应视觉指令选择方法DICS,仅用25%数据就超越现有最优方法,还构建600万样本语料库,用不足25%训练数据达到InternVL3-8B-Instruct的94.52%性能

Comments Accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29923 2026-09-01 cs.CV cs.LG 新提交 57%

Towards Continual Test-Time Adaptation of Vision-Language Models in Open-Vocabulary Semantic Segmentation

面向开放词汇语义分割中视觉-语言模型的持续测试时适应

Chandler Timm C. Doloriel, Yunbei Zhang, Sarthak Kumar Maharana, Muhammad Salman Siddiqui, Tor Kristian Stevik, Fadi Al Machot, Kristian Hovde Liland, Habib Ullah

机构 * Norwegian University of Life Sciences (NMBU)(挪威生命科学大学) Tulane University(杜兰大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对开放词汇语义分割中视觉-语言模型在持续测试时分布偏移下的对齐脆弱问题,提出DAF框架,在多数据集上实现mIoU显著提升且鲁棒性良好。

Comments under review. code available at https://github.com/chandlerbing65nm/DAF.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29604 2026-09-01 cs.IR cs.CV 新提交 57%

RePair: Turning Retrieval Failures into Counterfactual Hard Pairs

RePair:将检索失败转化为反事实困难对

Siyi Liu, Xiaorong Zhu, Enjun Du, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Junfu Pu, Yongqi Zhang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 RePair基于CLIP双编码器的视觉-语言检索,通过挖掘假阳性并结合LLM引导的反事实编辑生成困难对,提升数据效率,在Flickr30K和COCO30K上性能优于基线。

Comments EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28701 2026-09-01 cs.CV 新提交 57%

TopoAgent: A Structure-Aware Perception-to-Reasoning Framework for Diagram-to-Graph Topology Extraction with Large Vision-Language Models

TopoAgent:基于大型视觉语言模型的感知到推理的结构感知框架,用于图到图拓扑提取

Bangwei Guo, Xujiang Zhao, Yanchi Liu, Wei Cheng, Shengyu Chen, Dongyue Li, Masaharu Morimoto, Takayuki Kuroda, Dimitris Metaxas, Haifeng Chen

机构 * Rutgers University(罗格斯大学) Meta NEC Labs America(美国NEC实验室) University of Electro-Communications(电气通信大学) NEC Corporation(日本电气公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对图到图拓扑提取任务构建了TopoBench-180基准,并提出TopoAgent框架,结合感知、结构先验与推理,在基准上性能优于现有模型,填补了多模态结构化理解的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30836 2026-09-01 eess.SP 新提交 50%

Channel Gains to Captions: Task-Unified Multi-Level RF Sensing with Vision-Language Models

信道增益到描述:面向任务统一的多级射频感知与视觉语言模型

Tianyu Hu, Zhiren Gong, Haowei Cui, Shuai Wang, Samson Lasaulce, Lingxiang Li, Wassim Hamidouche, Zhi Chen, Merouane Debbah

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出基于VLMs的任务统一多级RF感知框架,通过生成式方案将mmWave/THz信道增益映射为环境语义描述,引入LoRA专家实现级别适配,仿真显示其性能优于基线且适配性更广。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 16 篇

2608.30726 2026-09-01 cs.AI 新提交 87%

Multimodal Adaptive Expert Selection with Text Routing and Ordinal Prototype Optimization for Sentiment Analysis

面向情感分析的、结合文本路由与序数原型优化的多模态自适应专家选择方法

Xiaode Chen, Jiakang Yu, Hongtao Deng, Huina Qu, Xun Zhu, Yinxia Lou

机构 * Jianghan University(江汉大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI

AI总结 本研究针对多模态情感分析的静态计算图与忽略情感序数层级的问题,提出MAESTRO框架,通过文本引导的MoE机制与O-PCL实现动态多模态表征,在CMU-MOSI等基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29239 2026-09-01 cs.CL cs.SD eess.AS 新提交 81%

Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages

用语义锚定语音:一种针对低资源语言自动语音识别的多模态适配器机制

Kuan-Tang Huang, Cheng-Yeh Yang, Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen

机构 * National Taiwan Normal University(台湾师范大学) EZAI Academia Sinica(中央研究院)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 针对低资源语言ASR的监督证据不足问题,提出轻量级多模态适配器机制SAMA-ASR,结合语义与声学锚,在台湾闽南语和客家话数据集上优于多种基线,且紧凑ST模型可生成有效语义锚。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30125 2026-09-01 cs.SD cs.AI cs.CL cs.CV cs.LG 新提交 80%

VIBE: Video Instruction-aligned Background music gEneration

VIBE:视频指令对齐背景音乐生成模型

Aryan Vijay Bhosale, Vaibhavi Lokegaonkar, Vishnu Raj, Gouthaman KV, Sreyan Ghosh, Ramani Duraiswami, Lie Lu, Dinesh Manocha

机构 * Dolby Laboratories(杜比实验室) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 VIBE是一种新型文本与视频生成音乐模型,通过深度跨层条件机制与五阶段奖励建模优化,提升了音乐生成的可控性与指令依从性,在生成保真度上与多数基准模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30270 2026-09-01 cs.CL 新提交 79%

Read the Room, Read the Image: Understanding Indirect Speech Acts in Multimodal Visual Contexts

读懂房间,读懂图像:理解多模态视觉语境中的间接言语行为

Jaehee Kim, Ji Hoon Chung, Seoyoon Park, Unsol Kim, Kyungwon Park, Ji Hak Kim, Yi-Jun Chen, Hansaem Kim

机构 * Yonsei University(延世大学) LG AI Research(LG人工智能研究院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究推出多模态基准READI,以视觉语用问答任务评估间接言语行为理解,发现先进多模态模型在视觉接地间接言语行为上表现差,性能随间接性提升而下降,凸显相关基准的必要性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30204 2026-09-01 cs.CL 新提交 79%

When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

当模型“听到”它们所期待的:诊断多模态讽刺检测中的韵律启发式算法

Yongjian Chen, Pengfei Wei, Yiqun Sun, Zhu Li, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute (MTRI)(麦哲伦技术研究所(MTRI)) Center for Language and Cognition, University of Groningen(格罗宁根大学语言与认知中心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文以讽刺检测为切入点,评估Qwen2.5-Omni等多模态大语言模型,发现模型依赖音高升高、停顿不规则的韵律刻板印象,操控该维度可使假阳性率达60%,且该效应可跨模型复现。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29121 2026-09-01 cs.CV 新提交 79%

Acoustically Grounded Cost Learning for Open-Vocabulary Audio-Visual Semantic Segmentation

基于声学接地代价学习的开放词汇视听语义分割

Tianrui Hui, Shaofei Huang, Qisong Han, Yaxiong Wang, Lechao Cheng, Zhedong Zheng, Zhun Zhong, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Cardiff University(卡迪夫大学) University of Macau(澳门大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 针对开放词汇视听语义分割的现有方法缺陷,提出AGCL框架及AMCG、AGTA、SDM模块,在AVSBench-OV数据集上显著优于现有SOTA方法,尤其在未见类别上表现突出。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28609 2026-09-01 cs.CL cs.AI cs.CV 新提交 78%

Parametric Multimodal User Memory: Storing What Captions Cannot Carry

参数化多模态用户记忆:存储字幕无法承载的内容

Bojie Li, Noah Shi

机构 * Pine AI(派恩人工智能) University of Washington(华盛顿大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出参数化多模态用户记忆,结合视觉语言模型与专用编码器,解决传统文本用户记忆丢失感知信息的问题,在PerceptMem数据集上验证了其有效性与可推广性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30013 2026-09-01 cs.HC 新提交 71%

Multimodal Takeover Requests for Drivers with Hearing Loss: Implications for AI-Enabled Communication in Automated Vehicles

针对听力障碍驾驶员的多模态接管请求:自动驾驶汽车中AI驱动通信的启示

Aries Chu, Wei-Hsiang Lo, Gaojian Huang

专题命中 音频语音多模态 :multimodal(title)

AI总结 该研究针对听力障碍驾驶员,通过驾驶模拟器实验发现视觉-触觉接管显示可缩短反应与接管时间,AI驱动汽车可据此调整接管消息内容以适配不同需求。

Comments 10 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31014 2026-09-01 cs.CL 新提交 70%

Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols

基于异构语音协议的证据受限心理健康推理

Chengyuan Gao, Jiang Wu, Tao Lu, Jiayan Guo, Mingkun Xu, Tianyi Zang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) GDIIST(广东省智能制造研究所) Tencent(腾讯)

专题命中 音频语音多模态 :multimodal(abstract);omni-modal(abstract);分类 cs.CL

AI总结 本研究针对现有心理健康筛查模型的证据边界问题,提出协议感知的证据控制框架EviBound,在抑郁症筛查任务中达到0.8658的AUROC,且实现零宣称违规。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30156 2026-09-01 cs.CL 新提交 70%

Reactivating Test-Time Scaling for Plane Geometry Problem Solving

重新激活平面几何问题求解的测试时缩放能力

Xiaoqiang Kang, Shengen Wu, Maizhen Ning, Xiaobo Jin, Kaizhu Huang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) University of Liverpool(利物浦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hithink Research(海天瑞声研究院) Digital Innovation Research Center, Duke Kunshan University(昆山杜克大学数字创新研究中心)

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL

AI总结 该研究针对平面几何问题求解中测试时缩放失效的问题,提出多轨迹合成、感知增强训练及共识引导多轨迹集成方法,提升了不同模型规模下的几何问题求解性能,且采样成本最高降低8倍。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30713 2026-09-01 cs.SD 新提交 67%

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

闭合验证循环:用于长段落详细音频字幕的自检查字幕生成

Fengji Ma, Yan Rong, Xu Li, Chen Zhang, Pengfei Wan, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 本研究针对长段落详细音频字幕的未解决问题,提出SCC框架,构建LACap-50k语料库与LC-SFT方法,使系统在开源字幕生成器中达最优性能。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30260 2026-09-01 cs.CL cs.AI cs.LG 新提交 62%

Using Prosody to Predict Syntactic Structure

用韵律预测句法结构

Junghyun Min, Alex Warstadt, Tamar I. Regev, Tiago Pimentel, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该研究从信息论视角提出通用框架,利用多模态语言模型量化韵律与句法的互信息,发现韵律可降低自然对话中10.2%的句法不确定性,为相关理论提供实证支持。

Comments 15 pages, 4 figures. EMNLP 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28875 2026-09-01 cs.CL cs.AI cs.SD 新提交 62%

No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus

提示词层面上下文未检测到侧边级词错误率(WER)变化:对生产级口述历史语料库的预注册消融实验

Theodore O. Cochran, Stephanie Dodson, Keith Nore

机构 * AI for Altruism(利他智能)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该预注册实验在生产级口述历史转录工具上发现,提示词层面上下文未改变侧边级WER,仅短语有小幅改善,需结合序列对齐指标评估上下文机制。

Comments 31 pages, 1 figure. Preregistered on OSF (https://osf.io/ns49b, DOI 10.17605/OSF.IO/NS49B); release materials and dated provider-documentation snapshots in the study component (https://osf.io/9nsvr)

详情

展开后加载摘要…

URL PDF HTML 收藏