arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18998 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18998 篇

2605.10325 2026-05-28 cs.AI 82%

Verifiable Process Rewards for Agentic Reasoning

可验证过程奖励用于智能体推理

Huining Yuan, Zelai Xu, Huaijie Wang, Xiangmin Yi, Jiaxuan Gao, Xiao-Ping Zhang, Yu Wang, Chao Yu, Yi Wu

机构 * Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出可验证过程奖励(VPR)框架,通过符号或算法预言机将密集的中间步骤验证转化为强化学习的逐轮监督信号,解决长程智能体推理中的信用分配问题,并在搜索、约束和后验验证三种场景中验证其有效性。

Comments Corrected minor typos and LLM-assisted data extraction errors. The main conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18209 2026-05-19 cs.CV cs.AI 82%

SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning

SPATIOROUTE: 动态提示路由用于零样本空间推理

Pawat Chunhachatrachai, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(台湾国立大学) Delta Robotics Innovation Center(Delta机器人创新中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出SpatioRoute,一种动态提示生成方法,通过语义定制的提示模板路由问题,无需额外训练或3D传感器输入,在零样本设置下提升空间推理性能,同时发现Chain-of-Thought提示在空间视频理解中效果不佳。

Comments 10 pages, 2 figures, 2nd Workshop on 3D-LLM/VLA, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07966 2026-04-22 cs.CV cs.CL 82%

Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images

视觉-表格问答:面向表格图像推理的开放领域基准

Boammani Aser Lompo, Marc Haraoui

机构 * École de Technologie Supérieure(埃克塞技术学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract,comments);prompting(abstract);分类 cs.CL

AI总结 本文提出Visual-TableQA,一个大规模开放领域多模态数据集,用于评估和提升视觉推理能力,包含2500个LaTeX渲染表格和6000对推理密集型问答对,通过多模型协作生成,验证了模型在外部基准上的鲁棒性。

Comments Accepted at the First Workshop on Foundations of Reasoning in Language Models, NeurIPS 2025. Available at: https://openreview.net/forum?id=fvJRsGwhPf

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06039 2025-02-11 cs.SE cs.AI cs.CR 82%

Benchmarking Prompt Engineering Techniques for Secure Code Generation with GPT Models

Marc Bruni, Fabio Gabrielli, Mohammad Ghafari, Martin Kropp

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at the 2025 IEEE/ACM Second International Conference on AI Foundation Models and Software Engineering (Forge 2025). 10 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21022 2026-08-24 cs.CV cs.MM 新提交 82%

Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding

识别条件推理:一种用于细粒度微动作理解的无训练多模态大语言模型流水线

Fengshun Wang, Jin'ang Han, Zhigang Tu

机构 * Wuhan University(武汉大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 该研究提出一种无训练的多模态大语言模型流水线,动态分配子任务至适配的模型,在2026年MAC微动作挑战赛MA-Bench赛道的开放式任务上获显著性能优势,取得第一名。

Comments Accept at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19661 2026-08-21 cs.RO 新提交 82%

World-Model-Grounded LLM Planning for AUV and ASV Navigation Near Offshore Wind Farms

面向近海风电场区域自主水下航行器(AUV)与自主水面航行器(ASV)导航的世界模型赋能大语言模型规划

Markus Buchholz, Ignacio Carlucho, Yvan R. Petillot

机构 * Norwegian Defence Research Establishment (FFI)(挪威国防研究机构(FFI)) School of Engineering & Physical Sciences, Heriot-Watt University(赫瑞瓦特大学工程与物理科学学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本研究提出世界模型赋能大语言模型规划方法,结合MPC闭环重规划器等组件,在近海风电场区域的AUV和ASV导航任务中,大幅降低目标距离误差,验证了其有效性。

Comments This work has been accepted to the IEEE IROS 2026 AQ2UASIM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06578 2026-08-12 cs.AI cs.CL cs.LG 交叉投稿 82%

Divergent Response Modes in Frontier Language Models Under Steering Pressure

前沿语言模型在引导压力下的发散响应模式

Ali Jalal-Kamali

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估六种前沿语言模型在引导压力下的响应差异,发现模型间存在不同响应模式,以Llama为对象追溯到内部机制,相关发现经多实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05738 2026-08-07 cs.RO 新提交 82%

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

上下文视觉-语言-动作模型:通过上下文后训练与智能体工具使用为视觉-语言-动作模型赋予语言能力

Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

专题命中 推理与问题求解 :post-training(title,abstract);language model(abstract)

AI总结 该研究针对现有VLA模型用CoT会降低控制性能的问题,提出通过上下文后训练和智能体工具使用赋予VLA语言能力的方法,在多模拟和真实机器人任务上实现SOTA性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14888 2026-08-06 cs.CL cs.AI cs.CV cs.LG 版本更新 82%

Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

推理动态与监控模态依赖性的局限性

Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras, Desmond Elliott

机构 * University of Copenhagen, Department of Computer Science(哥本哈根大学计算机科学系) University of Sheffield, School of Computer Science(谢菲尔德大学计算机科学学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分析18种VLM的推理动态,发现模型易受早期预测影响,推理训练模型在模态条件下表现出更强的纠正行为,但其效果依赖于模态条件,且CoT的可检测性因模型而异。

Comments Accepted for publication in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01709 2026-08-04 cs.CV 新提交 82%

SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models

SpatialQuery:评估视觉语言模型中基于几何的多实例空间推理能力

Hai Nguyen, Tung Vu, Cong Tran

机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract)

AI总结 该研究针对视觉语言模型的多实例空间推理缺陷,推出SPATIALQUERY框架及含百万对问答的SPATIALQUERY-1M基准,结合UA-CoT提示,使Qwen3-VL-8B在空间推理任务中表现优于多种模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29175 2026-08-03 cs.SE 新提交 82%

Execution-First Synthetic Tool-Use Trace Generation for LLM Agents

面向LLM智能体的优先执行式合成工具使用轨迹生成

Hafsa Ouajdi, Francesco Giannuzzo, Alaa Boukhary, Paolo Papotti, Gerard Conangla, Adam Elwood

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 针对传统数据合成的局限,提出优先执行式框架SyntheticAgentTraceQA生成工具增强型智能体的监督数据,经四工具生态系统及Qwen模型验证,该框架可提升工具执行等性能,且揭示了掩码与全监督的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24617 2026-07-28 cs.IR 新提交 82%

LaRec: Unleashing LLM-based Latent Reasoning for Generative Recommendation

LaRec:释放基于大语言模型的生成式推荐中的潜在推理能力

Yu Xia, Zihan Lin, Wei Yang, Rui Zhong, Cheng Chen, Huan Ren, Yao Hu

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究针对LLMs在推荐中现有方法的问题,提出LaRec框架。核心方法是通过潜在预训练赋予潜在推理能力,用个性化强化学习调整引导遍历多样推理路径。主要贡献是在多数据集实验中,以相当效率显著超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22925 2026-07-28 cs.CL cs.AI cs.LG 新提交 82%

Not All LLM Reasoning is Visible in the Chain-of-Thought

并非所有大语言模型的推理都能在思维链中体现

Vatsal Baherwani, Tom Goldstein, Ashwinee Panda

机构 * New York University(纽约大学) University of Maryland(马里兰大学) TogetherAI

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型输出令牌是否体现所有推理,发现前沿模型存在利用无关填充令牌提升合成推理任务性能的不可见推理现象,评估多个模型,揭示填充令牌益处因模型和令牌而异,还表明其能服务隐藏目标,且强化学习等方法无法使填充令牌益处在测试时持续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23146 2026-07-24 q-bio.QM 版本更新 82%

Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks

轻量语言模型在复杂计算表型任务中易出现推理错误

Sarah Pungitore, Shashank Yadav, David Maughan, Vignesh Subbian

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn)

AI总结 研究探讨了轻量语言模型在复杂计算表型任务中的推理错误问题,通过扩展PHEONA框架评估了不同模型的推理准确性,并发现轻量推理模型在提示修改后表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19568 2026-07-23 eess.SY cs.SY 新提交 82%

From P&ID Drawings to Process Graphs: A Multimodal Language Model Approach

从管道和仪表图到过程图:一种多模态语言模型方法

Baikai Zhu, Samuel Duong, Javal Vyas, Mehmet Mercangöz

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)

AI总结 研究针对P&IDs数字化难题,提出基于多模态大语言模型的两阶段工作流程,将其数字化重定义为设备标签提取与拓扑推理,经案例研究评估,该方法比端到端数字化更优,凸显知识引导工作流程在P&ID数字化中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17053 2026-07-21 cs.SE cs.AR 新提交 82%

MechMem-RTL: Reusing Verified Mechanism Memories for LLM-Based RTL Repair

MechMem-RTL:用于基于大语言模型的RTL修复的可复用验证机制存储器

Mingyu Cheng, Junjie Gao, Jinhua Cui, Kuncai Zhong

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型修复RTL设计时,利用任务文本相似性易误导的问题,提出MechMem-RTL框架,复用验证器确认的修复记录,通过严格匹配触发证据来注入记录,实验表明该框架在多个任务上修复效果优于标准反馈修复和任务相似性RAG。

Comments 7 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11173 2026-07-14 cs.CV 新提交 82%

When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning

当深度以文字表述比图像展示更好用时:用于视觉语言空间推理的深度序数提示

Quynh Vo, Phuc Dao, Cong-Duy Nguyen, Thong Nguyen

机构 * National University of Singapore(新加坡国立大学) Center of AI Research, VinUniversity(文大人工智能研究中心)

专题命中 推理与问题求解 :prompting(title,abstract);language model(abstract)

AI总结 研究视觉语言模型空间推理难题,提出深度序数提示(DOP)方法,该方法无需训练,将单目深度转换为序数文本提示,在伪深度提供可靠排序时可改善空间推理,简单且针对性强,与其他无需训练的深度提示方法有竞争力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06014 2026-07-08 cs.SD 新提交 82%

Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models

摆脱普罗克汝斯忒斯之床:用于音频语言模型的分组正交连接器

Ho-Lam Chung, Ke-Han Lu, Yi-Cheng Lin, Guan-Ting Lin, Yiming Chen, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所) ASUS AICS

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)

AI总结 研究音频语言模型压缩中存在的问题,提出ORCA方法,通过分组使查询输出指向不同方向,在SAKURA多跳推理中表现出色,提升分数,减少查询冗余并提高跨说话者方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11960 2026-07-07 cs.LG cs.AI cs.CL 版本更新 82%

R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning

R$^2$PO:用于大语言模型推理的解耦展开与推理策略

Jingchu Wang, Bingbing Xu, Yige Yuan, Dan Zhang, Bin Xie, Xiaoqian Sun, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国家大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究指出强化学习方法中训练轨迹与推理响应策略耦合的问题,提出R$^2$PO解耦二者,在训练时多样化展开,保持推理生成不变,实验表明其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31157 2026-07-01 cs.CV 新提交 82%

Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning

重新思考基础模型协作:通过代理任务推理增强专用模型

Hongyi Lin, Yang Liu, Jinhua Zhao, Xiaobo Qu

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系)

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract)

AI总结 提出FAT框架,将基础模型与专用模型协作视为任务分解而非替代,通过代理任务(如选择或验证)提升结构化预测性能,在多个任务上优于直接使用基础模型回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24082 2026-06-24 eess.AS cs.SD 新提交 82%

Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions

比较推理:让音频语言模型更擅长比较情感

Abinay Reddy Naini, Jaeyeon Kim, Chao-Han Huck Yang, Shinji Watanabe, Carlos Busso

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) The University of Texas at Dallas(德克萨斯大学达拉斯分校) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(title,abstract);preference optimization(abstract)

AI总结 提出一种推理引导的序数情感识别框架,通过配对语音输入和推理轨迹训练音频语言模型,实现可解释的比较情感判断,仅需传统方法5%的训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18375 2026-06-24 cs.RO 新提交 82%

PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation

PAIWorld: 用于机器人操作的三维一致世界基础模型

Yuhang Huang, Xuan Lv, Junyan Xu, Zhiyuan Yu, Jiazhao Zhang, Ruizhen Hu, Wancheng Feng, Shilong Zou, Hewen Xiao, Ziqiao Zhou, Kaiyun Huang, Zhiyu Peng, Juzhan Xu, Hang Zhao, Chenyang Zhu, Renjiao Yi, Yifei Huang, Douhui Wu, Yan Zhang, Kexu Cheng, Chunhe Song, Yunzhi Xue, Xiuhong Zhang, Leitao Guo, Yunji Chen, Bin Wu, Haibin Yu, Kai Xu

机构 * Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

专题命中 推理与问题求解 :foundation model(title,abstract);post-training(abstract)

AI总结 提出PAIWorld框架,通过几何感知交叉注意力、几何旋转位置编码和潜在3D-REPA蒸馏,解决多视图世界模型的3D不一致问题,在机器人操作基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19396 2026-06-19 q-bio.QM 新提交 82%

BioHarness: Substrate-Aware Evidence Assembly for Biomedical Question Answering across Literature, Knowledge Bases, and Biological Atlases

BioHarness:面向生物医学问答的底物感知证据组装——跨文献、知识库和生物图谱

Meng Xiao, Chuan Qin, Jinmiao Chen, Yihang Cheng, Yuanchun Zhou, Hengshu Zhu

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract,comments);language model(abstract,comments)

AI总结 提出BioHarness,通过级联控制机制在文献检索、知识库和生物图谱间选择性组装证据,提升生物医学问答准确率,在19,302个问答项上得分从65.9提升至71.0。

Comments 14 Pages, 11 Figures, Keywords: biomedical question answering; retrieval-augmented generation; large language models; evidence assembly; biomedical knowledge bases; biological atlases

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15860 2026-06-16 math.GM 新提交 82%

New lower bounds for the degree/diameter problem via interaction with a browser-accessible LLM

通过浏览器可访问的LLM交互得到度/直径问题的新下界

Ryosuke Mizuno

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 通过与ChatGPT交互发现图构造,改进了度/直径问题的下界:N(12,5)≥34,992和N(16,5)≥147,456。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16380 2026-06-12 cs.CL cs.AI cs.CY cs.HC cs.LG 版本更新 82%

MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes

MoReBench:评估语言模型中的程序性和多元道德推理,超越结果

Yu Ying Chiu, Michael S. Lee, Rachel Calcott, Brandon Handoko, Paul de Font-Reaulx, Raphaël Millière, Paula Rodriguez, Chen Bo Calvin Zhang, Ziwen Han, Udari Madhushani Sehwag, Yash Maurya, Christina Q Knight, Harry R. Lloyd, Florence Bacus, Conor Downey, Mantas Mazeika, Bing Liu, Yejin Choi, Mitchell L Gordon, Sydney Levine

机构 * University of Washington(华盛顿大学) New York University(纽约大学) Scale AI Harvard University(哈佛大学) University of Michigan(密歇根大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Center for AI Safety(人工智能安全中心) Stanford University(斯坦福大学) MIT(麻省理工学院) University of Oxford(牛津大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MoReBench基准,包含1000个道德场景和超过2.3万条标准,用于评估语言模型在道德推理中的程序性推理能力,发现现有基准无法预测模型表现,且模型对特定道德框架存在偏好。

Comments 46 pages, 8 figures, 10 tables. Published in ICLR 2026. Accepted at CHAI workshop and SPP 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12195 2026-06-11 cs.CV 新提交 82%

InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

InternVideo3: 用多模态上下文推理代理化基础模型

Ziang Yan, Sheng Xia, Jiashuo Yu, Yue Wu, Tianxiang Jiang, Songze Li, Kanghui Tian, Yicheng Xu, Yinan He, Kai Chen, Limin Wang, Yu Qiao, Yi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 推理与问题求解 :foundation model(title,abstract);pretraining(abstract)

AI总结 提出InternVideo3框架,通过多模态上下文推理(MCR)和高效KV缓存压缩方法M^2LA,增强长视频理解与迭代交互能力,在多个基准上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15327 2026-06-09 cs.LG cs.AI cs.CL stat.ML 版本更新 82%

Prescriptive Scaling Reveals the Evolution of Language Model Capabilities

规范性缩放揭示语言模型能力的演变

Hanlin Zhang, Jikai Jin, Vasilis Syrgkanis, Sham Kakade

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过大规模观测评估和分位数回归,提出规范性缩放定律,将预训练计算预算映射到下游准确率,并验证其时间稳定性,引入平衡I-最优采样算法降低评估成本。

Comments ICML 2026 Oral. Blog Post: https://jkjin.com/prescriptive-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06474 2026-06-05 cs.CL cs.AI cs.LG 82%

Self-Augmenting Retrieval for Diffusion Language Models

扩散语言模型的自增强检索

Paul Jünger, Justin Lovelace, Linxi Zhao, Dongyoung Go, Kilian Q. Weinberger

机构 * University of California, Berkeley(加州大学伯克利分校) Google Research(谷歌研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SARDI框架,利用扩散语言模型去噪过程中丢弃的低置信度标记作为前瞻信号指导检索,无需训练且与检索器无关,在多跳问答基准上以高达8倍吞吐量超越现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04236 2026-06-04 cs.CL cs.AI cs.LG 82%

Supportive Token Revealing for Fast Diffusion Language Model Decoding

支持性标记揭示:快速扩散语言模型解码

Giries Abu Ayoub, Mario Barbara, Lluís Pastor-Pérez, Tanja Bien, Aneesh Barthakur, Alaa Maalouf, Loay Mualem

机构 * Department of Computer Science, University of Haifa(海法大学计算机科学系) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) IMPRS-IS

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AXON模块,通过选择注意力、不确定性和置信度信号中的锚点标记来改善扩散语言模型并行解码的质量-延迟权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02321 2026-06-02 cs.CV 82%

Training-Free Composed Video Retrieval via Visual Representation-Guided Video-LLM Reasoning

基于视觉表示引导的视频-大语言模型推理的无训练组合视频检索

Yang Liu, Qianqian Xu, Peisong Wen, Siran Dai, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract)

AI总结 提出无训练框架,先利用冻结DINOv3模型筛选视觉相关候选,再通过大视觉语言模型评估指令匹配,最后推理精化,在CVPR 2026挑战赛中取得48.78 Recall@1和51.48 Recall@5。

Comments CVPR 2026, VidLLMs workshop

详情

展开后加载摘要…

URL PDF HTML 收藏