arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18875 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18875 篇

2402.11821 2024-11-01 cs.LG cs.CL cs.IR cs.SI 86%

Microstructures and Accuracy of Graph Recall by Large Language Models

Yanbang Wang, Hejie Cui, Jon Kleinberg

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.LG;LLM(comments)

Comments Accepted at NeurIPS 2024; Code available at: https://github.com/Abel0828/llm-graph-recall

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14613 2026-08-18 cs.AI 新提交 85%

Do LLM Agents Negotiate Rationally? A Mechanism-Design Framework for Verifiable Multi-Agent Interaction over A2A/MCP

大语言模型智能体是否进行理性协商?面向A2A/MCP的可验证多智能体交互机制设计框架

Wael Albayaydh, Rui Zhao

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对A2A/MCP协议提出可验证多智能体交互机制设计框架,实验发现机制激励兼容性无法自动迁移至大语言模型智能体行为,相关成果连接经典多智能体理论与现代LLM智能体基础设施。

Comments 20 pages , 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14610 2026-08-18 cs.AI 新提交 85%

When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning

大型语言模型何时适用错误法律?诊断大型语言模型在时间法律推理中的失败

Yiqian Huang, Shuyuan Zheng, Qianying Liu, Shaowen Peng, Yuntao Kong, Kotaro Funakoshi, Chuan Xiao, Manabu Okumura, Yang Cao

机构 * Institute of Science Tokyo(东京科学大学) Osaka University(大阪大学) NII LLMC(日本信息学研究所语言、语言学与媒体中心) Nara Institute of Science and Technology(奈良科学技术研究所) Center of Juris-Informatics, ROIS-DS(日本学术研究推进机构跨学科科学研究中心法学信息学中心)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文构建基准评估LLMs的时间适用法律判定能力,发现LLMs存在适用最新法律的偏差,该偏差源于强化学习塑造的显式推理导致推理路径多样性减少,通用推理能力更强的模型在时间法律推理中表现更差,为相关优化提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03093 2026-08-18 cs.CL cs.SD 85%

Revisiting Direct Speech-to-Text Translation with Speech LLMs: Better Scaling than CoT Prompting?

重新审视基于语音大语言模型的直接语音到文本翻译:比CoT提示更好的扩展性?

Oriol Pareras, Gerard I. Gállego, Federico Costa, Cristina España-Bonet, Javier Hernando

机构 * Barcelona Supercomputing Center, Spain(巴塞罗那超级计算中心,西班牙) Universitat Politècnica de Catalunya, Spain(加泰罗尼亚理工大学,西班牙) DFKI GmbH, Saarland Informatics Campus, Saarbrücken, Germany(德意志联邦计算机研究中心(DFKI) GmbH,萨尔布吕肯,德国)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文比较了CoT和直接提示在增加S2TT数据量下的表现,发现直接提示在数据增加时表现更优,可能成为更大资源下的更有效方法。

Comments To appear in Proc. ICASSP 2026, May 04-08, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27143 2026-08-13 cs.CR cs.AI 版本更新 85%

Enhancing Linux Privilege Escalation Attack Capabilities of Local LLM Agents

增强本地大语言模型代理的Linux提权攻击能力

Benjamin Probst, Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究通过系统性实验验证针对性干预能否提升本地开源模型在Linux提权中的性能,发现开源模型可匹配甚至超越云模型,且反思类干预效果最佳,但漏洞发现仍是本地模型的瓶颈。

Comments Accepted at RAISE workshop (https://raise-workshop.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05833 2026-08-11 cs.AI 版本更新 85%

ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion

ViSR-KGC:结合视觉语言模型的视觉子图推理用于多模态知识图谱补全

Jiafan Li, Mengxue Yang, Jiaqi Zhu, Liang Chang, Ying Li, Hongan Wang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) CITIC Securities(中信证券) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对多模态知识图谱补全的痛点,提出ViSR-KGC方法,结合表示学习、视觉语言模型与预训练常识,通过提取查询感知子图并转换为可视化内容辅助VLM推理缺失实体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02149 2026-08-04 cs.AI 新提交 85%

Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning

超越均值:面向大语言模型推理的多时刻策略优化

Yijun Zhang, Yule Xie, Jiaxin Ding, Xin Ding, Fan Xu, Haoxiang Zhang, Luoyi Fu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对大语言模型推理提出多时刻策略优化(MMPO)框架,联合最小化失败概率分布的多个矩,在五个数学推理基准上优于基线方法,为策略优化目标设计提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04998 2026-08-04 cs.AI 85%

Mathematical Reasoning for Unmanned Aerial Vehicles: A RAG-Based Approach for Complex Arithmetic Reasoning

无人机数学推理:基于检索增强生成的方法用于复杂算术推理

Mehdi Azarafza, Mojtaba Nayyeri, Faezeh Pasandideh, Steffen Staab, Achim Rettberg

机构 * Department of Computer Science(计算机科学系) Institute For Artificial Intelligence(人工智能研究所) Hamm-Lippstadt University of Applied Sciences(哈姆-利普施塔特应用科学大学) University of Stuttgart(斯图加特大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract,journal_ref);language model(abstract,journal_ref);分类 cs.AI

AI总结 本文提出RAG-UAV框架,通过引入领域文献提升LLM在无人机任务中的数学推理能力,实验表明检索显著提高准确率并减少错误选择。

Comments 15 pages, 7 figures, 4 appendix subsections

Journal ref ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27484 2026-07-31 cs.AI cs.MA 新提交 85%

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

技能使用还是技能表演?评估技能增强型语言智能体中的推理后台

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

专题命中 推理与问题求解 :language agent(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24789 2026-07-29 cs.IR cs.CV cs.LG cs.MM 新提交 85%

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

NEXT:通过视觉语言模型进行推理驱动的视频推荐

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22621 2026-07-28 cs.AI 新提交 85%

Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning

Opti-Q:一种用于多语言模型问题规划的基于约束的优化框架

Aamir Hamid, Bharg Barot, Satvik Racharla, Tim Finin, Primal Pappachan, Roberto Yus

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Portland State University(波特兰州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多语言模型预算部署难题,提出OPTI-Q框架。该框架将模型调用建模为执行DAG操作符,利用PERFDB估计质量和成本,经帕累托前沿搜索选计划,在指定预算下于MMLU-Pro和SimpleQA上提升QoA,实现更好的质量-资源权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20500 2026-07-24 cs.AI 新提交 85%

FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Involving Conflicts

FlowEdit:针对涉及冲突的不适定问题的大语言模型推理流的信息论控制

Sizhe Tang, Guangyu Jiang, Yu Li, Rongqian Chen, Ioannis G. Kevrekidis, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对开放世界中因条件冲突等导致的不适定问题,提出FlowEdit框架利用信息论原理控制大语言模型推理流,能生成多样替代响应,实验证明其优于专有模型,提升了准确率和响应信息性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30420 2026-07-23 cs.LG 版本更新 85%

Experience Augmented Policy Optimization for LLM Reasoning

经验增强策略优化用于大语言模型推理

Jinda Lu, Kexin Huang, Junkang Wu, Shuo Yang, Jinghan Li, Chiyu Ma, Shaohang Wei, Xiang Wang, Guoyin Wang, Jingren Zhou

专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出经验增强策略优化(EAPO),通过将先验RL优化策略作为动作级经验先验并在关键决策点选择性注入,配合自适应重要性采样,解决RLVR中采样成本高和经验利用不足问题,在多个基准上提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05282 2026-07-22 cs.CL 85%

Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning

并非所有错误都是同等重要:ASCoT解决高效大语言模型推理中的晚期脆弱性

Dongxu Zhang, Yujun Wu, Yiding Sun, Jinnan Yang, Ning Yang, Jihua Zhu, Miao Xin, Baoliang Tian

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Institute of Automation, CASIA(中国科学院自动化研究所) Bytedance(字节跳动)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ASCoT通过自适应校正机制提升大语言模型推理效率与可靠性,减少计算资源消耗的同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16269 2026-07-21 eess.SP cs.AI 新提交 85%

From Intent to Infrastructure: LLM-Driven Agent Compilers for ISAC Networks

从意图到基础设施:用于ISAC网络的基于大语言模型的智能体编译器

Lijie Zheng, Xudong Zhong, Baoquan Ren, Xiangwu Gong, Xinghui Zhu, Ji He

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Institute of Systems General, Academy of Systems Engineering, Academy of Military Sciences(系统工程院系统一般研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究ISAC网络从概念验证到系统级部署的设计难题,提出基于大语言模型的智能体编译器,经四个阶段工作产生ISAC策略图,运行时引擎支持闭环自适应,以无人机救援为例展示编译过程并讨论开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17641 2026-07-21 cs.AI cs.SE 新提交 85%

Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

验证、修复、重复还是停止?大语言模型代理中用于有噪声验证-修复循环的稳健停止方法

Yitao Wu, Si Shen, Rui Yang, Hong Peng, Bin Hu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型代理中验证-修复循环有噪声时缺乏停止原则的问题,提出VRR-Stop框架,通过四参数噪声模型和信念过滤估计有效性,依真实边际增益符号决策,配对VRR-Guard,提升了停止可靠性与真实有效性。

Comments 18 pages, 10 figures, 10 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15778 2026-07-20 cs.CV cs.AI 新提交 85%

Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding

用于多事件长视频理解的模块化动态粒度视频语言模型

Wei Feng, Xin Wang, Yu-Wei Zhan, Yuwei Zhou, Wenwu Zhu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长视频理解中视觉令牌预算与多事件捕捉的矛盾问题,提出MoD-VLLM框架,含正-负视频片段定位和模块化动态粒度反射模块,结合动态粒度强化学习策略,在多事件长视频基准测试中显著优于现有基线。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14187 2026-07-17 cs.AI cs.RO 新提交 85%

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

RxBrain:具有联合语言-视觉推理与想象的具身认知基础模型

Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 研究提出具身认知基础模型RxBrain,采用统一多模态架构,通过构建自动管道训练,引入RxBrain-Bench评估,能保持具身理解和生成能力,扩展到连续机器人动作生成,为具身认知基础模型发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14103 2026-07-17 cs.CL cs.MA 新提交 85%

Latent Communication Between Language Model Agents: Channels, Alignment, and the Limits of Text

语言模型智能体之间的潜在通信:通道、对齐方式及文本的局限性

Markus Wenzel

机构 * Constructor University(康斯坦丁大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 研究大语言模型智能体间潜在通信,构建三个通信通道,通过稀疏自编码器分析信息损失,经实验发现文本通信会丢失信息,潜在通道在跨语言概念任务上与文本通道匹配但未超,得出丢失特征多编码表面形式的结论,还指出明确潜在通信优势需更深入任务及分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16395 2026-07-14 cs.AI cs.SE 版本更新 85%

LLM-Driven Collaborative Model for Untangling Commits via Explicit and Implicit Dependency Reasoning

基于显式和隐式依赖推理的大语言模型驱动的提交解缠协作模型

Bo Hou, Xin Tan, Kai Zheng, Fang Liu, Yinghao Zhu, Li Zhang

机构 * State Key Laboratory of Complex \& Critical Software Environment (SKLCCSE), School of Computer Science Engineering, Beihang University Beijing China SKLCCSE, School of Computer Science School of Computing Data Science, The University of Hong Kong Hong Kong SAR China Engineering, Beihang University Data Science, The University of Hong Kong

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对开发者常产生的缠结提交问题,提出ColaUntangle协作框架,集成大语言模型驱动智能体,构建显式和隐式上下文捕捉信息,经实验验证,该框架在提交解缠任务中性能优于基线,凸显基于大语言模型协作框架的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09452 2026-07-13 cs.SE cs.AI 新提交 85%

Practical Source Code Recovery from Binary Functions Using Anchor-Based Retrieval and LLM Reasoning

使用基于锚点的检索和大语言模型推理从二进制函数中进行实用的源代码恢复

Charles Edward Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung

机构 * McGill University(麦吉尔大学) Defence Research and Development Canada(国防研究与发展加拿大)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究如何从二进制函数恢复源代码,结合逆向工程、基于锚点检索和大语言模型推理,在基于高保真数据库对tcpdump二进制文件评估中,匹配方法实现95.2%汇编指令覆盖率,在GitHub数据库实验中平均覆盖率35.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09195 2026-07-13 cs.AI cond-mat.mtrl-sci 新提交 85%

Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents

迈向可审计的人工智能科学家:大语言模型智能体的假设演化协议

Izumi Takahara, Teruyasu Mizoguchi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学产业科学研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在让大语言模型智能体在科学发现中发挥核心作用。提出假设演化协议(HEP),使假设生成等操作可审计。在材料科学任务中,该协议能让智能体运行关键循环,跨问题概括并随模型能力提升更充分利用协议,迈向可审计的人工智能科学家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00130 2026-07-13 cs.CL 版本更新 85%

Hierarchical Chain-of-Thought: Enhancing LLM Reasoning Performance and Efficiency

层次化思维链提示:提升大语言模型推理性能与效率

Xingshuai Huang, Derek Li, Bahareh Nikpour, Parsa Omidi

机构 * Huawei Technologies Canada, Canada(华为技术加拿大公司,加拿大)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出层次化思维链提示方法,通过分层步骤规划与执行提升复杂多步推理的准确率和效率,实验显示在多种模型和任务中平均准确率提升6.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13406 2026-07-07 cs.AI 85%

AutoMathKG: The automated mathematical knowledge graph based on LLM and vector database

AutoMathKG:基于LLM和向量数据库的自动化数学知识图谱

Rong Bian, Yu Geng, Zijian Yang, Bing Cheng

机构 * Academy of Mathematics and Systems Science(数学与系统科学研究院) Chinese Academy of Sciences(中国科学院) School of Mathematical Sciences(数学科学学院) University of Chinese Academy of Sciences(中国科学院大学) AMSS Center for Forecasting Science(数学与系统科学研究院预测科学中心) State Key Laboratory of Mathematical Science(数学科学国家重点实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AutoMathKG,一种高质、广覆盖、多维度的数学知识图谱,通过LLM和向量数据库实现自动更新与知识融合,实验显示其在可达性查询和数学推理方面表现优异。

Journal ref Computational Intelligence, vol. 41, no. 4 (2025): e70096

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00049 2026-07-02 cs.SE cs.AI 新提交 85%

Prompting GPT-5 on Scrum Certification Questions: An Empirical Accuracy Study

在Scrum认证问题上提示GPT-5:一项实证准确性研究

Mirko Perkusich, Danyllo Albuquerque, João Paiva, Robson Vilar, Emanuel Dantas, Ademar França de Sousa Neto, Rohit Gheyi, Kyller Gorgônio, Angelo Perkusich

专题命中 推理与问题求解 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过三种提示技术(零样本、思维链、带源引用)测试GPT-5在993个PSM认证问题上的准确性,发现所有提示均达到85%以上准确率,其中带源引用最佳(89.1%),并分析了错误类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00447 2026-07-02 cs.CL 新提交 85%

Understanding Why Language Models Hallucinate: Testing Reasoning Against Priors

理解语言模型为何产生幻觉:针对先验知识的推理测试

Yangfan Hu, Xuhan Tong, Haoyue Bai, Xi Ding, Shashank Muralidhar Bharadwaj, Siyang Cao, Robert Nowak, Jiawei Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出推理错位假说,认为幻觉源于模型偏向统计显著的潜在关联而非遵循提示约束,并通过TrapQA测试集验证了两种偏差模式。

Comments Project page: https://neohughus.github.io/Understanding_Why_Language_Models_Hallucinate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26041 2026-06-25 cs.CV cs.CL 新提交 85%

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

OCR推理有多鲁棒?评估视觉语言模型在视觉扰动下的OCR推理鲁棒性

Yuxing Cheng, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出OCR-Robust基准,通过5种扰动类型和3种严重程度评估18个VLM在OCR推理任务上的鲁棒性,发现高干净精度不保证强鲁棒性,图表比文档更脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20448 2026-06-19 cs.CV cs.LG 版本更新 85%

Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?

视觉-语言模型是理解3D场景还是仅仅 catalogue 物体?

Animesh Maheshwari, Divyansh Sahu, Nishit Verma

机构 * Deccan AI(德克南人工智能)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文通过一个包含3034个样本的人工整理基准,探讨了视觉-语言模型对空间理解的深度有序遮挡、光学几何推断和体积重新安排规划能力,发现模型在重新安排可见布局时表现优异,但在遮挡和反射推断上表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18831 2026-06-17 cs.CL 版本更新 85%

Adaptive Activation Steering for Efficient LLM Reasoning via Closed-Loop PID Control

自适应激活引导:通过闭环PID控制实现高效LLM推理

Aryasomayajula Ram Bharadwaj

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出PID-steering方法,利用PID控制器根据块级冗余分类器动态调整激活引导强度,在减少推理开销的同时提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13909 2026-06-16 cs.GT cs.AI 版本更新 85%

TERMS-Bench: Diagnosing LLM Negotiation Agents Beyond Deal Rate

TERMS-Bench: 在交易率之外评估大语言模型谈判代理

Erica Zhang, Fangzhao Zhang, Aneesh Pappu, Batu El, Jose Blanchet, Susan Athey, Jiashuo Liu, James Zou

机构 * Stanford School of Engineering(斯坦福大学工程学院) Stanford Department of Economics(斯坦福大学经济系) Stanford Graduate School of Business(斯坦福商学院)

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 TERMS-Bench通过博弈论框架评估谈判代理,揭示其在交易率之外的性能差异,如盈余提取、线索使用和合规性。

Comments Project Site: https://terms-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏