arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 122 篇

2605.29742 2026-09-01 cs.AI 版本更新 57%

Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering

引用闭包检索与逐规则归因:面向真实世界法规合规问答

Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对法规合规问答中多层级权威结构的引用追踪难题,提出基于操作知识图谱的基准RegOps-Bench和统一框架RefWalk,通过共享主题锚点遍历跨文档引用、多视角候选融合及逐规则归因,显著提升检索召回率和引用准确性。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27995 2026-09-01 cs.AI 版本更新 57%

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

AsyncTool: 多任务场景下异步函数调用能力的评估

Kou Shi, Ziao Zhang, Shiting Huang, Avery Nie, Zhen Fang, Qiuchen Wang, Lin Chen, Huaian Chen, Zehui Chen, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出AsyncTool基准,通过模拟工具响应延迟的多任务环境,评估基于大语言模型的智能体在异步工具调用中的任务协调与效率。

Comments https://github.com/StoKou/repo-asynctool

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12729 2026-09-01 cs.NI cs.AI cs.CR 版本更新 57%

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 59 pages, 13 figures, 8 tables. Survey article. Accompanying evidence-audit dataset available on Mendeley Data, doi: 10.17632/2p5ppxzy4s.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01390 2026-09-01 cs.HC cs.AI 版本更新 57%

Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

迈向可扩展的音频描述质量控制:评估人类和VLM评分者的流程

Lana Do, Gio Jung, Juvenal Francisco Barajas, Andrew Taylor Scott, Shasta Ihorn, Alexander Mario Blum, Vassilis Athitsos, Ilmi Yoon

机构 * Northeastern University(东北大学) San Francisco State University(旧金山州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种评估人类和VLM评分者音频描述质量的流程,利用项目反应理论评估其与专家标准的匹配程度,发现VLM在大规模评估中可与人类评分者相当,但其推理可靠性较低。

Comments Accepted to ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-09-01 cs.CV cs.LG 版本更新 57%

SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 14 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00628 2026-09-01 cs.SD cs.CL 版本更新 57%

Hearing the Order: Investigating Position Bias in Large Audio-Language Models

听序:探究大型音频-语言模型中的位置偏差

Yu-Xiang Lin, Chen-An Li, Sheng-Lun Wei, Po-Chun Chen, Hsin-Hsi Chen, Hung-yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文首次系统研究了大型音频-语言模型中位置偏差问题,通过实验发现答案选项顺序影响模型性能,提出基于排列的策略可缓解偏差。

Comments The first two authors contributed equally. Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16956 2026-09-01 cs.SE cs.LG 版本更新 57%

SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

SpIDER:面向软件问题定位的时空感知密集嵌入检索

Shravan Chaudhari, Rahul Thomas Jacob, Jiajun Cao, Shihab Rashid, Mononito Goswami, Christian Bock

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SpIDER通过结合LLM推理和图结构探索信息,提升代码库中相关代码单元的密集检索性能,实验显示在多个编程语言和基准测试中性能提升达13%。

Comments EMNLP 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13206 2026-09-01 cs.AI 版本更新 57%

Real-Time Deadlines Reveal Fragile Temporal Adaptation in LLM Strategic Dialogues

实时截止时间揭示了LLM战略对话中的时间意识失败

Neil K. R. Sehgal, Sharath Chandra Guntuku, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究发现LLM在时间敏感任务中存在时间跟踪不足的问题,导致在实时截止条件下表现不佳,但能在回合制限制下表现良好。

Journal ref 2026 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08626 2026-09-01 cs.CL 版本更新 57%

How Order-Sensitive Are LLMs? OrderProbe for Deterministic Structural Reconstruction

大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建

Zhaolu Kang, Yingjie He, Kehan Jiang, Leqi Zheng, Jiachen Qian, Qianyuan Zhang, Chunlei Meng, Yujie Feng, Yuan Wang, Stephen Dou, Aming Wu, Pengxiang Zhao, Jiaxin Liu, Guansu Wang, Zeyu Zhang, Lei Wang, Qishi Zhan, Xiaomin He, Meisheng Zhang, Jianyuan Ni, Richeng Xuan

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong(香港城市大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Marquette University(马凯特大学) Juniata College(朱尼阿特学院)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18676 2026-09-01 cs.CV cs.AI 版本更新 57%

MedVision: Benchmarking Quantitative Medical Image Analysis

MedVision:定量医学图像分析的基准测试

Yongcheng Yao, Yongshuo Zong, Raman Dutt, Yongxin Yang, Sotirios A Tsaftaris, Timothy Hospedales

机构 * University of Edinburgh(爱丁堡大学) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对当前医学视觉语言模型缺乏定量推理能力的问题,提出MedVision数据集和基准,涵盖22个公共数据集、3080万图像-标注对,通过监督和强化微调显著提升检测、肿瘤/病变大小估计和角度/距离测量性能。

Comments Paper accepted to EMNLP26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09347 2026-09-01 cs.CL 版本更新 57%

LLP: LLM-Based Product Pricing in E-commerce

LLP:基于大语言模型的电商产品定价方案

Hairu Wang, Sheng You, Qiheng Zhang, Xike Xie, Shuguang Han, Yuchen Wu, Fei Huang, Jufeng Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xianyu of Alibaba(阿里巴巴闲鱼)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对C2C平台二手卖家定价难题,研究人员提出首个基于LLM的二手产品定价框架LLP,经两阶段优化与置信过滤后,在闲鱼部署的性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31041 2026-09-01 q-fin.CP 新提交 50%

Agentic Quantitative Trading: A Survey of Workflows, Systems, and Evaluation

智能体量化交易:工作流、系统与评估综述

Fengrui Hua, Hengyi Yang, Xinlei Hao, Haohan Zhang, Bokai Cao, Yiyan Qi, Jia Li, Jian Guo

专题命中 推理评测 :reasoning(abstract)

AI总结 该综述梳理智能体量化交易的工作流阶段、系统特性与评估基准,指出当前系统多集中于信号发现,多智能体系统依赖聚合,且模型能力未必转化为实盘交易性能,并展望了未来研究方向。

Comments 9 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30441 2026-09-01 cs.CR 新提交 50%

ECLIPSE: Self-Evolving Stealthy Prompt Injection Attack against Long-Horizon Agentic Systems

ECLIPSE:针对长视程智能体系统的自演化隐蔽提示注入攻击

Shiqian Zhao, Yangfan Zhou, Xinfeng Li, Runyi Hu, Yechao Zhang, Yi Xie, Tianwei Zhang, Luu Anh Tuan

专题命中 推理评测 :planning(abstract)

AI总结 本研究提出ECLIPSE框架,结合隐蔽攻击轨迹合成与工具链引导,在LASE-Bench上实现高攻击成功率,现有安全措施难以可靠防御,凸显需开发更有效防御手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30199 2026-09-01 eess.SY cs.SY 新提交 50%

A High-Resolution Synthetic EV Charging Dataset for Cold-Climate Distribution Grid Impact Analysis: Trondheim, Norway (2020-2030)

用于寒区配电网影响分析的高分辨率合成电动汽车充电数据集:挪威特隆赫姆(2020-2030)

Hanieh Taraghi Nazloo, Petr Musilek

专题命中 推理评测 :planning(abstract)

AI总结 该研究构建了挪威特隆赫姆2020-2030年寒区高分辨率合成EV充电数据集,整合多类特征与CTGAN等模型生成,为配电网相关分析提供基准。

Comments 10 pages, 4 figures, 2 tables. Dataset available on Zenodo: DOI 10.5281/zenodo.22132618

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30068 2026-09-01 cs.CV 新提交 50%

TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

TAKE 85:基于85小时电影时长的电影创作者意图测试基准

Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant, Xi Wang, Dimitris Samaras, Vicky Kalogeiton

机构 * LIX, Ecole Polytechnique, IP Paris(巴黎综合理工学院LIX实验室、巴黎IP大学) New York University(纽约大学) Ecole nationale supérieure Louis-Lumière(路易卢米耶高等国家学院) Stony Brook University(石溪大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文推出首个导演意图理解基准TAKE 85,通过实验发现当前顶尖MLLMs在感知识别与意图理解间存在显著差距,最强模型仅得58分,单一模态无法支撑意图理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29802 2026-09-01 cs.CV 新提交 50%

Foundation and Multimodal Large Language Models for Face Presentation and Morph Attack Detection

用于人脸呈现与变形攻击检测的基础模型及多模态大语言模型

Hatef Otroshi Shahreza, Asif Hussain Khan, Peter Lorenz, Alain Komaty, Sébastien Marcel

机构 * Idiap Research Institute(Idiap研究所) Université de Lausanne(洛桑大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究通用基础模型和多模态大语言模型是否包含人脸呈现与变形攻击相关信息,通过五种方法在8个公开数据集上测试,发现微调后模型跨数据集检测性能达SOTA,将开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29632 2026-09-01 cs.SE 新提交 50%

InteractBench: Benchmarking LLMs on Competitive Programming under Unrevealed Information

InteractBench:针对未公开信息下的竞赛编程任务评估大语言模型(LLM)

Jiaze Li, Aocheng Shen, Bing Liu, Boyu Zhang, Xiaoxuan Fan, Qiankun Zhang, Xianjun Deng

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对现有LLM竞赛编程基准的不足,推出含322道题的InteractBench基准,评估LLM在未公开信息交互式竞赛编程任务的表现,发现先进模型存在显著交互差距并提出失败分类法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29016 2026-09-01 cs.CV cs.SE 新提交 50%

Towards Fully Automated Medical Imaging Code Generation via Validation-based Context Engineering

基于验证的上下文工程实现全自动医学影像代码生成

Zixiao Zhao, Jing Sun, Zhe Hou, Cheng-Hao Cai, Qian Liu, Mengze Li, Zijian Zhang, Jin Song Dong

机构 * University of Auckland(奥克兰大学) Griffith University(格里菲斯大学) Suzhou Industrial Park Monash Research Institute of Science and Technology(苏州工业园区莫纳什科技研究院) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出AutoMedImg多智能体框架,通过规划与编码阶段的多阶段验证及自动上下文工程,实现零人工干预的全自动医学影像代码生成,在六个数据集上分割任务Dice最高0.90、分类准确率99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05003 2026-09-01 cs.HC 50%

PhysDox: Benchmarking LLMs on Physical Feasibility Auditing of Physiological Sensing Protocols

PhysDox: 对生理传感协议的物理可行性审计进行LLM基准测试

He Liu, Boyuan Gu, Shuaiqi Cheng, Haiyang Sun, Siyu You, Xuming Hu

专题命中 推理评测 :reasoning(abstract)

AI总结 提出PhysDox基准,通过两阶段评估(严重性检测和约束级诊断)测试LLM对生物医学协议物理可行性的审计能力,发现模型存在支架偏差和隐式约束高漏检率等问题。

Comments 31 Pages,7 Figures

Journal ref EMNLP 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16990 2026-09-01 cs.CV 版本更新 50%

Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding

Dimple:采用并行解码的离散扩散多模态大语言模型

Runpeng Yu, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本研究提出首个离散扩散多模态大语言模型Dimple,采用自回归与扩散结合的训练范式,性能优于LLaVA-NEXT 3.9%,通过置信解码提升推理效率,还探索了结构先验的响应控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 48 篇

2606.11052 2026-09-01 cs.CL 版本更新 92%

Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It

混合LLM中的注意力遗忘:当CoT微调破坏长程记忆时,如何修复

Xinyu Zhou, Boyu Zhu, Yi Xu, Zhiwei Li, Yingfa Chen, Huiming Wang, Zhijiang Guo

机构 * LARK, HKUST(GZ)(香港科技大学(广州)LARK实验室) UCL(伦敦大学学院) Mistral AI Tsinghua University(清华大学) SUTD(新加坡科技设计大学) HKUST(香港科技大学)

专题命中 其他推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 发现CoT监督微调会系统性降低混合线性注意力模型的长上下文召回能力,提出QK-Restore方法通过恢复微调前的查询-键投影矩阵来修复,无需额外训练。

Comments Accepted to EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29070 2026-09-01 cs.LG 新提交 91%

Selective Disclosure of Hidden Directives in Reasoning Models: Behavioral Asymmetry and Steering

推理模型中隐藏指令的选择性披露:行为不对称性与引导

Zimo Shi, Xander Tifft, Wen Xing

机构 * SPAR Research(SPAR研究院) Yale University(耶鲁大学)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对8个前沿推理模型,发现其CoT对恶意隐藏指令的披露概率高于良性指令,存在行为不对称性,且共享隐藏方向的差异化激活是该不对称性的来源。

Comments 22 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29783 2026-09-01 cs.CV 新提交 89%

InspectorGPT: A Comparative Reasoning Enhanced VLM for Comprehensive Industrial Anomaly Detection

InspectorGPT:用于全面工业异常检测的对比推理增强型视觉语言模型(VLM)

Weifei Chen, Honghao Zhang, Zhiyuan You, Xinyi Le

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本研究提出InspectorGPT,一种结合对比推理的VLM框架,通过CoT微调与GRPO优化,配合任务向量融合的InspectorGPT-Seg实现工业异常检测,在多维度性能及未见基准泛化上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22280 2026-09-01 cs.CV 版本更新 85%

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28859 2026-09-01 cs.LG cs.AI cs.CL 新提交 83%

The Halt Vector: Internalizing a Causal Steering Intervention for Efficient Reasoning

停止向量:内化因果引导干预以实现高效推理

Dylan Jayabahu, Tinuade Adeleke

机构 * University of Waterloo(滑铁卢大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出通过将因果可解释性发现内化到权重中得到的停止向量,可在保持准确率的前提下减少推理模型约四分之一的思考时长,解决其不终止问题,核心贡献为该停止向量的获取方法。

Comments 23 pages, 3 figures. Accepted at the 2nd Workshop on Efficient Reasoning, COLM 2026 (non-archival). Code: https://github.com/dylanjayabahu/halt-vector

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30632 2026-09-01 cs.CL cs.AI cs.LG 新提交 82%

GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning

GMTS:基于梯度幅度的令牌选择改进用于大语言模型推理的RLVR训练

Outongyi Lv, Yuanwei Zhang, Xiaoqun Zhang

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Institute of Natural Sciences, Shanghai Jiao Tong University(上海交通大学自然科学研究院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对RLVR训练中高熵令牌重要性机制不明的问题,提出GMTS方法量化令牌重要性,实验显示其在多领域、多模型规模下性能优于熵基选择。

Comments Findings of the 2026 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09627 2026-09-01 cs.SE 版本更新 82%

LogICL: Distilling LLM Reasoning to Bridge the Semantic Gap in Cross-Domain Log Anomaly Detection

LogICL: 通过蒸馏大语言模型推理来弥合跨域日志异常检测中的语义鸿沟

Jingwei Ye, Zhi Wang, Chenbin Su, Jieshuai Yang, Jiayi Ding, Chunbo Liu, Ge Chu

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 LogICL通过蒸馏大语言模型推理,提升跨域日志异常检测的语义理解与泛化能力,实现更准确的检测与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30399 2026-09-01 cs.CL cs.AI 新提交 81%

SemPOI-RL: Aligning LLM Semantic Reasoning for Interpretable Out-of-Town POI Sequential Generation

SemPOI-RL:对齐大语言模型语义推理以实现可解释的异地兴趣点序列生成

Yunqi Liu, Yang Zhang, Ruixing Zhang, Liangzhe Han, Yi Qiao, Tongyu Zhu, Leilei Sun

机构 * State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SemPOI-RL框架通过微调LLM、引入SPAM模块并结合推荐导向强化学习,实现LLM语义推理与结构化序列生成的对齐,在两个真实数据集上优于传统推荐器和LLM基线,可生成可解释的异地POI序列。

Comments 19 pages in total, including 9 pages of main text and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09600 2026-09-01 cs.AI cs.CL 版本更新 81%

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation

Agora:通过基于拍卖的任务分配增强大语言模型智能体推理

Kaiji Zhou, Aleš Leonardis, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究旨在增强LLM智能体推理能力,提出Agora框架,通过基于拍卖的机制动态分配任务,将推理步骤视为可交易项目让智能体依纠正能力投标,实验表明该框架在多基准测试中表现优且能实现成本-质量权衡。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21054 2026-09-01 cs.AI cs.CL 版本更新 81%

Reasoning or Rambling? Exploring the Effect of Thinking on Agent Persuasion

推理还是漫谈?探究思考过程对智能体说服能力的影响

Haodong Zhao, Jidong Li, Zhaomin Wu, Tianjie Ju, Zhuosheng Zhang, Bingsheng He, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) National University of Singapore(新加坡国立大学) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文对比通用LLM与LRM,发现推理对智能体说服能力存在二元性影响,还揭示其依赖表面线索的漏洞,提出提示级对抗性论点检测方法以提升鲁棒性。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏