arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18875 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18875 篇

2509.01412 2026-06-26 cs.CL 版本更新 90%

Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning

Vis-CoT:一种用于LLM思维链推理中交互式可视化和干预的人机协同框架

Kaviraj Pather, Elena Hadjigeorgiou, Arben Krasniqi, Claire Schmit, Irina Rusu, Marc Pons, Kabir Khan

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Vis-CoT框架,将线性思维链文本转换为交互式推理图,允许用户可视化逻辑流程、识别错误步骤并通过剪枝和嫁接进行干预,显著提升推理准确性和用户信任。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22375 2026-06-23 cs.AI cs.CE cs.IR 新提交 90%

ARIA: A Causal-Aware Framework for Rescuing LLM Reasoning in Trustworthy Materials Discovery

ARIA: 一种用于在可信材料发现中拯救LLM推理的因果感知框架

Yi Cao, Liaoyaqi Wang, Jieneng Chen, Benjamin Van Durme, Alan Yuille, Paulette Clancy

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ARIA框架,通过因果感知的三级级联(直接因果推理、物理类比迁移、参数回退)解决LLM在材料发现中的上下文隧道问题,提升物理可信性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21740 2026-06-23 cs.AI 新提交 90%

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

训练编排器:一种基于监督学习的端到端PDDL规划方法,使用LLM智能体

Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

机构 * Oregon State University(俄勒冈州立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出HALO框架,通过监督学习训练编排器,利用验证器提供的轨迹作为监督信号,在11个PDDL领域上以极低成本实现与前沿LLM相当的成功率。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20895 2026-06-23 cs.AI 新提交 90%

Neurosymbolic Clinical Trial Matching via LLM-Driven Abduction and Logical Verification

基于LLM驱动溯因与逻辑验证的神经符号临床试验匹配

Baiyang Qu, Leonardo Ranaldi, Xi Wang, Marco Valentino

机构 * University of Leicester(莱斯特大学) University of Edinburgh(爱丁堡大学) University of Sheffield(谢菲尔德大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种结合大语言模型与逻辑验证的神经符号框架αNeSy-CTM,通过溯因推理处理噪声和不完整临床文本,在临床试验匹配中相对零样本基线提升30%准确率。

Comments 21 pages (including appendix), 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14935 2026-06-23 cs.AI 新提交 90%

PrologMCP: A Standardized Prolog Tool Interface for LLM Agents

PrologMCP:面向LLM代理的标准化Prolog工具接口

Agnieszka Mensfelt, Adarsh Prabhakaran, Adrian Haret, Vince Trencsenyi, Kostas Stathis

机构 * Royal Holloway, University of London(伦敦大学皇家霍洛威学院)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出PrologMCP,一个通过模型上下文协议将Prolog暴露为状态化工具的任务无关开源服务器,使LLM代理能够通过翻译-运行-检查-修复循环稳健地委托演绎推理,在PARARULE-Plus上达到或超越推理型LLM。

Comments Accepted at Joint Workshop on Statistics and Knowledge Integration for Logic, Learning, Ethical Decisions, and LLMs, 18 July 2026, Lisbon v2: Added references to other Prolog MCP servers; fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19771 2026-06-19 cs.AI 新提交 90%

Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning

超越熵:从令牌级分布偏差中学习以增强LLM推理

Xuanzhi Feng, Zhengyang Li, Zeyu Liu, Haoxi Li, Yuming Jiang, Bing Guo, Jingcai Guo, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Sichuan University(四川大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对RLVR中令牌更新导致的熵塌陷或爆炸问题,提出ICT框架,利用JS散度识别关键令牌,通过选择性更新平衡策略集中度,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19494 2026-06-19 cs.AI 新提交 90%

Hidden Anchors in Multi-Agent LLM Deliberation

多智能体LLM协商中的隐藏锚点

Apurba Pokharel, Ram Dantu

机构 * University of North Texas(北德克萨斯大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 将多智能体LLM协商建模为闭环动力系统,每个智能体有隐藏内部信念(锚点),解释协商如何超越初始信念凸包,并通过恢复锚点预测模型行为。

Comments 13 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11556 2026-06-19 cs.SE cs.AI 版本更新 90%

FM-Agent: Scaling Formal Methods to Large Systems via LLM-Based Hoare-Style Reasoning

FM-Agent: 通过基于LLM的Hoare风格推理将形式化方法扩展到大型系统

Haoran Ding, Zhaoguo Wang, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出FM-Agent框架,利用LLM自动生成函数级规范,实现大型系统的组合式推理,在143k行代码的系统中2天内发现522个新bug。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29649 2026-06-18 cs.AI 版本更新 90%

LLM-Evolved Domain-Independent Heuristics for Symbolic AI Planning

LLM进化的符号AI规划领域无关启发式

Elliot Gestrin, Jendrik Seipp

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文使用进化搜索让大语言模型生成领域无关的启发式函数,在未见测试域上超越手工最优启发式,并首次系统评估了启发式的信息性-速度权衡。

Comments Accepted at the LM4Plan workshop at ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14517 2026-06-17 cs.CR cs.AI 新提交 90%

From Shield to Target: Denial-of-Service Attacks on LLM-Based Agent Guardrails

从盾牌到靶心:针对基于LLM的智能体护栏的拒绝服务攻击

Yuguang Zhou, Xunguang Wang, Pingchuan Ma, Zhantong Xue, Zhaoyu Wang, Shuai Wang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文揭示基于LLM的护栏易受拒绝服务攻击,通过束搜索优化框架和机制感知结构变异生成恶意负载,导致令牌放大13-63倍、延迟放大148倍,威胁系统可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00826 2026-06-17 q-fin.TR cs.AI 版本更新 90%

LLM-Powered Multi-Agent System for Automated Crypto Portfolio Management

基于LLM的多智能体系统实现自动化加密货币投资组合管理

Yichen Luo, Yebo Feng, Jiahua Xu, Paolo Tasca, Yang Liu

机构 * University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) Exponential Science(指数科学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个三智能体系统(市场、新闻、交易),通过分层、协作和辩论架构融合多模态信号,在2025年回测中实现133.52%累计收益和1.502夏普比率,优于单智能体和深度学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16576 2026-06-16 cs.CL 新提交 90%

Can LLM Agents Infer World Models? Evidence from Agentic Automata Learning

LLM智能体能否推断世界模型?来自智能体自动机学习的证据

Reef Menaged, Gili Lior, Shauli Ravfogel, Roee Aharoni, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) New York University(纽约大学) Google Research(谷歌研究)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出智能体自动机学习框架,通过成员查询和等价查询评估LLM智能体发现隐藏确定性有限自动机的能力,发现性能随DFA规模增加而急剧下降,推理模型优于非推理模型但仍存在规划、整合和假设构建缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16481 2026-06-16 cs.AI 新提交 90%

Steering Emotional Dynamics for Art Therapy: Controllable Narrative Script Generation through Hierarchically Guided LLM Agents

引导艺术治疗的情感动态:通过分层引导的LLM智能体实现可控叙事脚本生成

Suqing Wang, Qinghai Miao, Chao Guo, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EC-Script框架,通过分层控制情感轨迹生成叙事脚本,实现情感轨迹规划、场景驱动和局部情感调节,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16478 2026-06-16 cs.AI 新提交 90%

Tensor-Coord: Algebraic Decomposition of Joint Plan Tensors for Conflict-Free Multi-Agent LLM Planning

Tensor-Coord:用于无冲突多智能体LLM规划的联合计划张量代数分解

Mudit Rastogi

机构 * University of Michigan(密歇根大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Tensor-Coord框架,将多智能体联合计划表示为三阶张量,通过CP和Tucker分解识别协调结构,计算协调复杂度并定位冲突,实现无冲突规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16328 2026-06-16 cs.AI 新提交 90%

AdaSTORM: Scaling LLM Reasoning on Dynamic Graphs via Adaptive Spatio-Temporal Multi-Agent Collaboration

AdaSTORM: 通过自适应时空多智能体协作扩展动态图上的LLM推理

Bing Hao, Ruijie Wang, Haodong Qian, Yunlong Chu, Yuhang Liu, Yumeng Lin, Minglai Shao, Jianxin Li

机构 * Tianjin University, China(天津大学,中国) Beihang University, China(北航大学,中国)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AdaSTORM框架,通过自适应分区和时空解耦的多智能体协作,将动态图推理扩展到千节点规模,准确率超90%,无需外部工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13693 2026-06-16 cs.CY cs.AI 新提交 90%

Limited Marginal Benefit of Reasoning-Heavy LLM Deployment in ESG Narrative Scoring: A 4-Model Consensus Study on Japanese Listed Firms

ESG叙述评分中重度推理LLM部署的有限边际收益:一项关于日本上市公司的4模型共识研究

Hiroyuki Kokubu

机构 * Kansai University(关西大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过4模型共识设计,研究在ESG叙述评分中,重度推理模型相比非推理模型是否带来显著收益,发现其边际收益有限且成本高昂。

Comments 12 pages. Earlier version available on SSRN, Abstract ID 6683303

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03108 2026-06-15 cs.AI 版本更新 90%

EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

EvoTrainer: 协同进化LLM策略与训练框架以实现自主智能体强化学习

Guhong Chen, Yingcheng Shi, Yongbin Li, Binhua Li, Xander Xu, Hu Wei, Shiwen Ni, Min Yang, Jieping Ye

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团) Alibaba Group(阿里巴巴集团) SUAT(深圳大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出EvoTrainer框架,通过协同进化LLM策略和训练端框架,基于经验反馈自动诊断、修正并积累可复用技能,在数学推理、编程竞赛和仓库级软件工程任务上匹配或超越人工设计的RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12657 2026-06-12 cs.AI cs.DB cs.RO 新提交 90%

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

TrajGenAgent: 一种用于人类移动轨迹生成的分层LLM智能体

Siyu Li, Toan Tran, Lingyi Zhao, Khurram Shafique, Li Xiong

机构 * Emory University(埃默里大学) University of Florida(佛罗里达大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出TrajGenAgent,一种无需微调的分层LLM智能体框架,通过编排器-工作者两阶段设计生成真实轨迹,在时空保真度、语义一致性和个体行为真实性上优于现有方法。

Comments 14 pages, 2 figures, 8 tables. Accepted by the 27th IEEE International Conference on Mobile Data Management (MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10307 2026-06-10 cs.CL 新提交 90%

Early-Token Confidence Predicts Reasoning Quality in Multi-Agent LLM Debate

早期令牌置信度预测多智能体LLM辩论中的推理质量

Ali Keramati, Justin Cheok, Jacob Horne, Mark Warschauer

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 研究利用解码时令牌级对数概率作为置信度信号,预测多智能体LLM辩论中的推理质量,发现早期令牌置信度是最强预测因子。

Comments 15 pages, 8 figures, 4 tables; ACL Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10304 2026-06-10 cs.CL 新提交 90%

MIRAGE: A Polarity-Flipping Encoding Subspace in LLM Agents

MIRAGE: LLM智能体中的极性翻转编码子空间

Pratibha Revankar, Kargi Chauhan, Jihye Kim, Sadiba Nusrat Nur, Vincent Siu, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 发现LLM智能体在隐蔽编码敏感数据时,残差流中存在共享的低维编码子空间,通过逻辑回归探针可高精度检测,并构建MIRAGE实时监控器,在126个场景中AUC达0.918,远超仅输出检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09071 2026-06-09 cs.AI 新提交 90%

REFLECT: Intervention-Supported Error Attribution for Silent Failures in LLM Agent Traces

REFLECT: 针对LLM智能体轨迹中静默失败的干预支持错误归因

Xiaofeng Lin, Yingxu Wang, Tung Sum Thomas Kwok, Daniel Guo, Sahil Arun Nale, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出REFLECT方法,通过诊断候选错误步骤、使用诊断特定补丁进行受控重放测试,并利用验证结果作为对比证据来细化归因,在四个基准上取得最高定位准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08661 2026-06-09 cs.CR cs.AI cs.DB 新提交 90%

Data Agents Under Attack: Vulnerabilities in LLM-Driven Analytical Systems

数据代理遭受攻击:LLM驱动的分析系统中的漏洞

Kuncan Wang, Ziting Wang, Peizhuo Lv, Haoyang Li, Guoliang Li, Gao Cong, Wei Dong

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究系统分析了LLM驱动的数据代理的安全漏洞,提出了分层漏洞框架和攻击分类法,并在六个系统上评估了攻击效果,揭示了当前系统的重大安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07790 2026-06-09 cs.LG 新提交 90%

Byzantine Cheap Talk: Adversarial Resilience and Topology Effects in LLM Coordination Games

拜占庭廉价谈话:LLM协调博弈中的对抗韧性与拓扑效应

Aya El Mir, Martin Takáč, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 研究多智能体LLM在协调博弈中面对拜占庭攻击和通信拓扑限制的脆弱性,发现智能体无法集体适应背叛,且显式限制拓扑会破坏合作,而隐式限制则不影响。

Comments Accepted at NETYS 2026 (The International Conference on Networked Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06399 2026-06-09 cs.CL 版本更新 90%

CollabSim: A CSCW-Grounded Methodology for Investigating Collaborative Competence of LLM Agents through Controlled Multi-Agent Experiments

CollabSim: 一种基于CSCW的方法,通过受控多智能体实验研究LLM智能体的协作能力

Jiaju Chen, Bo Sun, Yuxuan Lu, Yun Wang, Dakuo Wang, Bingsheng Yao

机构 * Northeastern University(东北大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CollabSim框架,结合CSCW理论定义协作能力、控制交互条件并探测智能体内部状态,以系统分析LLM多智能体系统的协作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09402 2026-06-08 cs.CL 版本更新 90%

SEEK: Steering LLM Reasoning for RAG via Internal Reasoning Sketches

SEEK: 通过内部推理草图引导LLM推理用于RAG

Xinze Li, Yuqing Lan, Zhenghao Liu, Haidong Xin, Yukun Yan, Shuo Wang, Zheni Zeng, Sen Mei, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系,人工智能研究院) School of Intelligent Science and Technology, Nanjing University, China(南京大学智能科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SEEK框架,通过构建结构化引导草图,迭代检索和填充知识槽,减少冗余检索,提升RAG性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05806 2026-06-05 cs.AI 90%

When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents

当工具失效时:LLM智能体动态重规划与异常恢复的基准测试

Dongsheng Zhu, Xuchen Ma, Yucheng Shen, Xiang Li, Yukun Zhao, Shuaiqiang Wang, Lingyong Yan, Dawei Yin

机构 * Shanghai AI Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Sochow University(苏州大学) Shandong University(山东大学) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出ToolMaze基准,通过有向无环图拓扑复杂度和工具扰动分类法,评估LLM智能体在工具失效时的动态重规划与错误恢复能力,发现模型对隐式语义故障的恢复率下降约37%,且智能体容错性随模型规模增长的速度远慢于基本任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05268 2026-06-05 cs.GR cs.LG 90%

Aggregating LLM-Based Weak Verifiers for Spatial Layout Generation

基于LLM的弱验证器聚合用于空间布局生成

Sharon Zhang, R. Kenny Jones, Jiajun Wu, Maneesh Agrawala

机构 * Stanford University(斯坦福大学) Roblox

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 提出一种通过聚合LLM生成的弱验证器来构建强验证器的流水线,用于空间布局领域,在3D房间布局和2D海报设计任务中F1分数提升高达7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03606 2026-06-04 cs.CR cs.AI 90%

Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks

测试大语言模型算术推理泛化能力:自动数值重映射攻击

Malia Barker, Bishal Lakha, Edoardo Serra, Francesco Gullo

机构 * Department of Computer Science, Boise State University(计算机科学系,博伊州立大学) University of L’Aquila(拉奎拉大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出自动数值重映射攻击算法,通过保持推理程序的小数值变化测试LLM算术推理鲁棒性,发现GSM8K上准确率下降12-26个百分点,而MAWPS和MultiArith更稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25200 2026-06-04 cs.CL 90%

GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning

GroupTravelBench: 多人群组旅行规划中LLM智能体的基准测试

Xiang Cheng, Yulan Hu, Lulu Zheng, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出GroupTravelBench基准,通过多用户多轮对话任务评估LLM智能体在偏好获取、冲突协调和公平规划三方面的能力。

Comments work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01161 2026-06-04 cs.LG 90%

Reasoning Shift: How Context Silently Shortens LLM Reasoning

推理偏移:上下文如何无声地缩短LLM推理

Gleb Rodionov, Roman Garipov, George Yakushev

机构 * Yandex HSE University(俄罗斯高等经济学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过系统评估,发现推理模型在不同上下文条件下(如无关长上下文、多轮对话、子任务)对同一问题的推理链长度显著缩短(最高65%),且伴随自我验证和不确定性管理行为减少,但简单任务性能不受影响,复杂任务可能受影响。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏