CAPE: Corrective Actions from Precondition Errors using Large Language Models
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 17 pages, 6 figures, accepted at ICRA 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 17 pages, 6 figures, accepted at ICRA 2024
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accepted at the Findings of ACL 2023
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accepted to NeurIPS2022. Our code is available at https://github.com/kojima-takeshi188/zero_shot_cot
专题命中 推理与问题求解 :language model(title,abstract);prompting(title,abstract);LLM(abstract);large language model(abstract)
Comments The first two authors contributed equally to this work
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);prompting(abstract)
Comments The short version (v3) was accepted for oral presentation at the first LLM@IJCAI 2023 non-archival symposium, and the full version was accepted by ICONIP 2024
视频-大语言模型(Video-LLM)问答中幻觉引用的检测:自验证流水线与验证器 ablation 研究
专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.AI
AI总结 针对视频-LLM问答中引用幻觉问题,提出自验证流水线,用小型自然语言推理模型作稳定验证器,在对抗性错误前提问题上检测率达79%,并发布相关代码。
LAPF:基于大语言模型智能体的路径查找器,使用UAVScenes数据集
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出基于LLM智能体的LAPF框架,整合多模块构建闭环认知架构,在城镇级无人机导航中实现了更优路径效率,且无钳位事件,性能优于CoT提示方法。
Comments 15 pages
形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦
机构 * Islamic University of Technology(伊斯兰科技大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。
Comments 15 pages, 6 figures
LLMBDC:面向生物域的基因本体聚类语言模型
专题命中 推理与问题求解 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract,abstract_cn);分类 cs.AI
AI总结 该研究针对GO富集分析的术语冗余问题,提出无需训练的LLMBDC框架,利用LLM零样本推理聚类GO术语为生物域,在AD和FXS数据集上较基线方法显著提升了聚类性能。
ReSum: 通过强化学习协同LLM推理与摘要生成
机构 * University of Science and Technology of China(中国科学技术大学) ; AMAP, Alibaba Group(阿里巴巴集团高德地图)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出ReSum框架,利用自摘要机制让LLM压缩和组织推理轨迹,通过对比评估自适应触发摘要,在提升性能4%的同时减少18.6%的推理长度。
Comments 24 pages, including 13 pages of main text and 11 pages of appendix
奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。
Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation
使用证据引导推理提示减轻代码异味检测中的大语言模型谄媚现象
机构 * Institute of Information Technology(信息科技研究所) ; University of Dhaka(达卡大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究基于LLM的代码异味检测中谄媚偏差问题,通过MLCQ数据集评估不同提示框架影响,发现模型对提示变化敏感。提出证据引导去偏提示策略,降低决策不稳定性,提高鲁棒性,为解决该问题提供有效方法。
Comments 11 Pages
神经代理控制:一种基于深度学习的由大型语言模型驱动的用于控制安全控制的代理人工智能框架
机构 * Texas Tech University(德克萨斯理工大学) ; Cumberland University(坎伯兰大学) ; Advanced Academic Programs Science(高级学术项目科学部) ; Johns Hopkins University(约翰·霍普金斯大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 针对运营技术网络攻击问题,提出神经代理控制框架,结合基于LLM的规划器与预训练的TimesFM,并引入“反事实物理注入”机制,在工业数据集评估中表现优于基线,能有效保障关键基础设施中代理人工智能。
具体化命题提示解决大语言模型中的组合-知识二分法
机构 * Columbia University(哥伦比亚大学) ; UNIST(全南科学技术大学) ; POSCO Holdings(POSCO控股)
专题命中 推理与问题求解 :prompting(title,abstract);large language model(title);language model(title);foundation model(abstract)
AI总结 研究针对大语言模型组合-知识二分法难题,提出具体化命题提示(CPP)框架。通过明确相关命题具体化,提升推理性能,尤其在医学基准测试中表现突出,且可扩展到多种模型和参数规模,弥合两类方法差距,解决了二分法问题。
Comments 9
基于基础迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播
机构 * Emory University(埃默里大学) ; The University of Tokyo(东京大学) ; LocationMind
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);language agent(title,abstract);language model(abstract);分类 cs.AI
AI总结 提出GILP方法,结合小参数化世界模型与LLM推理,通过一致性门控减少幻觉,在规划基准上将幻觉率从0.176降至0.035,成功率从0.668提升至0.838。
Comments Under Review
CAP-CoT:用于提升大语言模型推理中思维链的循环对抗提示
机构 * Department of Electronic Engineering, Kyung Hee University(韩国庆熙大学电子工程系) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(中国电子科技大学计算机科学与工程学院) ; Henan Polytechnic University(河南理工大学) ; School of Computing, Kyung Hee University(韩国庆熙大学计算机学院)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 CAP-CoT通过循环对抗提示框架提升LLM推理的准确性和稳定性,通过生成候选推理链、构造有缺陷的链并对比反馈,优化推理过程。
LLM 生成的 VeriFast 规范实证研究
机构 * Purdue University(普渡大学) ; University of Michigan(密歇根大学) ; Meta ; Ann Arbor, Michigan, USA(美国密歇根州安阿伯) ; Menlo Park, California, USA(美国加州Menlo Park) ; West Lafayette, Indiana, USA(美国印第安纳州西拉法叶)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究评估了大型语言模型为分离逻辑验证器 VeriFast 生成规范的能力,发现虽然功能保持良好(>91%),但验证成功率仅31.4%,主要错误源于领域知识不足。
SICI:一种揭示LLM立场检测中相变的语义-语用复杂度指数
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)
专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.CL
AI总结 提出SICI指数,从七维语义-语用复杂度诊断立场检测难度,揭示LLM错误随复杂度增加从过度归因到集中弃权的相变规律,且干预方法仅沿归因-弃权轴移动而非消除瓶颈。
当智能体过早承诺:诊断LLM智能体中的过早承诺问题
机构 * Snowflake AI Research
专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.AI
AI总结 本文提出表征承诺作为跨运行隐藏状态收敛的指标,用于诊断长程LLM智能体过早承诺问题,并在多个模型和数据集上验证其预测轨迹一致性的能力。
Comments 22 pages, 16 figures Primary: cs.AI Secondary: cs.CL
面向数学错误纠正的教学对齐LLM导师
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 提出两阶段对齐流程(监督微调+偏好优化),结合合成数据提升LLM在数学错误纠正中的教学质量和事实准确性,优于基线模型并与专有模型竞争。
跨语言数学问题的LLM参数:共享还是分离?
机构 * Lamarr Institute(Lamarr研究所) ; University of Bonn(波恩大学) ; Fraunhofer IAIS(弗劳恩霍夫智能分析和信息系统研究所)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 通过跨语言机制分析,发现多语言LLM中数学相关参数存在部分跨语言重叠,且主要集中在中间层,英语参数集最大,低资源语言参数集较小。
Comments 5 pages. Accepted at ACL Student Research Workshop (SRW) 2026. Code: https://github.com/luisavictor/math-across-languages Translated Datasets: https://huggingface.co/math-across-languages Webpage: https://math-across-languages.github.io
提取语义:从URDF自动构建机器人本体的LLM引导方法
机构 * LAAS-CNRS, Department of Robotics, Toulouse, France(法国图卢兹机器人系CNRS实验室)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出利用大语言模型从URDF文件自动生成机器人语义本体,通过多数投票和语法验证确保与现有本体对齐,初步实验表明该方法能有效桥接低层描述与高层知识表示。
Journal ref 18th International Conference on Social Robotics (ICSR 2026), University of London, Jul 2026, Londres, United Kingdom
Mental-R1:面向心理健康评估的对齐LLM推理
机构 * University of Oxford(牛津大学) ; Oxford Suzhou Centre for Advanced Research(牛津大学苏州高等研究院)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出认知相对策略优化(CRPO)框架,通过阶段依赖不确定性建模和熵正则化机制,使LLM推理对齐人类认知过程,在8个心理健康数据集上加权F1平均提升10.4个百分点。
PerceptTwin:面向迭代LLM规划与验证的语义场景重建
机构 * Department of Computer Science and Operations Research, Université de Montréal(蒙特利尔大学计算机科学与运筹学系) ; Mila - Quebec AI Institute(魁北克人工智能研究所) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.AI
AI总结 提出PerceptTwin自动管道,从机器人感知的语义场景表示构建交互式仿真,结合LLM法官验证规划正确性与人类偏好,提升规划成功率约39%。
Comments Accepted at ICRA 2026 (Vienna); published on arxiv for archival purposes. See also https://percept-twin.github.io/
SMH-Bench:用于智能家居中环境基础推理与行动的LLM代理基准测试
机构 * Midea Group(美的集团) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Donghua University(东华大学) ; The University of Sydney(悉尼大学) ; Peking University(北京大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出SMH-Bench基准,基于可执行模拟器HomeEnv,通过1100个任务评估LLM在智能家居中的推理与行动能力,发现前沿模型在自动化调度、模糊处理和个性化推理方面存在不足。
深入歧义:基于A*的多智能体常识混淆攻击LLM提示
机构 * University of Liverpool(利物浦大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一种基于A*的事实错误诱导框架,通过层次化重写策略和动态语义分散系数生成语义对齐但混淆的提示,以高效攻击LLM的常识推理。
Comments Pre-print
TRACER: 基于内部强化信用与轮次级遗憾匹配的多LLM协作推理
机构 * Fudan University(复旦大学) ; Zhongguancun Academy(中关村学院) ; Academy for Advanced Interdisciplinary Studies, Peking University(北京大学先进交叉学科研究院)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出TRACER框架,通过控制器-遗憾层和生成-信用层分别学习发言时机与内容,解决多智能体强化学习中的稀疏奖励、搭便车和固定协议振荡问题,实现数学收敛的协作推理。
Comments 25 pages, 3 figures
超越单一路径:评估与增强交互式LLM代理的发散性思维
机构 * Chung-Ang University(Chung-Ang 大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出交互式基准MUTATE和策略ReDNA,用于评估和增强LLM代理在路径和动作层面的发散性思维,解决现有框架中即时收敛压力导致的动作固定问题。
Comments 28 pages, 16 figures, 19 tables
ReasonOps: 可信验证的LLM推理的统一操作范式
机构 * School of Electrical Engineering(电子工程学院) ; Computer Science (SEECS) National University of Sciences(计算机科学(SEECS)国家 Sciences and Technology)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出ReasonOps,一种将推理视为持续监控、可验证、可靠性感知的操作过程的统一范式,整合语义解释、自动形式化、符号推理、定理证明、运行时保证、概率可靠性估计和自适应修正,以解决当前LLM推理中的逻辑不一致、幻觉符号转换等问题。
Comments 5 Pages
思维图增强:由强化学习驱动的LLM自适应提示方法
机构 * School of Engineering and Computer Science(工程与计算机科学学院) ; Bern University of Applied Sciences(伯恩应用科学大学)
专题命中 推理与问题求解 :LLM(title_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出Reinforced Graph of Thoughts (RGoT),通过强化学习自动生成适应任务复杂度的思维图结构,提升大型语言模型的提示效果。
Comments 26 pages (including appendix), 16 figures