Integrating Visual Foundation Models for Enhanced Robot Manipulation and Motion Planning: A Layered Approach
专题命中 推理与问题求解 :foundation model(title,abstract)
Comments 3 pages, 2 figures, IEEE Workshop
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :foundation model(title,abstract)
Comments 3 pages, 2 figures, IEEE Workshop
专题命中 推理与问题求解 :language model(title,abstract)
Comments 6 pages, 4 figures
专题命中 推理与问题求解 :foundation model(title,abstract)
Comments In review
专题命中 推理与问题求解 :language model(title,abstract)
Comments ICRA Workshop on Robot Execution Failures and Failure Management Strategies, 2023
专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to the 1st Natural Language Reasoning and Structured Explanations Workshop (NLRSE@ACL'23). 8 pages, 4 figures, 3 tables
专题命中 推理与问题求解 :foundation model(title,abstract)
Comments 13 pages, 5 figures
专题命中 推理与问题求解 :foundation model(title,abstract)
专题命中 推理与问题求解 :foundation model(title,abstract)
Comments This paper is accepted as a poster for NDSS 2023
专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI、cs.LG
Comments 6 pages
专题命中 推理与问题求解 :SLM(title,abstract)
Comments 9 Pages, 5 Figures, 16 Equations, Design and Technology Conference, Geelong, Australia, 2016
ChaosBench-Logic v2: 大规模评估大语言模型在动力系统上的逻辑推理能力
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 推理与问题求解 :LLM(title,comments);分类 cs.AI、cs.LG
AI总结 针对二元推理基准的准确性掩盖了关键缺陷,本文提出包含40,886个问题、覆盖165个动力系统的ChaosBench-Logic v2基准和CARE评估协议,揭示模型在状态转换推理、FOL演绎等任务上的表现差异和系统性反相关。
Comments 14 pages, 8 figures. Published at the ICLR 2026 Workshop on LLM Reasoning
困惑性悖论:为什么代码在LLM提示中比数学压缩得更好
机构 * Bona Opera Studios(博纳歌剧工作室)
专题命中 推理与问题求解 :LLM(title,comments);分类 cs.CL、cs.AI
AI总结 本文揭示代码在LLM提示中比数学压缩更有效的原因,并提出TAAC算法实现更高效的压缩。
Comments 19 pages, 5 figures, 4 tables. Second paper in TAAC research series. Code and data at https://github.com/micoverde/taac-llm-compression
MACGen:通过多智能体协作实现功能正确且安全的代码生成
机构 * Seoul National University(首尔大学) ; Sungshin Women’s University(诚信女子大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI
AI总结 MACGen是整合规划等多环节的多智能体代码生成框架,在CWEval、BaxBench基准上,较直接提示显著提升安全代码生成的功能与安全性指标。
Comments 8 pages
辩论动态与价值对齐在大语言模型辩论中
机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。
Comments Accepted to COLM 2026
正确诊断,装饰性推理:医学思维链的扰动审计
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; Dana-Farber Cancer Institute(达纳-法伯癌症研究所)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI
AI总结 本研究通过医学扰动审计方法,对14个大语言模型在四个医学问答基准上进行测试,发现医学思维链多为装饰性内容,为医学CoT的忠实性审计提供了可复用标准。
CyberFactory:利用真实场景实例扩展网络安全能力
机构 * Beihang University(北京航空航天大学) ; ELLIS(欧洲学习与智能系统实验室) ; IQuest Research(智问研究) ; Singapore Management University(新加坡管理大学)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究提出开源框架CyberFactory,将真实场景漏洞转化为任务实例以训练安全模型Aegis,该模型在CyberGym上的Pass@1较Qwen~3.5提升22.8个百分点,优于通用主干模型。
Comments We updated scores with models trained on updated agentic data
SRPO:用于长程推理的自反思策略优化
机构 * School of artificial intelligence, Wuhan University(武汉大学人工智能学院) ; School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
AI总结 本研究提出 SRPO 框架,将人类的自反思能力内化到 LLMs 中,无需额外模型即可将稀疏监督转化为密集训练信号,在数学推理等基准上以高数据效率取得了最先进性能。
Comments Accepted to ICML 2026
元审核员:用元认知赋能多智能体辩论
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Sichuan University(四川大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 该研究提出Meta-Moderator可学习框架,将多智能体辩论的审核视为元认知过程,经结果驱动策略优化训练,在五个基准测试中性能优于现有决策层,能动态调控辩论并减少错误聚合。
Comments Accepted by EMNLP 2026 Findings
SAVER:面向VLM变化推理中错误恢复的口头证据选择性审计
机构 * Panasonic Connect Co., Ltd.(松下连接公司)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL
AI总结 针对VLMs视觉变化推理的表述失败问题,提出轻量规则方法SAVER,通过选择性审计VLM输出的口头证据触发结构化重提示,在CLEVR-Change等基准上显著提升准确率。
Comments 19 pages, 5 figures
通过顺序激活补丁的思维链推理的机制可解释性
机构 * İzmir Institute of Technology(伊兹密尔理工学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 本研究提出顺序激活补丁框架及顺序多头补丁,探究思维链推理的因果效应位置与相关注意力头,证实存在支持思维链的分布式推理子电路。
SAEM:面向思维链推理的内存高效混合专家模型推理的阶段感知型专家管理
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI
AI总结 针对思维链推理中MoE模型的内存与延迟问题,提出SAEM阶段感知型专家管理运行时,通过阶段感知缓存等技术提升吞吐量,在受限GPU内存下平均实现1.33倍的性能提升。
Comments Extended version of the paper accepted at DAC 2026. Extends the conference version with evaluations on AIME 2024 and GPQA-Diamond and a prediction-oracle upper-bound analysis
$Z^2$-ACT:面向开放6G无线接入网的端到端可验证智能体意图控制
机构 * School of Computer Science, Dublin City University(都柏林城市大学计算机科学学院) ; Munster Technological University(芒斯特理工大学) ; National and Kapodistrian University of Athens(雅典国立与卡波迪斯特里亚大学)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对开放6G RAN多厂商部署的安全可验证需求,提出$Z^2$-ACT架构,集成多类核心组件并经实验验证其执行过滤与攻击恢复能力提升。
Comments 12 pages, 2 figures, 6 tables
Consilience:用于隐式多智能体推理的保形校准通信控制
机构 * Knight Foundation School of Computing and Information Sciences, Florida International University(佛罗里达国际大学奈特基金会计算与信息科学学院) ; SRI International(SRI国际公司) ; University of Florida(佛罗里达大学) ; Oak Ridge National Laboratory(橡树岭国家实验室) ; Army Cyber Institute, United States Military Academy(美国军事学院陆军网络研究所) ; Oakland University(奥克兰大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI
AI总结 本文提出Consilience框架,通过轮次保形校准程序保证多智能体通信控制的可靠性,在HiddenBench任务上提升了决策准确性与通信效率,优于现有协议甚至全信息基线。
Comments 39 pages, 2 figures, 9 tables. Includes appendix with full proof of Proposition 1, expanded results, ablations, and complete prompt templates
ReasFlow:通过基于知识的多智能体系统助力应用数学中以推理为中心的科学发现
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对理论驱动科学发现探索不足的问题,ReasFlow引入以推理为中心的自主智能体系统,通过内部验证循环和知识检索机制减少专家干预,能统一多项科研任务,从最少提示生成高质量论文,在开源基线中表现出色。
形式分析几何:一种基于神经符号的多模态解析几何问题生成框架
机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究解析几何问题生成,提出基于神经符号的FormalAnalyticGeo框架,利用CDL及四个大语言模型组件,无需人工注释自动生成问题,形成闭环,生成的AnalyticGeo7K数据集问题误差小,框架和数据集将公开。
AgentxGCore:面向下一代移动核心网络的智能体AI
机构 * Centro de Informática - Universidade Federal de Pernambuco(计算机中心 - 佩鲁巴科联邦大学)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出AgentxGCore,通过智能体AI原生层扩展3GPP架构,利用多智能体系统实现基于实时信息的闭环优化,支持自组织和自适应。
Comments This paper has been accepted for publication in IEEE Network
TDD-Agent:用于代码生成的测试驱动推理
机构 * National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; Qingdao Research Institute and Hangzhou Innovation Institute, Beihang University(北京航空航天大学青岛研究院与杭州创新研究院) ; School of Software, Beihang University(北京航空航天大学软件学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
测量位置混淆优化下的奖励黑客行为与推理-答案解耦
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI
AI总结 该研究针对位置混淆优化下的奖励黑客与推理-答案解耦问题,通过GRPO训练语言模型,发现模型会学习答案位置捷径,推理与答案解耦,且该捷径可跨域迁移,解耦率等指标可区分能力损失与捷径。
Comments Accepted at the AI Measurement Science Workshop, COLM 2026
天生不连贯?大型语言模型的道德自我一致性研究
机构 * Cornell University(康奈尔大学) ; Cornell Tech(康奈尔科技学院) ; Nanyang Technological University(南洋理工大学)
专题命中 推理与问题求解 :LLM(summary_cn);prompting(abstract);分类 cs.AI
AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。
Comments 88 pages; pages 16 to 88 are the appendix
SimuScene: 通过训练和基准测试代码生成来模拟物理场景
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。