TDD-Agent: Test-Driven Reasoning for Code Generation
TDD-Agent:用于代码生成的测试驱动推理
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
TDD-Agent:用于代码生成的测试驱动推理
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
生成式上下文与受控状态:可问责纵向临床推理的功能条件
机构 * MyndwareMed(迈恩德韦尔医疗)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。
能源盲点:NVIDIA 旗舰边缘 AI 硬件无法支持进程级能源归因
机构 * Independent Researcher(独立研究者) ; Texas A&M University(德克萨斯农工大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文审计了 ASUS Ascent GX10 (GB10 SoC) 平台的能源可观测性,发现其缺乏 CPU 能源计数器等关键接口,导致无法像 x86 的 RAPL 那样进行进程级能源归因,并提出通过外部直流计量和 GPU 减法进行校准的临时方案,呼吁将能源可观测性作为硬件的一等要求。
Comments 5 pages, 0 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv:2608.02072
LORA-CRAFT:通过冻结预训练注意力权重的跨层秩适应进行Tucker分解
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 LORA-CRAFT通过冻结预训练注意力权重的Tucker分解实现跨层秩适应,以轻量级可训练变换调整模型,在GLUE基准测试中达到与现有方法相当的性能,仅需41K参数。
智能体物理学:统计力学预测AI智能体的集体行为
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 该研究以10000余个语言模型智能体社区为对象,用统计力学模型将其集体动态分为三种状态,预测个体轨迹优于基线,揭示了AI智能体集体行为遵循可预测动力学规律。
Comments 51 pages, 20 figures, 9 tables
一种用于隐私风险分析的人-大语言模型(LLM)协同框架:以基于央行数字货币(CBDC)的福利方案为例
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出用于隐私风险分析的人-LLM协同框架PRIAM,以CBDC福利方案为例验证,该框架通过人机迭代协作优化隐私风险评估,为相关领域提供基础贡献。
Comments 10 pages
机器的内部时钟:大型语言模型(LLMs)是否会共享人类的时间错觉?
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本研究构建含5种错觉的6684个叙事对基准,发现人类仅在2种错觉中偏好预期场景,而14个LLMs在4种错觉中与文献预测一致,其一致性源于心理学研究检索而非类人时间偏差。
Comments 25 pages, 24 figures
分层多智能体系统中基于语义不确定性的协调策略
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; AT&T Chief Data Office(AT&T首席数据办公室) ; Cognizant AI Lab(高知特人工智能实验室)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出HASSUM框架,利用语义熵和密度估计不确定性实现多智能体自适应协调,在StrategyQA等基准上验证其可提升复杂推理任务的可靠性。
Comments 17 pages, 5 figures, 2 tables
BRA-Audit:基于累积暴露审计点放置的LLM多智能体系统预算运行时审计
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 BRA-Audit是一种预算感知的LLM多智能体系统运行时审计框架,通过贪心调度放置审计点,在保障防护性能的同时降低了17.2%-40.6%的端到端token消耗。
重新思考自动程序修复:缺陷复杂度、缺陷定位与大语言模型成本效率的影响
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本研究通过实证分析,发现中等复杂度缺陷可超50%由低成本LLM修复,不精确缺陷定位会扩大APR技术差距,高成本LLM与强推理设置并非总能提升成本效率,DeepSeek-V3.2成本效率最优。
Comments 20 pages, 6 figures, 10 tables. Accepted at ESEM 2026
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
Comments 13 pages, 7 figures
超越视觉思维链:用于主动视频推理的内化视觉思维
机构 * Apple(苹果公司)
专题命中 推理评测 :CoT(title,summary_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。
LAPF:基于大语言模型智能体的路径查找器,使用UAVScenes数据集
专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);planning(abstract)
AI总结 本文提出基于LLM智能体的LAPF框架,整合多模块构建闭环认知架构,在城镇级无人机导航中实现了更优路径效率,且无钳位事件,性能优于CoT提示方法。
Comments 15 pages
听、推理与分段:使大型音频语言模型(LALMs)与编辑判断对齐以实现媒体章节化
机构 * University of Surrey(萨里大学)
专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LALMs在实际媒体章节化部署的不足,提出基于GRPO与CoT的AudioChaps框架,构建三类数据集,使AudioChaps-R1的平均F1较SOTA提升49个百分点,实现非结构化听觉流到结构化媒体的可靠转换。
Comments 19 pages, 9 figures, 8 tables
重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。
PEER:统一的过程-结果强化学习用于结构化共情推理
机构 * Shandong University(山东大学) ; Shandong Jianzhu University(山东建筑大学) ; Singapore Management University(新加坡管理大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出PEER,通过结构化共情推理框架提升情感支持对话的 empathy、策略一致性及人性表现,采用GRPO与UnifiReward模型,结合数据增强减少重复。
基于推理的稀疏数据用户个性化生成
机构 * Vanderbilt University(范德比尔特大学) ; Adobe Research(Adobe研究) ; Yale University(耶鲁大学) ; University of Oregon(俄勒冈大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 GraSPer通过预测用户未来交互并生成文本来增强稀疏上下文中的个性化生成,提升用户个性化输出质量。
DiagnosisArena:面向大型语言模型的诊断推理基准测试
机构 * Shanghai Jiao Tong University(上海交通大学) ; SII ; SPIRAL Lab(SPIRAL实验室) ; Generative AI Research Lab (GAIR)(生成式AI研究实验室) ; Shanghai Chest Hospital(上海胸科医院) ; Beijing Anzhen Hospital, Capital Medical University(北京安贞医院,首都医科大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出DiagnosisArena基准,评估大型语言模型的临床诊断推理能力,发现顶尖模型准确率仅最高51.12%,凸显其泛化瓶颈,旨在推动AI诊断推理进步。
Comments Accepted to ACL 2026 Findings
ParaTempo:基于时间置信度的高效并行推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 ParaTempo 是一种基于时间置信度的无训练异步并行推理框架,可自适应分配计算资源,在保持推理准确率的同时降低延迟与 token 用量,且时间置信度性能优于其他信号。
Comments Code and dataset are available at https://github.com/ScottZhang812/ParaTempo
$R^3$-Bench:大语言模型在共享预算下的资源理性推理能力存在不足
机构 * The University of Hong Kong(香港大学) ; Hunyuan Team, Tencent(腾讯混元团队)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 $R^3$-Bench测试发现,大语言模型在共享预算下的资源理性推理存在不足,其表现出的单问题能力与共享预算下的实际表现存在差距。
Comments Code is available at https://github.com/NineAbyss/R-3-Bench . The dataset is available at https://huggingface.co/datasets/R-3-Bench/R-3-Bench
TRACE:面向多轮对抗对话评估的轨迹感知推理
机构 * Texas A&M University(德克萨斯农工大学) ; Amazon(亚马逊公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。
FloodReasonBench:面向边缘端具身洪水响应的VLM推理分割基准
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 FloodReasonBench针对边缘端具身洪水响应,构建专用数据集并刻画推理分割流水线的性能权衡,为资源受限场景提供任务与系统层面的基准支持。
Comments Paper is currently under review. The code and dataset will be made public upon acceptance
CEDAR-GRPO:面向大语言模型通用溯因推理的过程感知强化学习
机构 * Sharif University of Technology(谢里夫理工大学) ; University of Tehran(德黑兰大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出过程感知强化学习框架CEDAR-GRPO,通过后训练提升LLM的通用溯因推理能力,在11个未见任务上实现显著性能提升,验证了其迁移有效性。
Comments Code and data are available at https://github.com/cedar-grpo/cedar-grpo
大型语言模型何时适用错误法律?诊断大型语言模型在时间法律推理中的失败
机构 * Institute of Science Tokyo(东京科学大学) ; Osaka University(大阪大学) ; NII LLMC(日本信息学研究所语言、语言学与媒体中心) ; Nara Institute of Science and Technology(奈良科学技术研究所) ; Center of Juris-Informatics, ROIS-DS(日本学术研究推进机构跨学科科学研究中心法学信息学中心)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文构建基准评估LLMs的时间适用法律判定能力,发现LLMs存在适用最新法律的偏差,该偏差源于强化学习塑造的显式推理导致推理路径多样性减少,通用推理能力更强的模型在时间法律推理中表现更差,为相关优化提供指导。
未书写基准:多模态机器学习在抽象感知推理领域的新挑战
机构 * Arizona State University(亚利桑那州立大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出The Unwritten Benchmark基准,针对多模态模型在抽象感知推理中的不足,开展声-运动学文字推理任务评估,发现模型性能远逊于人类且存在模态融合悖论。
Comments To be published in CVPR Findings 2026
通过难度控制和动态测试生成对语言推理模型进行时间推理基准测试框架
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 针对语言推理模型定义推理边界和确保可靠性的挑战,引入TRACE框架,将时间推理建模为约束满足问题,构建TRACEBench基准,评估模型,揭示推理问题及规模相关失败模式。
Comments Accepted to ISSTA 2026. 23 pages including references, 3 figures
基于证据链的多模态推理用于少样本时序动作定位
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出基于证据链的多模态推理方法,通过结合文本和视觉信息提升少样本时序动作定位的性能。
Comments Accepted by TIP2026
ChainSpace:面向空间智能的链式推理范式
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; Li Auto Inc.(理想汽车有限公司)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对现有空间推理方法的缺陷,提出ChainSpace链式推理范式,构建对应基准与训练框架,相关模型在基准上表现最优且可迁移至多类外部基准,为空间智能评估与学习提供有效方案。
AeroGround:用于空-地协同推理的综合基准
机构 * Shanghai Innovation Institute(上海创新研究院) ; College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Chongqing Technology and Business University(重庆工商大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出AeroGround基准,针对现有VLMs在空-地协同场景推理能力的研究空白,构建含29000组多模态观测与2250个问答实例的数据集,实验发现模型与人类表现差距显著,为相关系统开发提供基础。
RingMo-Agent: 多平台多模态遥感基础模型
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院 aerospace information research institute) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Key Laboratory of Target Cognition and Application Technology (TCAT)(目标认知与应用技术重点实验室)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 RingMo-Agent是一种多平台多模态遥感基础模型,通过大规模数据集和任务特定标记提升遥感图像的感知与推理能力。
Comments 24 pages, 5 figures, 20 tables