LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning
基于大语言模型的多轮任务导向对话合成用于真实推理
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于LLM的多轮任务导向对话合成框架,通过三级优化生成真实推理场景下的对话,提升LLM的逻辑推理能力。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于大语言模型的多轮任务导向对话合成用于真实推理
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于LLM的多轮任务导向对话合成框架,通过三级优化生成真实推理场景下的对话,提升LLM的逻辑推理能力。
从静态基准到动态协议:面向评估LLM推理能力的代理中心文本异常检测
机构 * LG AI Research(LG人工智能研究)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种动态协议,通过代理中心文本异常检测评估LLM推理能力,以克服静态数据集的局限性。
Comments Accepted to ICLR 2026
领域划分混合RAG用于法律推理:迈向模块化和可解释的印度法律AI
机构 * Birla Institute of Technology and Science, Pilani(巴尔·印度技术科学学院,比兰地)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出了一种针对印度法律研究的领域划分混合RAG与知识图谱架构,通过模块化设计和结构化关系推理提升法律AI的可解释性和推理能力。
在放射学报告中建模临床不确定性:从显式不确定性标记到隐式推理路径
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究提出Lunguage++基准,通过显式和隐式不确定性建模方法,提升放射学报告中不确定性分析的准确性和应用性。
MobileLLM-R1: 探索子十亿参数语言模型推理能力的极限与开放训练配方
机构 * Meta AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 MobileLLM-R1通过开放训练配方在较少数据下实现子十亿参数模型的推理能力突破,显著超越现有模型。
Comments ICLR 2026
通过草稿思考:用于高效长视频理解的推测性时间推理
机构 * MBZUAI(马克斯·普朗克智能研究院) ; Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 SpecTemp通过协作双模型设计,实现高效长视频理解,平衡效率与准确性,提升推理速度。
Comments Accepted by CVPR 26
Q-Save:迈向生成视频评估的评分与归因
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)
AI总结 Q-Save提出一个统一的生成视频评估模型和数据集,通过三阶段训练策略实现质量评分与归因生成,提升AIGV质量预测的准确性和可解释性。
Comments 20 pages, 11 figures
CMT-Benchmark:由专家研究人员构建的凝聚态理论基准
机构 * Rutgers University(罗格斯大学) ; Harvard University(哈佛大学) ; Weizmann Institute of Science(魏茨曼科学研究所) ; ETH Zürich(苏黎世联邦理工学院) ; Cornell University(康奈尔大学) ; Stanford University(斯坦福大学) ; University of Zürich(苏黎世大学) ; Stanford Institute for Materials and Energy Sciences(斯坦福材料与能源科学研究所) ; SLAC National Accelerator Laboratory(斯坦福直线加速器实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; National Taiwan University(台湾大学) ; San José State University(圣何塞州立大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 CMT-Benchmark通过专家设计的50个凝聚态理论问题评估LLM在物理推理能力上的不足,揭示当前模型在复杂科学问题上的局限性。
Comments CMT-Benchmark dataset is available at https://huggingface.co/datasets/JVRoggeveen/cmt_benchmark. CMT-Benchmark was referenced in the Gemini 3 Deep Think (February 2026) release at https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/
Journal ref International Conference on Learning Representations (ICLR) main conference 2026
RUMAD:强化统一多智能体辩论
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 RUMAD通过强化学习动态控制通信拓扑,提升多智能体辩论的效率和准确性,实现80%以上的token成本降低和跨域泛化能力。
Comments 13 pages, 3 figures
视觉属性如何影响网络代理?对用户界面设计因素的全面评估
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Columbia University(哥伦比亚大学) ; University of California San Diego(加州大学圣地亚哥分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出VAF框架,通过系统评估视觉属性对网络代理决策的影响,发现背景颜色对比、项目大小等属性对代理行为有显著影响。
在多轮对话中衡量语言模型的趋炎附势性
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Emory University(埃默里大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究提出SYCON基准,评估多轮对话中语言模型的趋炎附势性,发现对齐调优会放大该行为,而模型规模和推理优化能增强抗压能力,采用第三人称视角可显著减少趋炎附势性。
Comments Accepted to Findings of EMNLP 2025
Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 2239-2259
统一的生成与理解模型能否在不同输出模态间保持语义等价性?
机构 * Tencent Youtu Lab(腾讯云图实验室) ; Xiamen University(厦门大学) ; Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。
Comments Equal contribution by Jie Li
MMSD3.0:一个多图像基准用于现实世界多模态讽刺检测
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 MMSD3.0是一个多图像基准,用于现实世界多模态讽刺检测,引入了跨图像推理模型和相关引导的细粒度跨模态融合机制,验证了其在单图像和多图像场景中的有效性。
VeriWeb: 可验证的长链网络基准测试用于代理信息检索
专题命中 推理评测 :reasoning(abstract)
AI总结 VeriWeb是一个用于评估和开发网络代理的可验证长链网络基准测试,通过长链复杂性和子任务级可验证性设计,揭示了处理长时间网络任务的性能差距。