BARD: budget-aware reasoning distillation
BARD: 带预算意识的推理蒸馏
机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 BARD通过两阶段训练实现推理能力蒸馏与预算控制,使模型在不同预算下高效完成推理任务。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
BARD: 带预算意识的推理蒸馏
机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 BARD通过两阶段训练实现推理能力蒸馏与预算控制,使模型在不同预算下高效完成推理任务。
在LLM中诱导因果世界模型以实现零样本物理推理
机构 * Department of Electrical Engineering(电气工程系) ; Indian Institute of Technology Bombay(印度理工学院孟买分校) ; Department of Computer Science and Automation(计算机科学与自动化系) ; Indian Institute of Science(印度科学研究所) ; Department of Computer Science(计算机科学系) ; San Francisco State University(旧金山州立大学) ; University of Lagos(拉各斯大学) ; Faculty of Mathematics, Informatics, and Mechanics(数学、信息学与力学学院) ; University of Warsaw(华沙大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出CWMI框架,通过引入因果物理模块和因果干预损失,使LLM具备因果推理能力,在零样本物理推理任务中取得显著成效。
Comments 12 pages, 4 figures,
LogicLens:面向文本导向伪造分析的视觉-逻辑协同推理
机构 * Ant Group(蚂蚁集团) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 LogicLens通过视觉-逻辑协同推理框架,提升文本导向伪造分析的准确性和鲁棒性,其在多个基准测试中表现优异。
Comments 11 pages, 5 figures, 3 tables
潜在标记是否思考?对连续思维链的因果和对抗分析
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文通过因果和对抗分析揭示COCONUT作为伪推理机制的问题,指出其依赖捷径而非真实推理。
Comments 13 pages, 5 figures
RoadSceneVQA: 用于智能交通系统 roadside 系统的视觉问答基准测试
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 RoadSceneVQA 通过大规模标注数据和 CogniAnchor 融合模块,提升多模态大语言模型在交通感知与推理任务中的性能。
Comments 10 pages, 6 figures, accepted by AAAI 2026. The model is also called Dream, to the other me in the world forever
一种评估忠实度度量的因果视角
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出因果诊断性框架,用于评估自然语言解释的忠实度度量,通过生成忠实-不忠实解释对,发现Filler Tokens在多任务中表现最佳,连续度量更优但易受噪声影响。
Comments Published at EMNLP 2025; 25 pages, 22 figures, 9 tables
MASFIN:一种用于分解金融推理和预测的多智能体系统
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 MASFIN通过整合LLMs与结构化财务指标和非结构化新闻,提出了一种模块化的多智能体系统,以提高金融预测的透明性和可重复性,实现优于基准的短期投资回报。
Comments Accepted to the NeurIPS 2025 Workshop on Generative AI in Finance
Cerberus:多智能体推理与覆盖引导探索用于运行时错误的静态检测
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 推理评测 :reasoning(title);分类 cs.LG
AI总结 Cerberus通过多智能体推理和覆盖引导探索,实现无执行的运行时错误静态检测,提高测试效率和错误发现能力。
基于注意力模型和大语言模型提示的可解释法规预测
机构 * TCS Research(TCS研究)
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 本文提出基于注意力模型和大语言模型提示的法规预测方法,通过生成可解释的预测结果提升法律AI系统的实用性。
TCM-Eval: 一个专家级动态且可扩展的中医基准测试
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; Beijing Zhimingtang Technology Co., Ltd.(北京智明堂科技有限公司) ; Beijing Zhiyan AI Technology Co., Ltd.(北京智言AI科技有限公司) ; Guangzhou University of Chinese Medicine(广州中医药大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 TCM-Eval通过动态可扩展的基准测试和SI-CoTE方法,开发出ZMT模型,显著超越人类中医从业者水平,推动中医领域LLM研究发展。
Comments Work in Progress
弥合版权鸿沟:大型视觉-语言模型是否能识别并尊重受版权保护的内容?
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究大型视觉-语言模型在处理受版权保护内容时的合规性问题,提出了一种新的工具增强防御框架以降低侵权风险。
Comments AAAI 2026 (Oral)
HeartBench: 探索大语言模型中拟人智能的核心维度
机构 * Ant Group(蚂蚁集团) ; Xiamen University(厦门大学) ; Beijing Normal University(北京师范大学) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 HeartBench通过理论驱动的分类体系评估中文大语言模型的情感、文化和伦理维度,揭示其在拟人智能方面的性能上限及改进方向。
Comments 10 pages
揭示语言模型的学习心智:一种认知框架与实证研究
机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科学与技术大学人工智能研究所) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR, China(香港科学与技术大学计算机科学与工程系) ; Microsoft Research Asia(微软亚洲研究院) ; University of Cambridge(剑桥大学) ; Microsoft(微软)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种认知框架,将学习能力分解为三个维度,并通过实证研究揭示LLMs在不同学习场景下的表现与局限性。
创意代理:通过想象力赋能代理以完成创意任务
机构 * School of Computer Science Peking University(北京大学计算机学院)
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出通过增强想象力的创意代理,首次在Minecraft生存模式中实现多样化建筑创建,利用大语言模型和扩散模型提升创造力表现。
Comments The first two authors contribute equally
Journal ref Proceedings of the 41st Conference on Uncertainty in Artificial Intelligence (UAI 2025), PMLR 244:471-496
OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析
机构 * Chinese University of Hong Kong(香港中文大学) ; Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) ; Southern Medical University(南方医科大学) ; Zhongshan Hospital, Fudan University(复旦大学中山医院) ; Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。
RefactorCoderQA: 评估LLMs在云和边缘部署中多领域编程问题解决方案的基准测试
机构 * York University and Algoma University(约克大学和阿尔戈马大学) ; Algoma University(阿尔戈马大学) ; Department of Systems and Computer Engineering, Carleton University(系统与计算机工程系,卡尔顿大学) ; Department of Math and Computer Science, Brandon University(数学与计算机科学系,布兰登大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 RefactorCoderQA通过云-边缘协作架构和RefactorCoder-MoE模型,在多领域编程任务中提升LLMs的性能,准确率达76.84%。
Comments 12 pages, 5 figures, Submitted to IEEE Transactions on Services Computing
重新思考强化学习中的样本极性与可验证奖励
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; The Chinese University of Hong Kong(香港中文大学) ; Ant Group(蚂蚁集团)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出A3PO方法,通过自适应非对称令牌级别优势塑造,提升强化学习中样本极性对推理能力的优化效果。
AInsteinBench:在科学仓库中评估编码代理的基准测试
机构 * Princeton University(普林斯顿大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 AInsteinBench通过评估大型语言模型在科学计算开发中的能力,提供了一个基于真实科研软件生态系统的基准测试。
理解病毒性:一种基于Rubric的视觉-语言模型框架用于短形式教育娱乐内容评估
机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,比里尼)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出基于Rubric的视觉-语言模型框架,用于评估短形式教育娱乐视频的病毒性,通过提取音频视觉特征并训练回归评估器,实现可解释且可扩展的参与度预测。
Comments Under Review