arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-06 至 2026-02-06 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 14 篇

2602.05496 2026-02-06 cs.MM cs.AI cs.CV 79%

XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning

XEmoGPT:一种具有线索级感知与推理的可解释多模态情感识别框架

Hanwen Zhang, Yao Liu, Peiyuan Jiang, Lang Junjie, Xie Jun, Yihui He, Yajiao Deng, Siyu Du, Qiao Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) th Research Institute, China Electronics Technology Group Corporation(中国电子科技集团第五十四研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 XEmoGPT通过专门模块和大规模数据集提升多模态情感识别的可解释性和线索级推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16048 2026-02-06 cs.AI 79%

SPhyR: Spatial-Physical Reasoning Benchmark on Material Distribution

SPhyR:基于材料分布的空间-物理推理基准

Philipp D. Siedler

机构 * Aleph Alpha Research(Aleph Alpha研究机构)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SPhyR数据集通过拓扑优化任务评估LLM在空间和物理推理方面的能力,无需模拟工具即可推断最优材料分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05120 2026-02-06 cs.CC cs.LG 79%

Certifiable Boolean Reasoning Is Universal

可验证的布尔推理是通用的

Wenhao Li, Anastasis Kratsios, Hrad Ghoukasian, Dennis Zvigelsky

机构 * University of Toronto(多伦多大学) McMaster University(麦基尔大学) Vector Institute(向量研究所) Scuola Normale Superiore di Pisa(比萨normal高等学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出了一种深度学习架构,能够确证性地推理并通用性地处理任何布尔任务,且在简单布尔任务中参数需求低。

Comments Submitted to COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05392 2026-02-06 cs.CL cs.AI 73%

Beyond Length: Context-Aware Expansion and Independence as Developmentally Sensitive Evaluation in Child Utterances

超越长度:基于上下文的扩展与独立性作为儿童言语发展的敏感评估

Jiyun Chun, Eric Fosler-Lussier, Michael White, Andrew Perrault

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于上下文的评估框架,通过扩展和独立性两个维度评估儿童言语的发展性,提升对儿童对话质量的敏感度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05879 2026-02-06 cs.CL cs.AI cs.LG 67%

EuroLLM-22B: Technical Report

EuroLLM-22B:技术报告

Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Mateusz Klimaszewski, José G. C. de Souza, Barry Haddow, François Yvon, Pierre Colombo, Alexandra Birch, André F. T. Martins

机构 * Instituto Superior Técnico & Universidade de Lisboa (Lisbon ELLIS Unit)(里斯本ELLIS单位(理工学院与里斯本大学)) Instituto de Telecomunicações(电信研究院) MICS, CentraleSupélec, Université Paris-Saclay(MICS、中央圣艾尔布兰理工大学、巴黎萨克雷大学) Acolad Carnegie Mellon University(卡内基梅隆大学) University of Edinburgh(爱丁堡大学) Diabolocom Aveni OutSystems Sword Health Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) Artefact Research Center(Artefact研究机构) TransPerfect

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EuroLLM-22B是一款覆盖24种欧盟语言及11种额外语言的大型语言模型,通过多语言基准测试展现强推理、指令遵循和翻译能力,提供基础模型、指令微调模型及预训练代码库以支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06008 2026-02-06 cs.AI cs.LG 62%

AgenticPay: A Multi-Agent LLM Negotiation System for Buyer-Seller Transactions

AgenticPay: 一种基于多智能体LLM的买方卖方交易谈判系统

Xianyang Liu, Shangding Gu, Dawn Song

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AgenticPay是一种基于多智能体LLM的买方卖方交易谈判系统,通过自然语言驱动的多轮谈判解决市场交易问题,评估智能体在经济互动中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05874 2026-02-06 cs.CL cs.AI 62%

xList-Hate: A Checklist-Based Framework for Interpretable and Generalizable Hate Speech Detection

xList-Hate: 一个基于检查表的框架用于可解释且可推广的仇恨言论检测

Adrián Girón, Pablo Miralles, Javier Huertas-Tato, Sergio D'Antonio, David Camacho

机构 * Universidad Politécnica de Madrid(马德里理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 xList-Hate通过基于检查表的诊断框架,提升仇恨言论检测的可解释性和跨领域鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05515 2026-02-06 cs.AI cs.CL 62%

A Unified Multimodal Framework for Dataset Construction and Model-Based Diagnosis of Ameloblastoma

一种统一的多模态框架用于数据集构建和基于模型的ameloblastoma诊断

Ajo Babu George, Anna Mariam John, Athul Anoop, Balu Bhasuran

机构 * DiceMed School of Sciences (SOS), Indira Gandhi National Open University(印度甘地国家开放大学科学学院) School of Information, Florida State University(佛罗里达州立大学信息学院)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种统一的多模态框架,用于构建ameloblastoma数据集并开发基于模型的诊断方法,通过多模态深度学习模型提高分类和手术规划的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04944 2026-02-06 eess.IV cs.AI cs.LG 62%

Smart Diagnosis and Early Intervention in PCOS: A Deep Learning Approach to Women's Reproductive Health

PCOS的智能诊断与早期干预:一种深度学习方法用于女性生殖健康

Shayan Abrar, Samura Rahman, Ishrat Jahan Momo, Mahjabin Tasnim Samiha, B. M. Shahria Alam, Mohammad Tahmid Noor, Nishat Tasnim Niloy

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于深度学习的PCOS卵巢超声图像分类系统,利用迁移学习和增强策略实现高准确率的自动诊断,提升医疗图像分析的透明度和实用性。

Comments 6 pages, 12 figures. This is the author's accepted manuscript of a paper accepted for publication in the Proceedings of the 16th International IEEE Conference on Computing, Communication and Networking Technologies (ICCCNT 2025). The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05857 2026-02-06 cs.AI 57%

BABE: Biology Arena BEnchmark

BABE:生物学竞技场基准

Junting Zhou, Jin Chen, Linfeng Hao, Denghui Cao, Zheyu Wang, Qiguang Chen, Chaoyou Fu, Jiaze Chen, Yuchen Wu, Ge Zhang, Mingxuan Wang, Wenhao Huang, Tong Yang

机构 * Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BABE基准通过评估生物AI系统的实验推理能力,解决现有生物学基准未能评估实验结果与上下文知识整合能力的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05249 2026-02-06 cs.AI 57%

Automatic Cognitive Task Generation for In-Situ Evaluation of Embodied Agents

为在场评估具身智能体而自动产生认知任务

Xinyi He, Ying Yang, Chuanjian Fu, Sihan Guo, Songchun Zhu, Lifeng Fan, Zhenliang Zhang, Yujia Peng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TEA系统,通过动态在场任务生成方法评估具身智能体在未见环境中的能力,揭示模型在基本感知和3D交互方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05110 2026-02-06 cs.AI 57%

Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment

理解大语言模型评估者行为:一种结构化多评估者框架用于商户风险评估

Liang Wang, Junpeng Wang, Chin-chia Michael Yeh, Yan Zheng, Jiarui Sun, Xiran Fan, Xin Dai, Yujie Fan, Yiwei Cai

机构 * Visa Research(Visa研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结构化多评估者框架,用于评估LLM在商户风险评估中的推理质量,揭示了不同模型的自我评估偏见差异,并通过真实数据验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05891 2026-02-06 cs.SE 50%

When Elo Lies: Hidden Biases in Codeforces-Based Evaluation of Large Language Models

当Elo谎言:基于Codeforces的大型语言模型评估中的隐藏偏见

Shenyu Zheng, Ximing Dong, Xiaoshuang Liu, Gustavo Oliva, Chong Chun Yong, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了基于Codeforces的Elo评分中隐藏的偏见因素,发现提交顺序、比赛难度选择和LLM运行稳定性显著影响评分结果,指出直接比较Elo分数缺乏可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11361 2026-02-06 cs.PL 50%

Opportunistically Parallel Lambda Calculus

机会性并行λ演算

Stephen Mell, Konstantinos Kallas, Steve Zdancewic, Osbert Bastani

专题命中 推理评测 :reasoning(abstract)

AI总结 Opal通过机会性并行λ演算提升脚本语言的执行效率,显著减少外部调用的等待时间,性能优于Python和Rust。

Journal ref Proc. ACM Program. Lang. 9, OOPSLA2, Article 365 (October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏