arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-02 至 2026-02-02 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 34 篇

2601.22790 2026-02-02 cs.AI math.ST stat.TH 83%

Conditional Performance Guarantee for Large Reasoning Models

基于条件的大型推理模型性能保证

Jianguo Huang, Hao Zeng, Bingyi Jing, Hongxin Wei, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学) Southern University of Science(南方科技大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出G-PAC和C-PAC推理框架,通过分组策略实现组条件风险控制,提升异质环境下推理效率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15612 2026-02-02 cs.SD eess.AS 82%

Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition

在鸡尾酒派对中思考:用于目标说话人自动语音识别的链式思维和强化学习

Yiru Zhang, Hang Su, Lichun Fan, Zhenbo Luo, Jian Luan

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) MiLM Plus, Xiaomi Inc., China(MiLM Plus,小米公司,中国)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract)

AI总结 本文提出结合链式思维和强化学习的新型框架,提升目标说话人自动语音识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06822 2026-02-02 cs.AI cs.CL 81%

RAFFLES: Reasoning-based Attribution of Faults for LLM Systems

基于推理的LLM系统故障归因

Chenyang Zhu, Spencer Hong, Jingyu Wu, Kushal Chawla, Charlotte Tang, Youbing Yin, Nathan Wolfe, Erin Babinsky, Daben Liu

机构 * Capital One

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RAFFLES通过整合迭代推理的离线评估架构,实现了对LLM系统中步骤级故障的自动化检测,显著提高了故障识别的准确率。

Comments Accepted at EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22742 2026-02-02 cs.CL 79%

AR-BENCH: Benchmarking Legal Reasoning with Judgment Error Detection, Classification and Correction

AR-BENCH:通过判决错误检测、分类和纠正进行法律推理基准测试

Yifei Li, Richong Zhang, Wanyu Tu, Zhijie Nie, Haokun Luo, Chuantao Yin, Pengchong Li

机构 * SKLCCSE Beihang University(北京航空航天大学软件学院) SCCE University of Science and Technology Beijing(北京科技大学计算机学院) Sino-French Engineer School Beihang University(北京航空航天大学中法工程师学院) People’s Procuratorate of Beijing Municipality(北京市人民检察院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 AR-BENCH通过构建基准数据集和评估14个大语言模型,揭示现有模型在法律判决错误识别上的局限性,旨在提升法律推理的诊断能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22735 2026-02-02 cs.CL 79%

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

MM-THEBench: 多模态大语言模型是否能合理推理?

Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

机构 * KIRC, Institute for Artificial Intelligence, Tsinghua University, China(KIRC人工智能研究院,清华大学,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MM-THEBench旨在评估推理MLLMs在中间推理过程中的幻觉问题,通过细粒度分类和多层次评估框架,揭示思考对多模态任务中幻觉和推理能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21937 2026-02-02 cs.AI 79%

Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities

检索增强推理沙盒:一种解耦检索与推理能力的基准

Shuangshuang Ying, Zheyu Wang, Yunjian Peng, Jin Chen, Yuhao Wu, Hongbin Lin, Dingyu He, Siyi Liu, Gengchen Yu, YinZhu Piao, Yuchen Wu, Xin Gui, Zhongyuan Peng, Xin Li, Xeron Du, Libo Qin, YiXin Cao, Ge Zhang, Stephen Huang

机构 * Full author list in Contributions(完整作者列表)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DeR2通过解耦检索与推理能力,提供了一种评估大语言模型处理新颖科学信息能力的基准测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10909 2026-02-02 cs.AI 79%

PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature

PaperArena: 一个用于科学文献上工具增强代理推理的评估基准

Daoyu Wang, Mingyue Cheng, Shuo Yu, Zirui Liu, Ze Guo, Xin Li, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PaperArena提出一个评估基准,用于评估基于LLM的代理在跨多篇论文整合信息并使用外部工具进行推理的能力,实验显示现有代理在复杂任务上的表现有限。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22959 2026-02-02 cs.CV 78%

Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models

Triage: 分层视觉预算机制用于视觉语言模型中的高效视频推理

Anmin Wang, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Triage通过分层视觉预算机制优化视频推理,提升效率并保持性能。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22269 2026-02-02 cs.AI cs.CL cs.LG 75%

JAF: Judge Agent Forest

JAF:裁判代理森林

Sahil Garg, Brad Cheezum, Sridhar Dutta, Vishal Agarwal

机构 * Averlon

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 JAF通过裁判代理森林框架,利用联合推理和集合学习原理,提升主代理的自我改进能力,通过高效的哈希算法优化多样示例选择,改进推理路径探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19299 2026-02-02 cs.AI 74%

Helios: A Foundational Language Model for Smart Energy Knowledge Reasoning and Application

Helios:一种面向智能能源知识推理与应用的基础语言模型

Haoyu Jiang, Fanjie Zeng, Boan Qu, Xiaojie Lin, Wei Zhong

机构 * College of Energy Engineering, Zhejiang University(浙江大学能源工程学院) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海研究院)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 Helios是一种专为智能能源领域设计的基础语言模型,通过构建多智能体协作框架和相关数据集,提升领域知识、任务执行准确性和与人类偏好的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21422 2026-02-02 cs.CL 74%

Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework

自动评审员无法检测研究论文中的错误推理:一种新的反事实评估框架

Nils Dycke, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and National Research Center for Applied Cybersecurity(UKP实验室、计算机科学系和应用网络安全国家研究中心)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出一种反事实评估框架,揭示自动评审系统在检测研究论文中逻辑错误方面的不足,并提出未来研究建议。

Comments accepted to TACL 2026 (presented at EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22930 2026-02-02 cs.RO cs.AI cs.LG 73%

MTDrive: Multi-turn Interactive Reinforcement Learning for Autonomous Driving

MTDrive: 多轮交互式强化学习用于自动驾驶

Xidong Li, Mingyu Guo, Chenchao Xu, Bailin Li, Wenjing Zhu, Yangang Zou, Rui Chen, Zehuan Wang

机构 * Li Auto Inc.(利汽车公司) NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MTDrive通过多轮交互式强化学习框架,结合多模态大语言模型与强化学习,提升自动驾驶轨迹规划的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22162 2026-02-02 q-fin.GN cs.AI cs.CL 73%

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

UniFinEval: 向跨文本、图像和视频的金融多模态模型统一评估迈进

Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

机构 * SUFE(上海财经大学) Tencent(腾讯) Gatech(佐治亚理工学院) HiThink Research(慧图研究)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 UniFinEval提出首个统一多模态基准,用于评估金融领域高信息密度下的多模态模型能力,通过五个真实金融场景和大规模数据集验证模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13524 2026-02-02 cs.CL 70%

OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models

OMGEval: 一种开放的多语言生成评估基准用于大型语言模型

Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang

机构 * Beijing Language and Culture University(北京语言大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Northeastern University(东北大学) Shanghai University of Finance and Economics(上海金融学院)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 OMGEval是一个开放的多语言生成评估基准,通过提供多种语言的开放性问题,评估大型语言模型在不同文化背景下的能力,旨在提升多语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22889 2026-02-02 cs.CL cs.AI cs.LG cs.SD 67%

DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion

DiffuSpeech: 通过统一的语音-文本扩散实现无声思考, spoken 答案

Yuxuan Lou, Ziming Wu, Yaochen Wang, Yong Liu, Yingxuan Ren, Fuming Lai, Shaobing Lian, Jie Tang, Yang You

机构 * National University of Singapore(新加坡国立大学) Tencent(腾讯)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DiffuSpeech通过统一的语音-文本扩散模型,实现语音生成的同时生成内部推理,提升语音问答的准确性和语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17687 2026-02-02 cs.LG cs.AI 62%

Agentic reinforcement learning empowers next-generation chemical language models for molecular design and synthesis

代理强化学习赋能下一代化学语言模型用于分子设计与合成

Hao Li, He Cao, Shenyao Peng, Zijing Liu, Bin Feng, Yu Wang, Zhiyuan Yan, Yonghong Tian, Yu Li, Li Yuan

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Shenzhen Graduate School, Shenzhen, 518055, China(深圳研究生院,深圳,518055,中国) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) Peng Cheng Laboratory, Shenzhen, 518000, China(鹏城实验室,深圳,518000,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ChemCRAFT通过代理强化学习实现化学语言模型的高效分子设计与合成,突破传统模型在成本与隐私间的限制。

Comments Working in Progress, 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11854 2026-02-02 cs.CL cs.AI cs.MA 62%

ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems

ATOD: 一种用于代理任务导向对话系统的评估框架和基准

Yifei Zhang, Hooshang Nayyeri, Rinat Khaziev, Emine Yilmaz, Gokhan Tur, Dilek Hakkani-Tür, Hari Thadakamalla

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ATOD提出了一种评估框架和基准,用于评估代理任务导向对话系统的多目标协调、依赖管理、记忆、适应性和主动性等能力,并通过ATOD-Eval实现了细粒度指标评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22714 2026-02-02 cs.LG cs.AI cs.CV 62%

Vision-Language Models Unlock Task-Centric Latent Actions

视觉-语言模型解锁任务导向的潜在动作

Alexander Nikulin, Ilya Zisman, Albina Klepach, Denis Tarasov, Alexander Derevyagin, Andrei Polubarov, Lyubaykin Nikita, Vladislav Kurenkov

机构 * Innopolis University(因诺波利斯大学) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究所以及ISP俄罗斯科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用视觉-语言模型的常识推理能力,通过可提示的表示分离可控变化与噪声,提升潜在动作质量,从而提高下游任务性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22690 2026-02-02 cs.LG cs.AI 62%

Do Transformers Have the Ability for Periodicity Generalization?

Transformer 是否具备周期性泛化能力?

Huanyu Liu, Ge Li, Yihong Dong, Sihan Wu, Peixu Wang, Sihao Cheng, Taozhi Chen, Kechi Zhang, Hao Zhu, Tongxuan Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了 Transformer 在周期性泛化方面的局限性,通过引入抽象代数和推理视角,揭示了模型在处理复合周期性任务时的不足,并提出了可控生成基准 Coper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02295 2026-02-02 cs.CV cs.AI cs.LG 62%

VideoNSA: Native Sparse Attention Scales Video Understanding

VideoNSA:原生稀疏注意力扩展视频理解

Enxin Song, Wenhao Chai, Shusheng Yang, Ethan Armand, Xiaojun Shan, Haiyang Xu, Jianwen Xie, Zhuowen Tu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VideoNSA通过端到端训练提升视频理解,结合原生稀疏注意力实现长视频和时间推理的性能优化

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22911 2026-02-02 cs.CL cs.AI 62%

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing

ElectriQ:一个评估大型语言模型在电力营销中响应能力的基准

Jinzhi Wang, Qingke Peng, Haozhou Li, Zeyuan Zeng, Jiangbo Zhang, Kaixuan Yang, Ningyong Wu, Qinfeng Song, Ruimeng Li, Biyi Zhou

机构 * Systems Engineering Institute, Xi’an Jiaotong University(系统工程研究所,西安交通大学) State Key Laboratory of Multiphase Flow in Power Engineering, School of Energy and Power Engineering, Xi’an Jiaotong University(电力工程多相流国家重点实验室,能源与动力工程学院,西安交通大学) School of Electronic Science and Engineering, Xi'an Jiaotong University(电子科学与工程学院,西安交通大学) Organizational Management Department, School of Management, Xi’an Jiaotong University(组织管理部,管理学院,西安交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ElectriQ是一个用于评估大型语言模型在电力营销中响应能力的基准,通过结合人类评分、自动指标和合规测试,提出SEEK-RAG方法提升领域知识注入,实现高效且合规的电力营销助手部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23183 2026-02-02 cs.CL 57%

JobResQA: A Benchmark for LLM Machine Reading Comprehension on Multilingual Résumés and JDs

JobResQA:一个用于多语言简历和职位描述的LLM机器阅读理解基准

Casimiro Pio Carrino, Paula Estrella, Rabih Zbib, Carlos Escolano, José A. R. Fonollosa

机构 * Avature Machine Learning(Avature 机器学习) Universitat Politècnica de Catalunya(巴塞罗那理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 JobResQA是一个用于评估LLM在多语言简历和职位描述上的机器阅读理解能力的基准,揭示了多语言MRC在人力资源应用中的关键差距。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23058 2026-02-02 cs.LG 57%

From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning

从绝对到相对:重新思考基于群体的强化学习中的奖励塑造

Wenzhe Niu, Wei He, Zongxia Xie, Jinpeng Ou, Huichuan Fan, Yuchen Ge, Yanru Sun, Ziyin Wang, Yizhao Sun, Chengshun Shi, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出RLRR框架,通过将奖励塑造从绝对评分转为相对排名,解决群体强化学习中奖励稳定性与监督稀疏性问题,并在推理和生成任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20730 2026-02-02 cs.CL 57%

AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts

AgentLongBench: 通过环境回放构建可控的长上下文代理基准

Shicheng Fang, Yuxin Wang, Xiaoran Liu, Jiahao Lu, Chuanyuan Tan, Xinchi Chen, Yining Zheng, Xuanjing Huang, Xipeng Qiu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AgentLongBench通过模拟环境回放评估代理在长上下文任务中的表现,揭示代理在动态信息综合方面的不足。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01017 2026-02-02 cs.AI 57%

ChartAnchor: Chart Grounding with Structural-Semantic Fidelity

ChartAnchor: 图表接地与结构-语义保真

Xinhang Li, Jingbo Zhou, Pengfei Luo, Yixiong Xiao, Tong Xu

机构 * Baidu Research(百度研究) USTC

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ChartAnchor提出一个综合图表接地基准测试,通过图表到代码生成和受控表格重建任务,评估模型在结构和数值层面的保真度,揭示MLLMs在数值精度和代码合成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22699 2026-02-02 cs.CL 57%

Models Know Models Best: Evaluation via Model-Preferred Formats

模型最擅长模型评估:通过模型偏好的格式进行评估

Joonhak Lee, Sungmok Jung, Jongyeon Park, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Dept. of Computer Science and Engineering, Seoul National University(计算机科学与工程系,首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种动态格式对齐策略,通过模型生成的信号确定最佳评估格式,提升零样本准确率,揭示模型潜在能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22595 2026-02-02 cs.AI 57%

Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR

学得更多,用得更少:不确定性一致性引导的查询选择用于RLVR

Hao Yi, Yulan Hu, Xin Li, Sheng Ouyang, Lizhong Ding, Yong Liu

机构 * Renmin University of China(中国人民大学) Gaoling School of Artificial Intelligence(北京人工智能学院) Amap, Alibaba Group(阿里集团阿里的地图部门) School of Computer Science & Technology(计算机科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于不确定性一致性的查询选择方法,通过改进RLVR的样本选择策略,减少查询预算,提升推理任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22575 2026-02-02 cs.CV cs.CL 57%

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

PhoStream:面向移动场景的多模态助手实时流基准测试

Xudong Lu, Huankang Guan, Yang Bo, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Peiwen Sun, Xueying Li, Wei Zhang, Xue Yang, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(CUHK 多模态实验室) Huawei Research(华为研究) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PhoStream是首个面向移动场景的多模态助手实时流基准测试,通过统一屏幕内外场景评估视频、音频和时间推理能力,揭示了大语言模型在决定何时发言上的局限性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22076 2026-02-02 cs.LG cs.DC 57%

Where Do the Joules Go? Diagnosing Inference Energy Consumption

焦耳去哪儿了?诊断推理能耗

Jae-Won Chung, Ruofan Wu, Jeff J. Ma, Mosharaf Chowdhury

机构 * University of Michigan \& The ML.ENERGY Initiative

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究通过大规模测量发现生成式AI中不同任务和硬件配置对能耗的影响差异,并提出框架解释能耗与利用率等隐含指标的关系,为优化数据中心能耗提供依据。

Comments The ML ENERGY Leaderboard v3.0 is open at https://ml.energy/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16993 2026-02-02 cs.DL cs.AI 57%

BibAgent: An Agentic Framework for Traceable Miscitation Detection in Scientific Literature

BibAgent: 一种用于科学文献中可追溯的误引检测代理框架

Peiran Li, Fangzhou Lin, Shuo Xing, Xiang Zheng, Xi Hong, Siyuan Yang, Jiashuo Sun, Zhengzhong Tu, Chaoqun Ni

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BibAgent是一种用于科学文献中可追溯误引检测的代理框架,通过整合检索、推理和自适应证据聚合,实现高效且透明的引文验证。

详情

展开后加载摘要…

URL PDF HTML 收藏