arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2601.07239 2026-01-13 cs.AI 57%

Stochastic CHAOS: Why Deterministic Inference Kills, and Distributional Variability Is the Heartbeat of Artifical Cognition

随机CHAOS:为何确定性推断会杀死,而分布性变化是人工认知的心跳

Tanmay Joshi, Shourya Aggarwal, Anusa Saha, Aadi Pandey, Shreyash Dhoot, Vighnesh Rai, Raxit Goswami, Aman Chadha, Vinija Jain, Amitava Das

机构 * Raapid Lab, USA(美国Raapid实验室) Apple, USA(美国苹果公司) Google, USA(美国谷歌公司) Pragya Lab, BITS Pilani Goa, India(印度BITS Pilani Goa大学Pragya实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文主张随机CHAOS,认为确定性推断会压制LLM的不确定性建模和安全对齐,强调分布性变化对人工认知的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07185 2026-01-13 cs.CR cs.AI 57%

Defenses Against Prompt Attacks Learn Surface Heuristics

对抗提示攻击的防御学习表面启发式

Shawn Li, Chenxiao Yu, Zhiyu Ni, Hao Li, Charith Peris, Chaowei Xiao, Yue Zhao

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Washington University in St. Louis(圣路易斯华盛顿大学) Amazon(亚马逊公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了对抗提示攻击防御中表面启发式的问题,发现现有方法易受表面模式影响,提出受控数据集和系统评估以揭示监督微调的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07019 2026-01-13 cs.CR cs.AI cs.SE 57%

Zer0n: An AI-Assisted Vulnerability Discovery and Blockchain-Backed Integrity Framework

Zer0n:一种结合人工智能的漏洞发现与区块链保障完整性框架

Harshil Parmar, Pushti Vyas, Prayers Khristi, Priyank Panchal

机构 * Parul University(帕鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Zer0n通过结合AI与区块链技术,实现高效漏洞检测与完整性保障,达到80%的准确率并保持低开销。

Comments 10 pages, 3 figures, 7 tables. Framework for AI-Assisted Vulnerability Discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06944 2026-01-13 cs.CV cs.AI 57%

SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models

SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准

Yuhang Su, Mei Wang, Yaoyao Zhong, Guozhang Li, Shixing Li, Yihan Feng, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。

Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07403 2026-01-13 cs.CL 57%

LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction

LongEmotion: 测量大语言模型在长上下文交互中的情感智能

Weichu Liu, Jing Xiong, Yuxuan Hu, Zixuan Li, Minghuan Tan, Ningning Mao, Hui Shen, Wendong Xu, Chaofan Tao, Min Yang, Chengming Li, Lingpeng Kong, Ngai Wong

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) The University of Hong Kong(香港大学) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Beijing Normal University(北京师范大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08997 2026-01-13 cs.AI 57%

Intrinsic Memory Agents: Heterogeneous Multi-Agent LLM Systems through Structured Contextual Memory

内在记忆代理:通过结构化上下文记忆实现异构多代理LLM系统

Sizhe Yuen, Francisco Gomez Medina, Ting Su, Yali Du, Adam J. Sobey

机构 * The Alan Turing Institute(艾伦·图灵研究所) King’s College London(伦敦大学国王学院) University of Southampton(南安普顿大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出内在记忆代理,通过结构化上下文记忆提升多代理LLM系统在复杂任务中的表现,展现更高的设计质量和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06640 2026-01-13 cs.AI cs.NI 57%

Agentic AI Empowered Intent-Based Networking for 6G

基于代理AI的意图驱动网络用于6G

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

机构 * Department of Computer Science, Brunel University London, UK(布伦埃尔大学伦敦计算机科学系) Department of Computer Science, University of Reading, UK(阅读大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于多代理框架的意图驱动网络方案,通过LLM自主分解意图并生成可行网络配置,提升6G无线网络的自主编排能力。

Comments Submitted for Possible Journal Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06497 2026-01-13 cs.SE cs.AI 57%

Coding in a Bubble? Evaluating LLMs in Resolving Context Adaptation Bugs During Code Adaptation

在气泡中编码?评估LLMs在代码适应过程中解决上下文适应故障的能力

Tanghaoran Zhang, Xinjun Mao, Shangwen Wang, Yuxin Zhao, Yao Lu, Zezhou Tang, Wenyu Xu, Longfei Sun, Changrong Xie, Kang Yang, Yue Yu

机构 * National University of Defense Technology(国防科技大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究提出CtxBugGen框架,评估LLMs在解决代码适应中的上下文适应故障方面的性能,发现LLMs在处理此类问题时存在显著不足。

Comments 24 pages, 11 figures, accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06088 2026-01-13 q-fin.ST cs.LG 57%

PriceSeer: Evaluating Large Language Models in Real-Time Stock Prediction

PriceSeer:实时股票预测中大型语言模型的评估

Bohan Liang, Zijian Chen, Qi Jia, Kaiwei Zhang, Kaiyuan Ji, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 PriceSeer通过实时动态数据评估LLMs在股票预测中的性能,提供数据无污染的基准测试及六种先进模型的多时间范围预测分析。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06039 2026-01-13 cs.CL 57%

Operation Veja: Fixing Fundamental Concepts Missing from Modern Roleplaying Training Paradigms

Operation Veja: 修复现代角色扮演训练范式中缺失的根本概念

Yueze Liu, Ajay Nagi Reddy Kumdam, Ronit Kanjilal, Hao Yang, Yichi Zhang

机构 * Divergence 2% LLC Department of Electrical and Computer Engineering University of Illinois Urbana-Champaign(电气与计算机工程系伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Operation Veja提出VEJA框架,通过整合价值观、经历、判断和能力,改进角色扮演模型的数据整理方法,以提升角色真实性和叙述连续性。

Comments Accepted to NeurIPS 2025 PeronaLLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07063 2026-01-13 cs.AI 57%

Towards Safer AI Moderation: Evaluating LLM Moderators Through a Unified Benchmark Dataset and Advocating a Human-First Approach

迈向更安全的AI审核:通过统一基准数据集评估LLM审核员并倡导以人类为中心的方法

Naseem Machlovi, Maryam Saleki, Innocent Ababio, Ruhul Amin

机构 * Fordham University(福特汉姆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过统一基准数据集评估LLM审核性能,提出SafePhi在道德判断上优于现有模型,强调需引入人类反馈提升审核可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12495 2026-01-13 cs.CL 57%

KG-MuLQA: A Framework for KG-based Multi-Level QA Extraction and Long-Context LLM Evaluation

KG-MuLQA:基于知识图谱的多级问答提取与长上下文LLM评估框架

Nikita Tatarinov, Vidhyakshaya Kannan, Haricharana Srinivasa, Arnav Raj, Harpreet Singh Anand, Varun Singh, Aditya Luthra, Ravij Lade, Agam Shah, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 KG-MuLQA通过基于知识图谱的文档表示,实现了多级问答提取与长上下文LLM评估,揭示了模型在集合运算和多跳推理上的系统性失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19153 2026-01-12 cs.CR cs.AI cs.SE 57%

LLMs as verification oracles for Solidity

LLMs作为Solidity的验证或者

Massimo Bartoletti, Enrico Lipparini, Livio Pompianu

机构 * University of Cagliari, Italy(卡利亚里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了使用LLMs评估Solidity合同属性有效性的潜力,通过实证研究展示其在智能合约验证中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04160 2026-01-12 cs.CL cs.CE q-fin.CP 57%

All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection

并非所有发光的都是金子:一个无参考信息的反事实金融虚假信息检测基准

Yuechen Jiang, Zhiwei Liu, Yupeng Cao, Yueru He, Ziyang Xu, Chen Xu, Zhiyang Deng, Prayag Tiwari, Xi Chen, Alejandro Lopez-Lira, Jimin Huang, Junichi Tsujii, Sophia Ananiadou

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 RFC Bench通过对比上下文提升金融虚假信息检测性能,揭示无参考设置下的模型局限性。

Comments 48 pages; 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05101 2026-01-09 cs.AI 57%

Arabic Prompts with English Tools: A Benchmark

阿拉伯提示与英语工具:一个基准

Konstantin Kubrak, Ahmed El-Moselhy, Ammar Alsulami, Remaz Altuwaim, Hassan Ismail Fawaz, Faisal Alsaby

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出首个阿拉伯语言LLMs工具调用能力评估基准,揭示阿拉伯语交互环境下工具调用准确率下降5-10%的显著差距。

Comments 10 pages, 10 figures, LLMs, Big Data, and Multilinguality for All (LLMs4All) Workshop at IEEE BigData 2025 Conference, Macau, December 10, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05009 2026-01-09 cs.AI 57%

An Empirical Investigation of Robustness in Large Language Models under Tabular Distortions

对大型语言模型在表格扭曲下的鲁棒性进行实证研究

Avik Dutta, Harshit Nigam, Hosein Hasanbeig, Arjun Radhakrishna, Sumit Gulwani

机构 * Microsoft Corp.(微软公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨了大型语言模型在表格数据扭曲下的鲁棒性问题,发现模型在缺乏显式提示时难以自动纠正表格错误,且顶级模型在扭曲下准确率显著下降。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04960 2026-01-09 cs.CL cs.SD 57%

A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction

具有注入情感归因思维的统一口语语言模型用于人样交互

Qing Wang, Zehan Li, Yaodong Song, Hongjie Chen, Jian Kang, Jie Lian, Jie Li, Yongxiang Li, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种通过注入情感归因思维提升情感智能的统一口语语言模型,实现人样交互中的情感感知与响应生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04895 2026-01-09 cs.AI 57%

DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation

DVD:一种检测大规模语言模型评估中变体污染的稳健方法

Renzhao Liang, Jingru Chen, Bo Jia, Bo Deng, Chenggang Xie, Yidong Wang, Ke Jin, Xin Wang, Linfeng Zhang, Cunxiang Wang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04709 2026-01-09 cs.AI 57%

Bridging Temporal and Textual Modalities: A Multimodal Framework for Automated Cloud Failure Root Cause Analysis

弥合时序与文本模态:一种多模态框架用于自动化云故障根本原因分析

Gijun Park

机构 * Okestro

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过融合时间序列与文本数据,提升云故障根本原因分析的自动化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04582 2026-01-09 cs.CL 57%

Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization

对齐文本、代码和视觉:一种多目标强化学习框架用于文本到可视化

Mizanur Rahman, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出RL-Text2Vis框架,通过多目标强化学习提升文本到可视化的准确性和代码执行率。

Comments Accepted to EACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04540 2026-01-09 cs.SE cs.AI 57%

AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation

AdaptEval: 一个用于评估大型语言模型在代码片段适应上的基准

Tanghaoran Zhang, Xinjun Mao, Shangwen Wang, Yuxin Zhao, Yao Lu, Jin Zhang, Zhang Zhang, Kang Yang, Yue Yu

机构 * College of Computer Science and Technology(计算机科学与技术学院) National University of Defense and Technology(国防科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AdaptEval是一个用于评估大型语言模型在代码片段适应能力的基准,通过多粒度标注和细粒度测试框架,首次实证研究了六种LLMs在代码适应任务上的表现。

Comments 13 pages, 7 figures, Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13655 2026-01-09 cs.CL cs.SE 57%

Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation

大语言模型擦除方法的比较分析:跨架构评估

Richard J. Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04055 2026-01-08 cs.CL 57%

Modular Prompt Optimization: Optimizing Structured Prompts with Section-Local Textual Gradients

模块化提示优化:通过部分局部文本梯度优化结构化提示

Prith Sharma, Austin Z. Henley

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 模块化提示优化通过局部文本梯度优化结构化提示,提升小型开源LLM的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03986 2026-01-08 cs.CL 57%

Benchmark^2: Systematic Evaluation of LLM Benchmarks

Benchmark^2: 大语言模型评估基准的系统性评估

Qi Qian, Chengsong Huang, Jingwen Xu, Changze Lv, Muling Wu, Wenhao Liu, Xiaohua Wang, Zhenghua Wang, Zisu Huang, Muzhao Tian, Jianhan Xu, Kun Hu, He-Da Wang, Yao Hu, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Washington University in St. Louis(华盛顿大学圣路易斯分校) Xiaohongshu Inc.(小红书公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Benchmark^2 提出了一种系统性评估大语言模型评估基准的方法,通过三个互补指标分析基准质量,揭示现有基准的差异并展示选择性构建的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03670 2026-01-08 cs.CL 57%

DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management

DisastQA:一个评估灾难管理中问答能力的综合性基准

Zhitong Chen, Kai Yin, Xiangjue Dong, Chengkai Liu, Xiangpeng Li, Yiming Xiao, Bo Li, Junwei Ma, Ali Mostafavi, James Caverlee

机构 * Texas A&M University(德克萨斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 DisastQA是一个用于评估灾难管理中问答能力的综合性基准,通过严格验证的问题和人类-LLM协作流程,揭示了在噪声环境下模型性能的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03590 2026-01-08 cs.CV cs.AI 57%

Can LLMs See Without Pixels? Benchmarking Spatial Intelligence from Textual Descriptions

大语言模型能否通过像素感知空间智能?基于文本描述的空间智能基准测试

Zhongbin Guo, Zhen Yang, Yushan Li, Xinyue Zhang, Wenyu Gao, Jiacheng Wang, Chengzhi Li, Xiangrui Liu, Ping Jian

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SiT-Bench通过文本描述评估大语言模型的空间智能,揭示其在全局一致性方面的不足,并表明显式空间推理可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03531 2026-01-08 cs.CL 57%

PALM-Bench: A Comprehensive Benchmark for Personalized Audio-Language Models

PALM-Bench: 一个全面的个性化音频-语言模型基准测试

Yuwen Wang, Xinyuan Qian, Tian-Hao Zhang, Jiaran Gao, Yuchen Pan, Xin Wang, Zhou Pan, Chen Wei, Yiming Wang

机构 * University of Science and Technology Beijing(北京科技大学) Li Auto(利汽车) Fondazione Bruno Kessler(布鲁诺·克塞尔基金会)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PALM-Bench旨在通过构建首个个性化音频-语言模型基准测试,促进个性化模型在多说话者场景中的方法发展和评估。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03458 2026-01-08 cs.CY cs.AI 57%

Automated Feedback Generation for Undergraduate Mathematics: Development and Evaluation of an AI Teaching Assistant

大学数学自动反馈生成:一种AI教学助教的开发与评估

Aron Gohr, Marie-Amelie Lawn, Kevin Gao, Inigo Serjeant, Stephen Heslip

机构 * Imperial College London(帝国理工学院伦敦校区)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的教学助手系统,用于生成大学数学作业的自动反馈,通过模块化工作流和大型语言模型实现了对技术正确性和风格的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03434 2026-01-08 cs.LG 57%

VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding

VNU-Bench:多源多模态新闻视频理解的基准数据集

Zibo Liu, Muyang Li, Zhe Jiang, Shigang Chen

机构 * University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03285 2026-01-08 physics.ed-ph cs.AI 57%

Feedback Indices to Evaluate LLM Responses to Rebuttals for Multiple Choice Type Questions

反馈指数用于评估LLM对多项选择题反驳的响应

Justin C. Dunlap, Anne-Simone Parent, Ralf Widenhorn

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出反馈指数评估LLM对多项选择题反驳的响应,通过分析谄媚和固执行为,揭示模型在不同世代间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏