arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2601.15645 2026-01-23 cs.CL 57%

Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation

迈向可靠的医疗大语言模型:在真实医疗咨询中评估和增强大语言模型信心估计的基准测试

Zhiyao Ren, Yibing Zhan, Siyuan Liang, Guozheng Ma, Baosheng Yu, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MedConf框架,通过证据引导的语言自评估方法,在医疗咨询中提升大语言模型的信心估计精度与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15551 2026-01-23 cs.AI cs.MA 57%

ALIGNAgent: Adaptive Learner Intelligence for Gap Identification and Next-step guidance

ALIGNAgent: 适应性学习智能用于知识缺口识别与下一步指导

Bismack Tokoli, Luis Jaimes, Ayesha S. Dina

机构 * Department Of Data Science and Business Analytics, *Department Of Computer Science, Florida Polytechnic University(数据科学与商业分析系、计算机科学系,佛罗里达理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ALIGNAgent是一种多智能体教育框架,通过整合知识估计、技能缺口识别和定向资源推荐,实现个性化学习,实验证明其在知识熟练度估计上的高精度和高F1分数。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13273 2026-01-23 cs.SD cs.AI 57%

AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs

AudioMotionBench: 评估音频大语言模型中的听觉运动感知

Zhe Sun, Yujun Cai, Jiayu Yao, Yiwei Wang

机构 * Wuhan University(武汉大学) University of Queensland(昆士兰大学) University of Chinese Academy of Sciences(中国科学院大学) University of California, Merced(加州大学默塞德分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AudioMotionBench通过评估音频大语言模型对移动声源方向和轨迹的感知能力,揭示了当前模型在听觉空间推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21143 2026-01-23 cs.CL cs.CV 57%

The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?

感知挑战:多模态大语言模型能否解决简单感知问题?

Samrajnee Ghosh, Naman Agarwal, Hemanshu Garg, Chinmay Mittal, Mausam, Parag Singla

机构 * IIT Delhi(德里印度理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Percept-V挑战通过简单感知任务测试多模态大语言模型的表现,发现其在基本感知任务上远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16921 2026-01-23 cs.CL 57%

Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs

善良并不总是安全:诊断大语言模型中的情感幻觉

Sewon Kim, Jiwon Kim, Seungwoo Shin, Hyejin Chung, Daeun Moon, Yejin Kwon, Hyunsoo Yoon

机构 * Department of Industrial Engineering, Yonsei University(工业工程系,延世大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AHaBench和AHaPairs用于诊断LLM中的情感幻觉问题,通过DPO优化减少虚假社会存在感,提升模型的心理安全性和事实可靠性。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22777 2026-01-23 cs.CL 57%

MEDAL: A Framework for Benchmarking LLMs as Multilingual Open-Domain Dialogue Evaluators

MEDAL:一个用于评估LLM作为多语言开放领域对话评估器的框架

John Mendonça, Alon Lavie, Isabel Trancoso

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MEDAL框架通过多语言多代理方法,评估LLM作为开放领域对话评估者的性能,揭示了现有评判者在检测细微问题上的不足。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15282 2026-01-22 cs.CV cs.AI cs.RO 57%

Rethinking Video Generation Model for the Embodied World

重新思考具身世界的视频生成模型

Yufan Deng, Zilin Pan, Hongyu Zhang, Xiaojie Li, Ruoqing Hu, Yufei Ding, Yiming Zou, Yan Zeng, Daquan Zhou

机构 * Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Rbench机器人视频生成基准和RoVid-X数据集,旨在解决高保真机器人视频生成中的数据短缺问题,推动具身AI发展。

Comments Github: https://github.com/DAGroup-PKU/ReVidgen/ Project website: https://dagroup-pku.github.io/ReVidgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15129 2026-01-22 cs.CL 57%

RSNA Large Language Model Benchmark Dataset for Chest Radiographs of Cardiothoracic Disease: Radiologist Evaluation and Validation Enhanced by AI Labels (REVEAL-CXR)

用于心胸疾病胸部X光影像的RSNA大语言模型基准数据集:通过AI标签增强的放射科评估和验证(REVEAL-CXR)

Yishu Wei, Adam E. Flanders, Errol Colak, John Mongan, Luciano M Prevedello, Po-Hao Chen, Henrique Min Ho Lee, Gilberto Szarf, Hamilton Shoji, Jason Sho, Katherine Andriole, Tessa Cook, Lisa C. Adams, Linda C. Chu, Maggie Chung, Geraldine Brusca-Augello, Djeven P. Deva, Navneet Singh, Felipe Sanchez Tijmes, Jeffrey B. Alpert, Elsie T. Nguyen, Drew A. Torigian, Kate Hanneman, Lauren K Groner, Alexander Phan, Ali Islam, Matias F. Callejas, Gustavo Borges da Silva Teles, Faisal Jamal, Maryam Vazirabad, Ali Tejani, Hari Trivedi, Paulo Kuriki, Rajesh Bhayana, Elana T. Benishay, Yi Lin, Yifan Peng, George Shih

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过AI辅助标注流程,创建了包含200张胸部影像的基准数据集,用于评估不同模型,同时帮助放射科医生更高效地标注影像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14903 2026-01-22 cs.CL 57%

PodBench: A Comprehensive Benchmark for Instruction-Aware Audio-Oriented Podcast Script Generation

PodBench: 一个全面的指令感知音频导向播客脚本生成基准

Chenning Xu, Mao Zheng, Mingyu Zheng, Mingyang Song

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PodBench通过多方面评估框架和实验验证,揭示了开源模型在长上下文和多说话人协调任务中的鲁棒性优势,同时指出高指令遵循性与高质量内容之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14549 2026-01-22 cs.LG 57%

QMC: Efficient SLM Edge Inference via Outlier-Aware Quantization and Emergent Memories Co-Design

QMC:通过异常感知量化和涌现记忆协同设计实现高效的SLM边缘推断

Nilesh Prasad Pandey, Jangseon Park, Onat Gungor, Flavio Ponzina, Tajana Rosing

机构 * University of California San Diego(加州大学圣地亚哥分校) San Diego State University(圣地亚哥州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 QMC通过异常感知量化和涌现记忆协同设计,实现高效SLM边缘推断,显著降低内存、能耗和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14277 2026-01-22 cs.LG 57%

Which Quantization Should I Use? A Unified Evaluation of llama.cpp Quantization on Llama-3.1-8B-Instruct

我应该使用哪种量化?对llama.cpp量化在Llama-3.1-8B-Instruct上的统一评估

Uygar Kurt

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文评估了llama.cpp不同量化方案在Llama-3.1-8B-Instruct模型上的性能,为选择合适的量化方法提供指导。

Comments 17 pages, 6 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13880 2026-01-21 cs.AI 57%

LifeAgentBench: A Multi-dimensional Benchmark and Agent for Personal Health Assistants in Digital Health

LifeAgentBench: 一个多维基准和代理用于数字健康中的个人健康助手

Ye Tian, Zihao Wang, Onat Gungor, Xiaoran Fan, Tajana Rosing

机构 * University of California San Diego(加州大学圣地亚哥分校) Google Research(谷歌研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LifeAgentBench多维基准和代理,用于评估LLM在长周期、跨维度健康推理中的能力,并通过实验识别关键瓶颈,提出基线代理LifeAgent实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13581 2026-01-21 cs.AI 57%

SCRIPTMIND: Crime Script Inference and Cognitive Evaluation for LLM-based Social Engineering Scam Detection System

SCRIPTMIND:基于LLM的社会工程诈骗检测系统的犯罪脚本推断与认知评估

Heedou Kim, Changsik Kim, Sanghwa Shin, Jaewoo Kang

机构 * Korea University(韩国大学) Korean National Police Agency(韩国国家警察局) Inje University(仁荷大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ScriptMind通过结合自动化推理与人类认知,提升LLM在社会工程诈骗检测中的准确性与用户认知意识

Comments This paper has been accepted to the EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13443 2026-01-21 cs.AI 57%

Explicit Cognitive Allocation: A Principle for Governed and Auditable Inference in Large Language Models

显式认知分配:一种用于受控和可审计的大语言模型推理的原则

Héctor Manuel Manzanilla-Granados, Zaira Navarrete-Cazales, Miriam Pescador-Rojas, Tonahtiu Ramírez-Romero

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出显式认知分配原则,通过认知通用代理架构实现结构化推理,提升大语言模型在高责任场景下的可追溯性和可审计性。

Comments Preprint. This version corresponds to the initial public release of the CUA architecture and associated evaluation metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06747 2026-01-21 cs.AI 57%

FinForge: Semi-Synthetic Financial Benchmark Generation

FinForge:半合成金融基准生成

Glenn Matlin, Akhil Theerthala, Anant Gupta, Anirudh JM, Rayan Castilla, Yi Mei Ng, Sudheer Chava

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FinForge通过半合成方法生成金融领域基准,评估模型在金融推理中的性能,揭示模型在金融领域的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10795 2026-01-21 cs.CL 57%

Beyond "Not Novel Enough": Enriching Scholarly Critique with LLM-Assisted Feedback

超越‘不够新颖’:利用LLM辅助反馈丰富学术批评

Osama Mohammed Afzal, Preslav Nakov, Tom Hope, Iryna Gurevych

机构 * UKP Lab, TU Darmstadt and Hessian Center for AI (hessian.AI)(图林人工智能实验室、德累斯顿理工大学和黑森人工智能中心) MBZUAI(马克斯·普朗克人工智能研究所) The Allen Institute for AI (AI2)(人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种结构化LLM辅助方法,通过三个阶段评估论文新颖性,实现86.5%的人类推理一致性,显著优于现有基线方法,提升同行评审的严谨性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15364 2026-01-21 cs.AI 57%

KeyDiff: Key Similarity-Based KV Cache Eviction for Long-Context LLM Inference in Resource-Constrained Environments

KeyDiff: 基于键相似性的KV缓存淘汰方法用于资源受限环境中的长上下文LLM推理

Junyoung Park, Dalton Jones, Matthew J Morse, Raghavv Goel, Mingu Lee, Chris Lott

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 KeyDiff是一种基于键相似性的KV缓存淘汰方法,能够在资源受限环境下高效处理长上下文LLM推理,减少缓存占用并提升响应效率。

Comments 37 pages, 19 figures, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19498 2026-01-21 cs.CL 57%

DomainCQA: Crafting Knowledge-Intensive QA from Domain-Specific Charts

DomainCQA: 从领域特定图表中构建知识密集型问答

Yujing Lu, Ling Zhong, Jing Yang, Weiming Li, Peng Wei, Yongheng Wang, Manni Duan, Qing Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 DomainCQA通过构建领域特定图表问答基准测试,提升多模态大语言模型在视觉理解和知识密集型推理方面的能力。

Comments 83 pages, 59 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13206 2026-01-21 cs.AI 57%

Real-Time Deadlines Reveal Temporal Awareness Failures in LLM Strategic Dialogues

实时截止时间揭示了LLM战略对话中的时间意识失败

Neil K. R. Sehgal, Sharath Chandra Guntuku, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究发现LLM在时间敏感任务中存在时间跟踪不足的问题,导致在实时截止条件下表现不佳,但能在回合制限制下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13186 2026-01-21 cs.AI cs.MA 57%

Prompt Injection Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

通过语义缓存、嵌套学习和AI可持续性缓解提示注入

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Torino, Italy(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据部门,意大利托里诺) Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Plymouth Meeting, PA, USA(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据部门,美国普利茅斯会议)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过语义缓存、嵌套学习和AI可持续性方法,提出了一种缓解提示注入的系统,实现安全、高效且环保的LLM部署。

Comments 33 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12974 2026-01-21 cs.CL 57%

Bridging the Knowledge-Action Gap by Evaluating LLMs in Dynamic Dental Clinical Scenarios

通过评估LLMs在动态牙科临床场景中弥合知识-行动鸿沟

Hongyang Ma, Tiantian Gu, Huaiyuan Sun, Huilin Zhu, Yongxin Wang, Jie Li, Wubin Sun, Zeliang Lian, Yinghong Zhou, Yi Gao, Shirui Wang, Zhihui Tang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过SCMPE基准评估LLMs在动态牙科临床场景中的表现,发现其在动态对话中存在主动信息收集和状态跟踪的瓶颈,揭示了外部知识不足以弥补推理差距,需领域自适应预训练。

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12807 2026-01-21 cs.LG 57%

Semi-supervised Instruction Tuning for Large Language Models on Text-Attributed Graphs

大型语言模型在文本属性图上的半监督指令微调

Zixing Song, Irwin King

机构 * University of Bristol(布里斯托大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SIT-Graph通过半监督指令微调提升文本属性图学习性能,实现低标签条件下20%以上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12799 2026-01-21 cs.RO cs.CL cs.CV 57%

FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions

FRoM-W1: 向通用人形机器人全身控制迈进:利用语言指令

Peng Li, Zihan Zhuang, Yangfan Gao, Yi Dong, Sixian Li, Changhao Jiang, Shihan Dou, Zhiheng Xi, Enyu Zhou, Jixuan Huang, Hui Li, Jingjing Gong, Xingjun Ma, Tao Gui, Zuxuan Wu, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 FRoM-W1通过语言指令实现人形机器人全身控制,结合大规模语言模型和强化学习提升动作生成与执行能力。

Comments Project Page: https://openmoss.github.io/FRoM-W1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12661 2026-01-21 cs.AI 57%

MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents

MedConsultBench: 一个完整周期、细粒度、过程感知的医疗咨询代理基准

Chuhan Qiao, Jianghua Huang, Daxing Zhao, Ziding Liu, Yanjun Shen, Bing Cheng, Wei Lin, Kai Wu

机构 * Meituan(美团)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 MedConsultBench通过细粒度过程感知评估医疗咨询代理的完整咨询周期,揭示高诊断准确性背后的效率与安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12585 2026-01-21 cs.HC cs.AI cs.ET 57%

Do MLLMs See What We See? Analyzing Visualization Literacy Barriers in AI Systems

MLLMs是否看到我们看到的?分析AI系统中可视化素养障碍

Mengli, Duan, Yuhe, Jiang, Matthew Varona, Carolina Nobre

机构 * University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究分析了MLLMs在可视化素养中的障碍,揭示了两种机器特定的障碍,并展示了模型在复杂可视化任务上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12505 2026-01-21 cs.CL 57%

DoPE: Decoy Oriented Perturbation Encapsulation Human-Readable, AI-Hostile Documents for Academic Integrity

DoPE: 伪装导向扰动封装用于学术诚信的人可读AI敌对文档

Ashish Raj Shekhar, Shiven Agarwal, Priyanuj Bordoloi, Yash Shah, Tejas Anvekar, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 DoPE通过在考试文档中嵌入语义伪装,利用MLLM pipelines的渲染-解析差异,实现对AI自动解决的预防和检测,提升学术诚信保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12473 2026-01-21 cs.CL 57%

Capability-Aware Early-Stage Research Idea Evaluation

具备能力的早期研究想法评估

Renlong Jie, Chen Chu, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) School of Statistics and Mathematics(统计与数学学院) iOPEN

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本文提出一种基于能力的框架,通过作者信息和研究想法预测论文接受情况,无需完整文本或实验结果,显著提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12392 2026-01-21 cs.AI 57%

PsychēChat: An Empathic Framework Focused on Emotion Shift Tracking and Safety Risk Analysis in Psychological Counseling

PsychēChat: 一种专注于心理辅导中情感转变跟踪和安全风险分析的共情框架

Zhentao Xia, Yongqi Fan, Yuxiang Chu, Yichao Yin, Liangliang Chen, Tong Ruan, Weiyan Zhang

机构 * East China University of Science and Technology(东华大学) Shanghai Changning Mental Health Center, Affiliated Mental Health Center of East China Normal University(上海昌宁心理健康中心,华东师范大学附属心理健康中心)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 PsychēChat通过情感管理与风险控制模块,提升心理辅导中情感转变跟踪和安全风险分析的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19423 2026-01-21 cs.AI 57%

ETOM: A Five-Level Benchmark for Evaluating Tool Orchestration within the MCP Ecosystem

ETOM:一种用于评估MCP生态系统内工具编排的五级基准

Jia-Kai Dong, I-Wei Huang, Chun-Tin Wu, Yi-Tien Tsai

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 ETOM提出了一种五级基准,用于评估LLM代理在MCP生态系统中进行多跳工具编排的能力,通过构建等效功能集提供客观指标,揭示代理在鲁棒性和复杂任务中的系统性弱点。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08341 2026-01-21 cs.AI cs.MA q-bio.GN 57%

Benchmarking AI scientists for omics data driven biological discovery

对驱动生物发现的生物信息学数据的AI科学家进行基准测试

Erpai Luo, Jinmeng Jia, Yifan Xiong, Xiangyu Li, Xiaobo Guo, Baoqi Yu, Minsheng Hao, Lei Wei, Xuegong Zhang

机构 * MOE Key Laboratory of Bioinformatics(生物信息学国家重点实验室) Bioinformatics Division of BNRIST, Department of Automation(生物信息学部) Tsinghua University(清华大学) School of Software Engineering(软件学院) Beijing Jiaotong University(北京交通大学) Department of Physiology and Pathophysiology, School of Basic Medical Sciences(基础医学学院生理与病理生理学系) Capital Medical University(首都医科大学) Center for Synthetic and Systems Biology, School of Life Sciences and School of Medicine(合成与系统生物学中心,生命科学学院,医学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BAISBench通过评估AI科学家在单细胞转录组数据上的表现,推动生物发现的AI研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏