arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2512.03026 2025-12-03 cs.CL cs.AI 62%

The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models

道德一致性流水线:面向大语言模型的持续道德评估

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Negar Shahabi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔大学SWAT实验室) Concordia Institute for Information Systems Engineering, Concordia University(Concordia大学信息系统工程研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MoCoP通过闭环框架持续评估大语言模型的道德一致性,揭示伦理与毒性间的强负相关,推动自主AI系统中计算道德研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02810 2025-12-03 cs.RO cs.AI cs.LG 62%

Phase-Adaptive LLM Framework with Multi-Stage Validation for Construction Robot Task Allocation: A Systematic Benchmark Against Traditional Optimization Algorithms

具有多阶段验证的相适应LLM框架用于施工机器人任务分配:与传统优化算法的系统基准测试

Shyam prasad reddy Kaitha, Hongrui Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LTAA框架,结合LLM推理与结构化验证,实现施工机器人任务分配的高效协调,展示LLM在任务分配中的优越性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02689 2025-12-03 cs.CL cs.AI 62%

An Empirical Survey of Model Merging Algorithms for Social Bias Mitigation

对缓解社会偏见的模型合并算法的实证调查

Daiki Shirafuji, Tatsuhiko Saito, Yasutomo Kimura

机构 * Mitsubishi Electric Corporation(三菱电机公司) Otaru University of Commerce(大岛商业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文实证分析了七种模型合并算法在缓解社会偏见中的效果,发现SLERP在平衡偏见减少与性能方面表现最佳。

Comments Accepted in PACLIC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18659 2025-12-03 stat.ML cs.AI cs.LG stat.ME 62%

Adaptive Prediction-Powered AutoEval with Reliability and Efficiency Guarantees

具有可靠性和效率保证的自适应预测-驱动AutoEval

Sangwoo Park, Matteo Zecchin, Osvaldo Simeone

机构 * Department of Engineering(工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出R-AutoEval+框架,通过自适应构造模型评估变量,实现模型评估的可靠性保障和样本效率提升。

Comments NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07646 2025-12-03 cs.CL cs.AI 62%

On the Temporal Question-Answering Capabilities of Large Language Models Over Anonymized Data

大型语言模型在匿名数据上的时间问答能力研究

Alfredo Garrachón Ruiz, Tomás de la Rosa, Daniel Borrajo

机构 * AI Research, JP Morgan Chase(人工智能研究, 花旗集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型在匿名数据上的时间推理能力,开发了RATA数据集并比较了多种方法,发现需要集成方法而非单一LLM。

Comments 18 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02405 2025-12-03 cs.CV cs.AI cs.LG 62%

WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate

WISE: 加权迭代专家社会用于鲁棒多模态多智能体辩论

Anoop Cherian, River Doyle, Eyal Ben-Dov, Suhas Lohit, Kuan-Chuan Peng

机构 * Mitsubishi Electric Research Labs(三菱电机研究实验室) Cambridge Rindge and Latin School(剑桥林恩和拉丁学校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WISE框架,通过多模态多智能体辩论提升视觉语言推理任务的准确性,实验显示在多个数据集上提升了2-7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02363 2025-12-03 cs.CL cs.AI 62%

Memory-Augmented Knowledge Fusion with Safety-Aware Decoding for Domain-Adaptive Question Answering

具有安全意识解码的记忆增强知识融合用于领域自适应问答

Lei Fu, Xiang Chen, Kaige Gao Xinyue Huang, Kejian Tong

机构 * Independent Researcher(独立研究者) Boston University(波士顿大学) Binghamton University(伯克利大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 KARMA通过记忆增强和安全意识解码提升领域自适应问答的准确性和安全性

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02299 2025-12-03 cs.CL cs.AI 62%

HealthContradict: Evaluating Biomedical Knowledge Conflicts in Language Models

HealthContradict: 评估语言模型在生物医学知识中的矛盾

Boya Zhang, Alban Bornet, Rui Yang, Nan Liu, Douglas Teodoro

机构 * Faculty of Medicine, University of Geneva(日内瓦大学医学院) Department of Biomedical Informatics, Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学 Yong Loo Lin 医学院生物医学信息学系) Department of Biostatistics & Bioinformatics, Duke University Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所生物统计学与生物信息学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HealthContradict数据集评估语言模型在处理生物医学知识矛盾时的推理能力,揭示模型在正确上下文利用与错误上下文抵抗方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01282 2025-12-03 cs.CL cs.AI 62%

Kardia-R1: Unleashing LLMs to Reason toward Understanding and Empathy for Emotional Support via Rubric-as-Judge Reinforcement Learning

Kardia-R1: 通过Rubric-as-Judge强化学习释放大语言模型以通过评分标准进行推理,以实现情感支持的理解与共情

Jiahao Yuan, Zhiqing Cui, Hanqing Wang, Yuansheng Gao, Yucheng Zhou, Usman Naseem

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Kardia-R1通过Rubric-as-Judge强化学习框架,提升大语言模型在情感支持中的理解与共情能力,通过评分标准引导训练以实现更准确的情感推理和个性化响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01852 2025-12-02 cs.CL cs.AI cs.ET 62%

BHRAM-IL: A Benchmark for Hallucination Recognition and Assessment in Multiple Indian Languages

BHRAM-IL:多印度语言中的幻觉识别与评估基准

Hrishikesh Terdalkar, Kirtan Bhojani, Aryan Dongare, Omm Aditya Behera

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BHRAM-IL是一个用于多印度语言中幻觉识别与评估的基准,通过评估14种多语言LLM在多个任务上的表现,揭示了幻觉检测的跨语言和事实性问题。

Comments Accepted at BHASHA Workshop @ IJCNLP/AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01507 2025-12-02 cs.AI cs.LG 62%

SynthStrategy: Extracting and Formalizing Latent Strategic Insights from LLMs in Organic Chemistry

SynthStrategy: 从有机化学中提取并形式化大语言模型中的潜在战略洞察

Daniel Armstrong, Zlatko Jončev, Andres M Bran, Philippe Schwaller

机构 * \'Ecole Polytechnique F\' e d\' e rale de Lausanne (EPFL)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SynthStrategy通过将大语言模型中的合成策略转化为可验证代码,实现了基于自然语言的路线检索,并在基准测试中达到75%的Top-3准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00586 2025-12-02 cs.LG cs.CL q-bio.QM 62%

Statistical NLP for Optimization of Clinical Trial Success Prediction in Pharmaceutical R&D

统计自然语言处理用于药理研发中临床试验成功预测的优化

Michael R. Doane

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文利用统计自然语言处理技术开发了基于BioBERT的模型,以优化神经科学领域临床试验成功预测,提升研发决策效率。

Comments Doctor of Engineering Praxis Dissertation, The George Washington University. 122 pages. Present affiliation: Iambic Therapeutics

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16671 2025-12-02 cs.CL cs.AI cs.CV 62%

MimeQA: Towards Socially-Intelligent Nonverbal Foundation Models

MimeQA: 向具有社会智能的非语言基础模型迈进

Hengzhi Li, Megan Tjandrasuwita, Yi R. Fung, Armando Solar-Lezama, Paul Pu Liang

机构 * Massachusetts Institute of Technology(麻省理工学院) Imperial College London(伦敦帝国理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MimeQA通过引入非语言互动数据集,评估视频大语言模型在非语言社会推理中的表现,发现其准确率较低,人类表现更优。

Comments NeurIPS 2025 Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00290 2025-12-02 cs.CL cs.AI 62%

EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education

EduEval: 一个用于评估大语言模型在中文教育中表现的分层认知基准

Guoqing Ma, Jia Zhu, Hanghui Guo, Weijie Shi, Yue Cui, Jiawei Shen, Zilong Li, Yidan Liang

机构 * Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EduEval通过分层认知基准评估大语言模型在中文教育中的表现,揭示其在事实性任务与创造性任务上的差异,并发现开源模型在复杂教育推理上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00042 2025-12-02 cs.CV cs.AI cs.CL cs.CY 62%

Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions

弥合差距:面向标准化考试题目的视觉语言模型数据驱动微调

Egemen Sert, Şeyda Ertekin

机构 * organization= Department of Computer Engineering, Middle East Technical University (METU) , city= Ankara , country= Türkiye organization= METU-DTX Digital Transformation \& Innovation Centre, METU , city= Ankara , country= Türkiye

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过高质量数据和优化语法提升视觉语言模型在标准化考试题目的多模态推理性能,达到接近SOTA的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00039 2025-12-02 cs.NI cs.AI cs.CL 62%

LM4Opt-RA: A Multi-Candidate LLM Framework with Structured Ranking for Automating Network Resource Allocation

LM4Opt-RA: 一种带有结构化排序的多候选LLM框架,用于自动化网络资源分配

Tasnim Ahmed, Siana Rizwan, Naveed Ejaz, Salimur Choudhury

机构 * School of Computing(计算机学院) Queen’s University(女王大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LM4Opt-RA通过结构化排序机制和多种提示策略,提升网络资源分配优化的LLM性能,实现优于基线模型的数学评估成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01558 2025-12-02 cs.LG cs.CL 62%

Predicting the Performance of Black-box LLMs through Follow-up Queries

通过后续查询预测黑盒大语言模型的性能

Dylan Sam, Marc Finzi, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过后续查询预测黑盒大语言模型性能,利用响应概率训练可靠预测器,有效区分模型正确性及对抗性影响。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21757 2025-12-01 cs.CY cs.AI cs.CL cs.CR 62%

Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs

医疗恶意:用于医疗LLM中情境感知安全的数据库

Andrew Maranhão Ventura D'addario

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Medical Malice提出一个情境感知安全的医疗数据库,通过对抗性提示和伦理推理提升医疗LLM的安全性,以应对医疗领域复杂且系统性的威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10157 2025-12-01 cs.AI cs.CL 62%

One Patient, Many Contexts: Scaling Medical AI with Contextual Intelligence

一个患者,许多情境:通过情境智能扩展医疗AI

Michelle M. Li, Ben Y. Reis, Adam Rodman, Tianxi Cai, Noa Dagan, Ran D. Balicer, Joseph Loscalzo, Isaac S. Kohane, Marinka Zitnik

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出情境切换技术,通过调整模型推理而非重新训练,使医疗AI能适应不同专科、人群和地理环境,提升其在现实护理中的可靠性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20937 2025-11-27 cs.AI cs.CL cs.CV cs.RO 62%

ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction

ENACT:通过视角交互的世界建模评估具身认知

Qineng Wang, Wenlong Huang, Yu Zhou, Hang Yin, Tianwei Bao, Jianwen Lyu, Weiyu Liu, Ruohan Zhang, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ENACT通过视角交互的世界建模评估具身认知,揭示VLMs在长周期交互中与人类表现差距扩大,且模型在逆向任务中表现更优。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20736 2025-11-27 cs.CY cs.AI cs.CL 62%

Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts

大语言模型在社会法律情境中对非法指令的共谋回应

Xing Wang, Huiyuan Xie, Yiyan Wang, Chaojun Xiao, Huimin Chen, Holli Sargeant, Felix Steffek, Jie Shao, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨大语言模型在社会法律情境中对非法指令的共谋回应,揭示其在不同情境下的安全性和易感性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19858 2025-11-27 cs.CL cs.AI 62%

A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Error Detection and Correction

基于RAG动态提示的大型语言模型系统分析:用于医疗错误检测与纠正

Farzad Ahmed, Joniel Augustine Jerome, Meliha Yetisgen, Özlem Uzuner

机构 * George Mason University(乔治·马歇尔大学) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于RAG动态提示的医疗错误检测与纠正方法,通过对比不同提示策略,发现RDP在准确率、召回率和纠错可靠性方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06998 2025-11-27 cs.CV cs.AI cs.LG 62%

Not All Splits Are Equal: Rethinking Attribute Generalization Across Unrelated Categories

并非所有分割都平等:重新思考跨无关类别的属性泛化

Liviu Nicolae Fircă, Antonio Bărbălau, Dan Oneata, Elena Burceanu

机构 * Bitdefender University of Bucharest(布加勒斯特大学) National University of Science and Technology Politehnica Bucharest(布加勒斯特技术科学国家大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究模型在跨无关类别间进行属性泛化的鲁棒性,通过改进的分割策略评估属性预测性能,发现聚类方法在减少相关性的同时保持学习能力,揭示了当前表示的局限性。

Comments Accepted at NeurIPS 2025 Workshop: CauScien - Uncovering Causality in Science and NeurIPS 2025 Workshop: Reliable ML from Unreliable Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI 62%

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19798 2025-11-26 cs.AI cs.HC cs.LG cs.MA 62%

KOM: A Multi-Agent Artificial Intelligence System for Precision Management of Knee Osteoarthritis (KOA)

KOM:一种用于膝骨关节炎(KOA)精准管理的多智能体人工智能系统

Weizhi Liu, Xi Chen, Zekun Jiang, Liang Zhao, Kunyuan Jiang, Ruisi Tang, Li Wang, Mingke You, Hanyu Zhou, Hongyu Chen, Qiankun Xiong, Yong Nie, Kang Li, Jian Li

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 KOM通过多智能体系统实现膝骨关节炎的自动化评估与管理,提升诊疗效率和个性化治疗质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19100 2025-11-25 cs.AI cs.FL cs.LG 62%

Extracting Robust Register Automata from Neural Networks over Data Sequences

从数据序列中的神经网络提取鲁棒的寄存器自动机

Chih-Duo Hong, Hongjian Jiang, Anthony W. Lin, Oliver Markgraf, Julian Parsert, Tony Tan

机构 * National Chengchi University(国立成功大学) University of Kaiserslautern-Landau(凯撒斯劳滕-劳恩堡大学) University of Liverpool(利物浦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种从神经网络中提取鲁棒寄存器自动机的方法,通过结合鲁棒性检查器与自动机学习算法,实现对神经网络的鲁棒性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10727 2025-11-25 cs.CL cs.AI 62%

Word-level Annotation of GDPR Transparency Compliance in Privacy Policies using Large Language Models

基于大型语言模型的GDPR透明性合规性隐私政策词级注释

Thomas Cory, Wolf Rieder, Julia Krämer, Philip Raschke, Patrick Herbke, Axel Küpper

机构 * Erasmus University Rotterdam(埃因霍温大学)

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的隐私政策词级注释方法,用于评估GDPR透明性合规性,通过模块化管道和双层评估提升注释准确性。

Comments Accepted to Proceedings on Privacy Enhancing Technologies (PoPETs) 1 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14268 2025-11-25 cs.CL cs.AI cs.SI 62%

Can Large Language Models Detect Misinformation in Scientific News Reporting?

大型语言模型能否在科学新闻报道中检测虚假信息?

Yupeng Cao, Aishwarya Muralidharan Nair, Nastaran Jamalipour Soofi, Elyon Eyimife, K. P. Subbalakshmi

机构 * Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了使用大型语言模型检测科学新闻中虚假信息的可能性,并提出了SciNews数据集及多种基线架构进行验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17602 2025-11-25 cs.LG cs.AI 62%

Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models

超越表层相似性:面向基础模型合成训练数据的分层污染检测

Sushant Mehta

机构 * Sushant Mehta

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出分层污染检测框架,用于检测基础模型中合成训练数据的语义污染问题,提升评估准确性与数据可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07793 2025-11-25 cs.CL cs.AI 62%

LLM4Cell: A Survey of Large Language and Agentic Models for Single-Cell Biology

LLM4Cell: 一种用于单细胞生物学的大语言和代理模型综述

Sajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Department of Computational Modeling and Data Analytics, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算建模与数据分析系) Institute of Information and Technology, University of Dhaka, Dhaka, Bangladesh(达卡大学信息技术学院) Fralin Biomedical Research Institute at VTC: Cancer Research Center, Washington DC, USA(弗拉林生物医学研究中心:癌症研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LLM4Cell综述了58个用于单细胞生物学的大语言和代理模型,分析了其在注释、轨迹建模和药物反应预测等任务中的表现,并指出了可解释性、标准化和可信模型开发的挑战。

Comments 34 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏