arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-03 至 2025-12-03 共收录 79 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 25 篇

2512.02299 2025-12-03 cs.CL cs.AI 62%

HealthContradict: Evaluating Biomedical Knowledge Conflicts in Language Models

HealthContradict: 评估语言模型在生物医学知识中的矛盾

Boya Zhang, Alban Bornet, Rui Yang, Nan Liu, Douglas Teodoro

机构 * Faculty of Medicine, University of Geneva(日内瓦大学医学院) Department of Biomedical Informatics, Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学 Yong Loo Lin 医学院生物医学信息学系) Department of Biostatistics & Bioinformatics, Duke University Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所生物统计学与生物信息学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HealthContradict数据集评估语言模型在处理生物医学知识矛盾时的推理能力,揭示模型在正确上下文利用与错误上下文抵抗方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01282 2025-12-03 cs.CL cs.AI 62%

Kardia-R1: Unleashing LLMs to Reason toward Understanding and Empathy for Emotional Support via Rubric-as-Judge Reinforcement Learning

Kardia-R1: 通过Rubric-as-Judge强化学习释放大语言模型以通过评分标准进行推理,以实现情感支持的理解与共情

Jiahao Yuan, Zhiqing Cui, Hanqing Wang, Yuansheng Gao, Yucheng Zhou, Usman Naseem

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Kardia-R1通过Rubric-as-Judge强化学习框架,提升大语言模型在情感支持中的理解与共情能力,通过评分标准引导训练以实现更准确的情感推理和个性化响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02625 2025-12-03 cs.CR cs.AI 57%

CryptoQA: A Large-scale Question-answering Dataset for AI-assisted Cryptography

CryptoQA: 一个大规模问答数据集,用于人工智能辅助密码学

Mayar Elfares, Pascal Reisert, Tilman Dietz, Manpa Barman, Ahmed Zaki, Ralf Küsters, Andreas Bulling

机构 * University of Stuttgart(斯图加特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CryptoQA是一个大规模问答数据集,旨在评估和训练LLMs在密码学任务中的能力,揭示LLMs在形式推理和数学知识上的不足,推动密码学研究的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26012 2025-12-03 cs.AI 57%

AutoSurvey2: Empowering Researchers with Next Level Automated Literature Surveys

AutoSurvey2:赋能研究人员的下一代自动化文献综述

Siyi Wu, Chiaxin Liang, Ziqian Bi, Leyi Zhao, Tianyang Wang, Junhao Song, Yichao Zhang, Keyu Chen, Benji Peng, Xinyuan Song

机构 * University of Texas at Arlington(德克萨斯理工大学) AI Agent Lab(人工智能代理实验室) Indiana University(印第安纳大学) Ohio State University(俄亥俄州立大学) Imperial College London(伦敦帝国理工学院) Georgia Institute of Technology(佐治亚理工学院) Appcubic(Appcubic公司) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AutoSurvey2通过多阶段流程实现自动化文献综述生成,结合检索增强合成与结构化评估,提升综述的连贯性与相关性,为学术写作提供可扩展解决方案。

Comments TKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11275 2025-12-03 cs.MM cs.AI cs.CY 57%

TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs

TCC-Bench:评估多模态大语言模型对传统中国文化理解能力的基准测试

Pengju Xu, Yan Wang, Shuyuan Zhang, Xuan Zhou, Xin Li, Yue Yuan, Fengzhao Li, Shunyuan Zhou, Xingyu Wang, Yi Zhang, Haiying Zhao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TCC-Bench通过双语视觉问答基准评估多模态大语言模型对传统中国文化理解能力,揭示其在文化相关视觉内容推理上的挑战。

Comments There are issues with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02230 2025-12-03 cs.AI 57%

Benchmarking LLM Agents for Wealth-Management Workflows

对财富管理流程的LLM代理进行基准测试

Rory Milsom

机构 * Rory Milsom(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过构建12个任务对的基准,评估通用LLM代理在财富管理任务中的准确性和经济性,发现其性能受自主性水平和工作流程可靠性影响显著。

Comments 56 pages, 8 figures, The University of Edinburgh

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22154 2025-12-03 cs.AI 57%

WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios

WearVQA: 一个用于评估智能眼镜等可穿戴设备上多模型AI助手视觉问答能力的基准测试

Eun Chang, Zhuangqun Huang, Yiwei Liao, Sagar Ravi Bhavsar, Amogh Param, Tammy Stark, Adel Ahmadyan, Xiao Yang, Jiaqi Wang, Ahsan Abdullah, Giang Nguyen, Akil Iyer, David Hall, Elissa Li, Shane Moon, Nicolas Scheffer, Kirmani Ahmed, Babak Damavandi, Rakesh Wanga, Anuj Kumar, Rohit Patel, Xin Luna Dong

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 WearVQA是一个评估可穿戴设备上多模型AI助手视觉问答能力的基准测试,通过真实场景下的图像-问题-答案三元组,评估其在复杂视觉输入和现实任务中的表现。

Comments 11 pages, 5 figures, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02492 2025-12-03 cs.CV 50%

YingVideo-MV: Music-Driven Multi-Stage Video Generation

YingVideo-MV: 基于音乐的多阶段视频生成

Jiahui Chen, Weida Wang, Runhua Shi, Huan Yang, Chaofan Ding, Zihao Chen

机构 * AI Lab, GiantNetwork(人工智能实验室)

专题命中 推理评测 :planning(abstract)

AI总结 YingVideo-MV通过整合音频语义分析、时间感知扩散模型和摄像机运动控制模块,实现了基于音乐的高质量视频生成。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2512.02246 2025-12-03 cs.CL cs.AI 81%

DETAIL Matters: Measuring the Impact of Prompt Specificity on Reasoning in Large Language Models

DETAIL 重要性:测量提示特定性对大语言模型推理的影响

Olivia Kim

机构 * Emory University(埃默里大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过DETAIL框架研究提示特定性对大语言模型推理性能的影响,发现特定性提升准确性,尤其对小型模型和程序性任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02361 2025-12-03 cs.CV cs.AI 70%

VACoT: Rethinking Visual Data Augmentation with VLMs

VACoT:重新思考视觉数据增强与VLMs

Zhengzhuo Xu, Chong Sun, SiNan Du, Chen Li, Jing Lyu, Chun Yuan

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc(腾讯微信视觉部门)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 VACoT通过在推理过程中动态调用图像增强,提升VLMs在挑战性和分布外输入中的鲁棒性,特别是在OCR对抗场景中,通过高效的智能强化学习减少训练开销并增强感知任务的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00663 2025-12-03 cs.CL cs.AI 62%

Graphing the Truth: Structured Visualizations for Automated Hallucination Detection in LLMs

图示真相:用于自动幻觉检测的结构化可视化

Tanmay Agrawal

机构 * Department of Computer Science, University of Arizona(计算机科学系,亚利桑那大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过结构化可视化技术,帮助自动检测大型语言模型中的幻觉问题,提升模型可靠性和响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03001 2025-12-03 cs.AI 57%

Invasive Context Engineering to Control Large Language Models

侵入式上下文工程以控制大语言模型

Thomas Rivasseau

机构 * McGill University(麦吉尔大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出侵入式上下文工程方法,通过在LLM上下文中插入控制句子以提升其安全性,避免长上下文场景下的数据短缺问题。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02280 2025-12-03 cs.AI cs.CV 57%

Bridging the Gap: Toward Cognitive Autonomy in Artificial Intelligence

弥合差距:迈向人工智能的认知自主性

Noorbakhsh Amiri Golilarz, Sindhuja Penchala, Shahram Rahimi

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了人工智能在自我监控、自我纠正和自主调节方面的能力不足,并提出基于神经认知原理的架构以实现认知自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02337 2025-12-03 cs.LG 57%

SpecPV: Improving Self-Speculative Decoding for Long-Context Generation via Partial Verification

SpecPV:通过部分验证改进长上下文生成的自我推测解码

Zhendong Tan, Xingjun Zhang, Chaoyi Hu, Junjie Peng, Kun Xia

机构 * School of Computer Science and Technology, Xi'an Jiaotong University, Xi'an, China(计算机科学与技术学院,西安交通大学,西安,中国)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 SpecPV通过部分验证和周期性完整验证提升长上下文生成效率,实现6倍解码加速

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02069 2025-12-03 cs.CR cs.AI 57%

Large Language Model based Smart Contract Auditing with LLMBugScanner

基于大型语言模型的智能合约审计与LLMBugScanner

Yining Yuan, Yifei Wang, Yichang Xu, Zachary Yahn, Sihao Hu, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 LLMBugScanner通过结合领域知识适应和集成推理,提升智能合约漏洞检测的鲁棒性和泛化能力,提供了一种高效且可扩展的审计框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02654 2025-12-03 cs.CR 50%

Cybersecurity AI: The World's Top AI Agent for Security Capture-the-Flag (CTF)

网络安全AI:世界顶级AI安全夺旗赛(CTF)

Víctor Mayoral-Vilches, Luis Javier Navarrete-Lozano, Francesco Balassone, María Sanz-Gómez, Cristóbal R. J. Veas Chavez, Maite del Mundo de Torres, Vanesa Turiel

专题命中 其他推理 :reasoning(abstract)

AI总结 2025年,网络安全AI在多个顶级CTF比赛中超越人类队伍,通过高效模型实现安全操作的突破,推动CTF赛事向更具挑战性的攻防格式转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01853 2025-12-03 cs.CV 50%

COACH: Collaborative Agents for Contextual Highlighting -- A Multi-Agent Framework for Sports Video Analysis

COACH:基于上下文高亮的协作代理——一种多代理框架用于体育视频分析

Tsz-To Wong, Ching-Chun Huang, Hong-Han Shuai

专题命中 其他推理 :reasoning(abstract)

AI总结 COACH提出一种多代理框架,通过协作代理实现体育视频分析中的上下文高亮,提升时间层次结构的理解与跨任务适应性。

Comments Accepted by AAAI 2026 Workshop LaMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02329 2025-12-03 cs.SE 50%

Towards autonomous normative multi-agent systems for Human-AI software engineering teams

迈向自主规范的多智能体系统用于人机软件工程团队

Hoa Khanh Dam, Geeta Mahala, Rashina Hoda, Xi Zheng, Cristina Conati

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出自主规范的多智能体系统,通过大型语言模型赋能,实现人机协作的高效软件开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00360 2025-12-03 cs.PL 50%

ChopChop: a Programmable Framework for Semantically Constraining the Output of Language Models

ChopChop: 一种可编程框架,用于对语言模型输出进行语义约束

Shaan Nagy, Timothy Zhou, Nadia Polikarpova, Loris D'Antoni

专题命中 其他推理 :reasoning(abstract)

AI总结 ChopChop是一种可编程框架,通过语义约束提升语言模型输出的正确性和类型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏