arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2602.04535 2026-02-05 cs.SD 50%

HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing

HoliAntiSpoof: 面向整体语音反伪装的音频大语言模型

Xuenan Xu, Yiming Ren, Liwei Liu, Wen Wu, Baoxiang Li, Chaochao Lu, Shuai Wang, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 HoliAntiSpoof通过音频大语言模型实现整体语音反伪装分析,通过统一文本生成任务提升检测性能并实现可解释的语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04278 2026-02-05 cs.IR 50%

MiniRec: Data-Efficient Reinforcement Learning for LLM-based Recommendation

MiniRec: 用于基于大语言模型推荐系统的高效强化学习

Lin Wang, Yang Zhang, Jingfan Chen, Xiaoyan Zhao, Fengbin Zhu, Qing Li, Tat-Seng Chua

专题命中 推理评测 :reasoning(abstract)

AI总结 MiniRec通过奖励对齐和轨迹导向的数据选择方法,有效降低基于LLM的推荐系统训练成本,同时保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03056 2026-02-04 cs.IR 50%

ALPBench: A Benchmark for Attribution-level Long-term Personal Behavior Understanding

ALPBench:一种用于属性级长期个人行为理解的基准测试

Lu Ren, Junda She, Xinchen Luo, Tao Wang, Xin Ye, Xu Zhang, Muxuan Wang, Xiao Yang, Chenguang Wang, Fei Xie, Yiwei Zhou, Danjun Wu, Guodong Zhang, Yifei Hu, Guoying Zheng, Shujie Yang, Xingmei Wang, Shiyao Wang, Yukun Zhou, Fan Yang, Size Li, Kuo Cai, Qiang Luo, Ruiming Tang, Han Li, Kun Gai

专题命中 推理评测 :reasoning(abstract)

AI总结 ALPBench是一种用于属性级长期个人行为理解的基准测试,通过预测用户感兴趣的属性组合,实现对个性化推荐的细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02964 2026-02-04 cs.SE 50%

Testing Framework Migration with Large Language Models

利用大语言模型进行测试框架迁移

Altino Alves, João Eduardo Montandon, Andre Hora

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文研究了大语言模型在自动化unittest到Pytest测试框架迁移中的能力,发现其在迁移过程中存在成功与失败并存的情况,且不同模型在迁移策略上表现各异。

Comments Accepted for publication at AST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02457 2026-02-03 cs.CY 50%

MetaCLASS: Metacognitive Coaching for Learning with Adaptive Self-regulation Support

MetaCLASS:基于自适应自我调节支持的元认知辅导

Naiming Liu, Richard Baraniuk, Shashank Sonkar

专题命中 推理评测 :planning(abstract)

AI总结 MetaCLASS通过元认知辅导框架提升学习者自我调节能力,验证了传统教学模型在元认知任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01067 2026-02-03 cs.RO 50%

A Systematic Study of Data Modalities and Strategies for Co-training Large Behavior Models for Robot Manipulation

对大型行为模型在机器人操作中协同训练数据模态和策略的系统研究

Fanqi Lin, Kushal Arora, Jean Mercat, Haruki Nishimura, Paarth Shah, Chen Xu, Mengchao Zhang, Mark Zolotas, Maya Angeles, Owen Pfannenstiehl, Andrew Beaulieu, Jose Barreiros

机构 * Toyota Research Institute, Cambridge MA(丰田研究院) Tsinghua University, Beijing, China(清华大学)

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文研究了机器人操作中协同训练不同数据模态和策略对行为模型性能的影响,发现视觉语言和跨身体数据显著提升泛化能力,而离散动作令牌无明显优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00757 2026-02-03 cs.SE 50%

ScratchEval : A Multimodal Evaluation Framework for LLMs in Block-Based Programming

ScratchEval:一种用于块式编程中LLM的多模态评估框架

Yuan Si, Simeng Han, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 ScratchEval是首个用于评估LLM在Scratch块式编程中修复能力的可执行基准,通过多层协议测量功能正确性、修复质量和解释质量,支持领域微调和泛化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11708 2026-02-03 cs.SE 50%

From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation

从评估到增强:大型语言模型在零知识证明代码生成中的应用

Zhantong Xue, Pingchuan Ma, Zhaoyu Wang, Yuguang Zhou, Xiaoqin Zhang, Shuai Wang, Juergen Rahmel

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出ZK-Eval和ZK-Coder,通过评估和增强大型语言模型在零知识证明代码生成中的能力,显著提高了ZK程序的生成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07486 2026-02-03 cs.SE 50%

DISTINCT: A Description-Guided Branch-Consistency Analysis Framework for Non-Regressive Test Case Generation

DISTINCT: 一种基于描述的分支一致性分析框架用于非回归测试用例生成

Pengyu Xue, Yuxiang Zhang, Zhen Yang, Xiaoxue Ren, Xiang Li, Pengfei Hu, Linhao Wu, Kainan Li

专题命中 推理评测 :reasoning(abstract)

AI总结 DISTINCT通过基于描述的分支一致性分析框架,提升非回归测试生成的缺陷检测能力,实现更高的编译成功率和缺陷检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22483 2026-02-02 cs.CV 50%

Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage

头感知视觉裁剪:通过注意力引导的子图像增强细粒度VQA

Junfei Xie, Peng Pan, Xulong Zhang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 通过注意力引导的子图像增强细粒度VQA,提出无需训练的HAVC方法,利用优化的注意力头提升视觉定位精度。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22218 2026-02-02 cs.CV cs.DL 50%

What Lies Beneath: A Call for Distribution-based Visual Question & Answer Datasets

表下之物:对基于分布的视觉问答数据集的呼吁

Jill P. Naiman, Daniel J. Evans, JooYoung Seo

机构 * Information Science(信息科学) University of Illinois(伊利诺伊大学) Urbana-Champaign(厄巴纳-香槟) Illinois, USA(伊利诺伊斯州,美国)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文呼吁建立专门针对科学图表的VQA基准,通过生成合成图表并要求模型基于底层数据回答问题,以解决现有数据集未能捕捉的图表与数据间关系的推理挑战。

Comments Accepted to ACM/IEEE Joint Conference on Digital Libraries JCDL 2025, 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21268 2026-01-30 cs.NE 50%

Reinforcement Learning from Meta-Evaluation: Aligning Language Models Without Ground-Truth Labels

基于元评估的强化学习:无需真实标签对齐语言模型

Micah Rentschler, Jesse Roberts

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出RLME方法,通过元评估生成奖励,实现无需真实标签的LLM训练,提升准确性和样本效率,支持多目标权衡与可靠推理模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20879 2026-01-30 cs.SE 50%

A Survey on Large Language Model Impact on Software Evolvability and Maintainability: the Good, the Bad, the Ugly, and the Remedy

对大型语言模型对软件可变性与可维护性影响的综述:好坏优劣及解决方法

Bruno Claudino Matias, Savio Freire, Juliana Freitas, Felipe Fronchetti, Kostadin Damevski, Rodrigo Spinola

专题命中 推理评测 :reasoning(abstract)

AI总结 本文综述了大型语言模型对软件可变性与可维护性的影响,分析了其带来的积极影响、潜在风险及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20354 2026-01-30 cs.CV 50%

Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models

万物皆有其位:文本到图像模型空间智能基准测试

Zengbin Wang, Xuecai Hu, Yong Wang, Feng Xiong, Man Zhang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(AMAP、阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SpatialGenEval基准测试,通过信息密集的提示评估文本到图像模型的空间智能,揭示高阶空间推理的瓶颈,并构建SpatialT2I数据集提升模型性能。

Comments Accepted by ICLR 2026, URL: https://github.com/AMAP-ML/SpatialGenEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20623 2026-01-29 cs.IR 50%

When Vision Meets Texts in Listwise Reranking

当视觉与文本在列表级重排序中相遇

Hongyi Cai

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Rank-Nexus,一种轻量级多模态图像-文本文档重排序器,通过渐进跨模态训练策略提升重排序性能,适用于文本和图像重排序基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20196 2026-01-29 cs.CV 50%

Automated Marine Biofouling Assessment: Benchmarking Computer Vision and Multimodal LLMs on the Level of Fouling Scale

自动化海洋生物污损评估:基于生物污损等级的计算机视觉与多模态LLM对比分析

Brayden Hamilton, Tim Cashmore, Peter Driscoll, Trevor Gee, Henry Williams

机构 * Centre for Automation and Robotic Engineering Science(自动化与机器人工程科学中心) The University of Auckland(奥克兰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过对比计算机视觉与多模态LLM在生物污损等级评估中的表现,提出混合方法以实现可扩展且可解释的自动化评估。

Comments Australasian Conference on Robotics and Automation, ACRA2025 13 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19239 2026-01-28 cs.SE 50%

LLM-based Vulnerability Detection at Project Scale: An Empirical Study

基于大语言模型的项目级漏洞检测:一项实证研究

Fengjie Li, Jiajun Jiang, Dongchi Chen, Yingfei Xiong

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了基于LLM的项目级漏洞检测方法,发现其在召回率低的情况下仍能发现更多漏洞,但存在高误报率和计算成本问题。

Comments 19 pages, 13 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19134 2026-01-28 cs.CR cs.SE 50%

Evaluating Nova 2.0 Lite model under Amazon's Frontier Model Safety Framework

在亚马逊前沿模型安全框架下评估Nova 2.0 Lite模型

Satyapriya Krishna, Matteo Memelli, Tong Wang, Abhinav Mohanty, Claire O'Brien Rajkumar, Payal Motwani, Rahul Gupta, Spyros Matsoukas

专题命中 推理评测 :reasoning(abstract)

AI总结 本文在亚马逊前沿模型安全框架下评估了Nova 2.0 Lite模型,分析其在高风险领域的安全性和性能表现。

Comments Arxiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18493 2026-01-27 cs.CV 50%

DisasterInsight: A Multimodal Benchmark for Function-Aware and Grounded Disaster Assessment

DisasterInsight: 一种多模态基准,用于功能感知和基于事实的灾害评估

Sara Tehrani, Yonghao Xu, Leif Haglund, Amanda Berg, Michael Felsberg

机构 * Computer Vision Laboratory, Linköping University, Sweden(林奈大学计算机视觉实验室) Vantor, Linköping, Sweden(林奈瑞典)

专题命中 推理评测 :reasoning(abstract)

AI总结 DisasterInsight提出一种多模态基准,用于评估视觉-语言模型在灾害分析任务中的性能,通过DI-Chat模型在损害识别和报告生成方面取得显著提升。

Comments Under review at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06835 2026-01-27 cs.CV 50%

X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding

X-LeBench:一个用于极长第一人称视频理解的基准数据集

Wenqi Zhou, Kai Cao, Hao Zheng, Yunze Liu, Xinyi Zheng, Miao Liu, Per Ola Kristensson, Walterio Mayol-Cuevas, Fan Zhang, Weizhe Lin, Junxiao Shen

机构 * University of Bristol(布里斯托大学) University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) College of AI, Tsinghua University(清华大学人工智能学院) Meta Memories.ai Research(Memories.ai研究)

专题命中 推理评测 :reasoning(abstract)

AI总结 X-LeBench通过模拟真实日常生活场景,构建了首个极长第一人称视频理解基准数据集,揭示了长视频理解中的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17614 2026-01-27 cs.HC 50%

AlignUI: A Method for Designing LLM-Generated UIs Aligned with User Preferences

AlignUI: 一种用于设计与用户偏好一致的LLM生成UI的方法

Yimeng Liu, Misha Sra, Chang Xiao

专题命中 推理评测 :reasoning(abstract)

AI总结 AlignUI通过用户偏好数据集引导LLM生成与用户任务和偏好一致的UI,提升UI设计与用户需求的匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17405 2026-01-27 cs.CV 50%

HAAF: Hierarchical Adaptation and Alignment of Foundation Models for Few-Shot Pathology Anomaly Detection

HAAF: 用于少样本病理异常检测的层次适应与对齐框架

Chunze Yang, Wenjie Zhao, Yue Tang, Junbo Lu, Jiusong Ge, Qidong Liu, Zeyu Gao, Chen Li

机构 * Sch Comp Sci \& Technol, Xi'an Jiaotong University Xi'an China University of Cambridge Cambridge United Kingdom Sch Comp Sci \& Technol, Xi'an Jiaotong University University of Cambridge

专题命中 推理评测 :reasoning(abstract)

AI总结 HAAF通过层次适应与对齐框架,解决少样本病理异常检测中的粒度不匹配问题,提升模型在低资源场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12148 2026-01-27 cs.SE 50%

Many Hands Make Light Work: An LLM-based Multi-Agent System for Detecting Malicious PyPI Packages

众手成炬:基于LLM的多智能体系统用于检测恶意PyPI包

Muhammad Umar Zeshan, Motunrayo Ibiyo, Claudio Di Sipio, Phuong T. Nguyen, Davide Di Ruscio

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出LAMPS,一种基于LLM的多智能体系统,通过协作检测恶意PyPI包,实现高准确率和显著的性能提升。

Comments The paper has been peer-reviewed and accepted for publication to the Journal of Systems and Software (https://www.sciencedirect.com/journal/journal-of-systems-and-software)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16930 2026-01-26 cs.CY 50%

In Quest of an Extensible Multi-Level Harm Taxonomy for Adversarial AI: Heart of Security, Ethical Risk Scoring and Resilience Analytics

寻求可扩展的多级危害分类法以应对对抗性AI:安全的核心、道德风险评分与韧性分析

Javed I. Khan, Sharmila Rahman Prithula

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种可扩展的多级危害分类法,结合伦理理论,系统化地定义危害类型,以提升对抗性AI的安全性和伦理分析能力。

Comments Manuscript accepted for presentation at the 12th International Conference on Computational Science and Computational Intelligence (CSCI 2025), Las Vegas, NV, USA, December 2025. Proceedings to be published by Springer Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16699 2026-01-26 cs.SE 50%

Supporting Stakeholder Requirements Expression with LLM Revisions: An Empirical Evaluation

通过LLM修订支持利益相关者需求表达:一项实证评估

Michael Mircea, Emre Gevrek, Elisa Schmid, Kurt Schneider

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过实证研究展示LLM在辅助利益相关者表达需求方面的有效性,证明其能提升需求表达的完整性、清晰度和一致性。

Comments This paper has been accepted at the research track of the 32nd International Working Conference on Requirements Engineering: Foundation for Software Quality (REFSQ 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19469 2026-01-26 cs.SD cs.MM 50%

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

MusiCRS:面向音频导向的对话推荐基准测试

Rohan Surana, Amit Namburi, Gagan Mundada, Abhay Lal, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego, USA(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 MusiCRS通过链接Reddit用户对话与音乐曲目,为音频导向的对话推荐提供首个基准测试,揭示了跨模态整合的局限性,并释放了相关数据集和代码以促进研究进展。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11932 2026-01-22 cs.CV 50%

Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs

Hyperphantasia: 一个多模态大语言模型心理可视化能力评估基准

Mohammad Shahab Sepehri, Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 推理评测 :reasoning(abstract)

AI总结 Hyperphantasia是一个评估多模态大语言模型心理可视化能力的合成基准,通过四个精心设计的谜题揭示了人类与当前模型之间的性能差距,并探索了强化学习在提升视觉模拟能力上的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13933 2026-01-21 cs.SE 50%

VulnResolver: A Hybrid Agent Framework for LLM-Based Automated Vulnerability Issue Resolution

VulnResolver: 一种基于大语言模型的混合代理框架用于LLM驱动的自动漏洞问题解决

Mingming Zhang, Xu Wang, Jian Zhang, Xiangxin Meng, Jiayi Zhang, Chunming Hu

专题命中 推理评测 :reasoning(abstract)

AI总结 VulnResolver是一种基于大语言模型的混合代理框架,通过上下文预收集和安全属性分析代理,实现自动化漏洞问题的高效解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13702 2026-01-21 cs.NI 50%

IGAA: Intent-Driven General Agentic AI for Edge Services Scheduling using Generative Meta Learning

IGAA: 基于生成元学习的意图驱动通用代理AI用于边缘服务调度

Yan Sun, Yinqiu Liu, Shaoyong Guo, Ruichen Zhang, Feng Qi, Xuesong Qiu, Weifeng Gong, Dusit Niyato, Qihui Wu

专题命中 推理评测 :reasoning(abstract)

AI总结 IGAA通过生成元学习和意图驱动机制,提升边缘服务调度的泛化能力与适应性,有效应对动态服务需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13682 2026-01-21 cs.SE cs.PL 50%

CodeContests-O: Powering LLMs via Feedback-Driven Iterative Test Case Generation

CodeContests-O: 通过反馈驱动的迭代测试用例生成增强大语言模型

Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Kangwen Zhao, Dongyun Xue, Mingxiao Feng, Wengang Zhou, Houqiang Li

专题命中 推理评测 :reasoning(abstract)

AI总结 通过反馈驱动的迭代测试用例生成框架,提升大语言模型的验证质量,构建高质量的CodeContests-O数据集,显著提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏