arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2510.26699 2026-01-09 cs.SE 50%

Using Copilot Agent Mode to Automate Library Migration: A Quantitative Assessment

使用 Copilot Agent 模式自动化库迁移:一项定量评估

Aylton Almeida, Laerte Xavier, Marco Tulio Valente

专题命中 推理评测 :planning(abstract)

AI总结 本文通过 Copilot Agent 模式评估了 SQLAlchemy 库迁移的自动化效果,发现其在功能迁移上表现良好但应用功能维护不足。

Comments Accepted at 1st International Workshop on Agentic Engineering (AGENT 2026, colocated with ICSE), pages 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03878 2026-01-08 cs.SE 50%

Understanding Specification-Driven Code Generation with LLMs: An Empirical Study Design

通过LLM理解基于规范的代码生成:一项实证研究设计

Giovanni Rosa, David Moreno-Lumbreras, Gregorio Robles, Jesús M. González-Barahona

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过实证研究设计,探讨人类干预在基于规范的LLM代码生成过程中对代码质量和动态的影响。

Comments This paper is a Stage 1 Registered Report. The study protocol and analysis plan were peer reviewed and accepted at SANER 2026 with a Continuity Acceptance (CA) score for Stage 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03640 2026-01-08 cs.SE cs.CR 50%

Verbatim Data Transcription Failures in LLM Code Generation: A State-Tracking Stress Test

LLM代码生成中的verbatim数据转录失败:一种状态跟踪压力测试

Mohd Ariful Haque, Kishor Datta Gupta, Mohammad Ashiqur Rahman, Roy George

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种最小化的基准测试,用于评估LLM在生成代码时对verbatim数据转录的可靠性,通过精确字符串包含和状态跟踪分析来检测长周期生成失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09818 2026-01-08 cs.CV 50%

ViMoNet: A Multimodal Vision-Language Framework for Human Behavior Understanding from Motion and Video

ViMoNet: 一种多模态视觉-语言框架,用于从运动和视频中理解人类行为

Rajan Das Gupta, Lei Wei, Md Yeasin Rahat, Nafiz Fahad, Abir Ahmed, Liew Tze Hui

机构 * Department of Computer Science, American International University–Bangladesh (AIUB)(美国国际大学-孟加拉国计算机科学系) Faculty of Psychology, Shinawatra University(信武大学心理学系) Faculty of Information Science and Technology, Multimedia University(多媒体大学信息科学与技术系) Department of Information Technology, Washington University of Science & Technology(华盛顿科学与技术大学信息科技系)

专题命中 推理评测 :reasoning(abstract)

AI总结 ViMoNet通过整合运动和视频数据,提出多模态视觉-语言框架,有效提升人类行为理解与医疗保健应用潜力。

Comments This is the preprint version of the manuscript. It is currently being prepared for submission to an academic conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06472 2026-01-07 cs.CV cs.MM 50%

CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model

CalliReader:通过嵌入对齐的视觉-语言模型 contextualizing 中文书法

Yuxuan Luo, Jiaqi Tang, Chenyi Huang, Feiyang Hao, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 CalliReader通过字符级切片、视觉-文本对齐和嵌入指令微调,解决中文书法的上下文识别问题,实现比现有方法和专业书法家更高的准确性与更低的幻觉率。

Comments 11 pages

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01505 2026-01-06 cs.CV 50%

Sports-QA: A Large-Scale Video Question Answering Benchmark for Complex and Professional Sports

Sports-QA: 一个大规模视频问答基准,用于复杂和专业的体育

Haopeng Li, Andong Deng, Jun Liu, Hossein Rahmani, Yulan Guo, Bernt Schiele, Mohammed Bennamoun, Qiuhong Ke

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Sports-QA数据集和Auto-Focus Transformer模型,用于复杂专业的体育视频问答任务,实现了最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00777 2026-01-05 cs.SD cs.CV 50%

Investigating the Viability of Employing Multi-modal Large Language Models in the Context of Audio Deepfake Detection

探讨在音频深度伪造检测中使用多模态大语言模型的可行性

Akanksha Chuchra, Shukesh Reddy, Sudeepta Mishra, Abhijit Das, Abhinav Dhall

机构 * Indian Institute of Technology, Ropar, India(印度理工学院罗帕尔分校) Machine Intelligence Group, Birla Institute of Technology and Science, Pilani, Hyderabad Campus, India(比拉理工科学院帕利尼 Hyderabad 分校机器智能小组) Monash University, Melbourne, Australia(墨尔本大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨了多模态大语言模型在音频深度伪造检测中的可行性,通过结合音频输入与多提示方法,展示了模型在域内数据上的良好表现及潜在应用价值。

Comments Accepted at IJCB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00264 2026-01-05 cs.CV 50%

S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding

S1-MMAlign: 一个大规模、跨学科的数据集用于科学图像-文本理解

He Wang, Longteng Guo, Pengkang Huo, Xuanxu Lin, Yichen Yuan, Jie Jiang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 S1-MMAlign是一个大规模跨学科数据集,通过语义增强提升科学图像与文本的对齐质量,推动AI在科学领域的应用。

Comments 12 pages, 5 figures. Dataset available at https://huggingface.co/datasets/ScienceOne-AI/S1-MMAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00002 2026-01-05 cs.DB 50%

From Metadata to Meaning: A Semantic Units Knowledge Graph for the Biodiversity Exploratories

从元数据到意义:一个语义单元知识图谱用于生物多样性探索

Tarek Al Mustafa

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出语义单元以提升用户与知识图谱的互操作性,并展示如何利用大语言模型和嵌入模型构建结构化、FAIR元数据。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21799 2026-01-01 cs.IR 50%

KG20C & KG20C-QA: Scholarly Knowledge Graph Benchmarks for Link Prediction and Question Answering

KG20C & KG20C-QA:面向链接预测和问答的学术知识图谱基准测试

Hung-Nghiep Tran, Atsuhiro Takasu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出KG20C和KG20C-QA两个学术知识图谱基准测试,用于提升基于学术数据的问答和推理能力。

Comments extracted and extended from author's PhD thesis, "Multi-Relational Embedding for Knowledge Graph Representation and Analysis"

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23875 2026-01-01 cs.SE 50%

From Illusion to Insight: Change-Aware File-Level Software Defect Prediction Using Agentic AI

从幻觉到洞察:利用代理AI的变更感知文件级软件缺陷预测

Mohsen Hesamolhokama, Behnam Rohani, Amirahmad Shafiee, MohammadAmin Fazli, Jafar Habibi

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种基于代理AI的变更感知文件级软件缺陷预测方法,通过多代理辩论框架提升缺陷预测的准确性和敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13204 2025-12-30 cs.CV 50%

RefineVAD: Semantic-Guided Feature Recalibration for Weakly Supervised Video Anomaly Detection

RefineVAD: 语义引导的特征重校准用于弱监督视频异常检测

Junhee Lee, ChaeBeen Bang, MyoungChul Kim, MyeongAh Cho

专题命中 推理评测 :reasoning(abstract)

AI总结 RefineVAD通过结合时间动态和语义结构,利用双过程推理提升弱监督视频异常检测的性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05526 2025-12-30 cs.CV 50%

When Deepfake Detection Meets Graph Neural Network:a Unified and Lightweight Learning Framework

当深度伪造检测遇见图神经网络:一种统一且轻量级的学习框架

Haoyu Liu, Chaoyu Gong, Mengke He, Jiate Li, Kai Han, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SSTGNN,一种统一且轻量级的深度伪造检测框架,通过图神经网络联合处理空间、时间及频谱信息,实现高效且准确的伪造检测。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22218 2025-12-30 cs.CV cs.MM 50%

Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark

面向路牌的视觉问答:ViSignVQA数据集、方法与基准

Hieu Minh Nguyen, Tam Le-Thanh Dang, Kiet Van Nguyen

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) Vietnam National University(越南国家大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 ViSignVQA首次提出大规模越南语路牌多模态数据集,结合OCR与预训练语言模型,提升低资源语言VQA性能。

Comments Dataset paper; code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22197 2025-12-30 cs.CV 50%

Quadrant Segmentation VLM with Few-Shot Adaptation and OCT Learning-based Explainability Methods for Diabetic Retinopathy

四象限分割视觉语言模型结合少样本适应与基于OCT学习的可解释方法用于糖尿病视网膜病变

Shivum Telang

机构 * Department of Biostatics(生物统计学系) North Allegheny Senior High School(北阿勒格尼高中) University of Pittsburgh Rangos Research Center(匹兹堡大学Rangos研究中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种基于四象限分割和少样本学习的多模态视觉语言模型,利用OCT和视网膜图像生成可解释性热图,提升糖尿病视网膜病变的诊断效果。

Comments 4 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20933 2025-12-30 cs.SE 50%

Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code

大型语言模型代码设计能力的分层评估

Mootez Saad, Boqi Chen, José Antonio Hernández López, Dániel Varró, Tushar Sharma

专题命中 推理评测 :reasoning(abstract)

AI总结 本文评估了大型语言模型在代码设计能力上的分层表现,发现其在耦合性推理上易受噪声影响,而内聚性分析在受控环境下较稳健,但整体自主推理能力有限。

Comments 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21402 2025-12-29 cs.CV 50%

Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation

理解病毒性:一种基于Rubric的视觉-语言模型框架用于短形式教育娱乐内容评估

Arnav Gupta, Gurekas Singh Sahney, Hardik Rathi, Abhishek Chandwani, Ishaan Gupta, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,比里尼)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于Rubric的视觉-语言模型框架,用于评估短形式教育娱乐视频的病毒性,通过提取音频视觉特征并训练回归评估器,实现可解释且可扩展的参与度预测。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21337 2025-12-25 cs.CV 50%

Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models

超越记忆:一个多模态序回归基准以揭示视觉-语言模型中的流行偏差

Li-Zhong Szu-Tu, Ting-Lin Wu, Chia-Jui Chang, He Syu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出一个多模态序回归基准,揭示视觉-语言模型在流行度上的偏差,通过YearGuessr数据集验证模型在记忆化与未识别对象上的表现差异。

Comments Project page: https://sytwu.github.io/BeyondMemo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20938 2025-12-25 cs.HC 50%

Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies

开创性多模态情感识别在大模型时代的探索:从封闭集到开放词汇

Jing Han, Zhiqiang Gao, Shihao Gao, Jialing Liu, Hongyu Chen, Zixing Zhang, Björn W. Schuller

专题命中 推理评测 :reasoning(abstract)

AI总结 本文首次系统评估了多模态大语言模型在开放词汇情感识别中的表现,发现两阶段三模态融合方法效果最佳,视频模态最为关键,同时揭示开放与封闭源LLM性能差距较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20839 2025-12-25 cs.CV 50%

Input-Adaptive Visual Preprocessing for Efficient Fast Vision-Language Model Inference

面向高效视觉语言模型推理的输入自适应视觉预处理

Putu Indah Githa Cahyani, Komang David Dananjaya Suartana, Novanto Yudistira

机构 * Faculty of Computer Science, University of Brawijaya(计算机科学学院,布拉维亚大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出一种自适应视觉预处理方法,通过动态调整输入分辨率和空间覆盖,显著提升视觉语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20735 2025-12-25 cs.CV 50%

VL4Gaze: Unleashing Vision-Language Models for Gaze Following

VL4Gaze:释放视觉-语言模型用于追随目光

Shijing Wang, Chaoqun Cui, Yaping Huang, Hyung Jin Chang, Yihua Cheng

机构 * Beijing Jiaotong University(北京交通大学) MAIS, Institute of Automation, Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院) University of Birmingham(伯明翰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 VL4Gaze通过四个互补任务统一目光理解为VQA问题,系统评估VLMs在目光解读上的表现,揭示了针对性多任务监督对提升VLMs目光理解能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20013 2025-12-24 cs.CV 50%

SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images

SegEarth-R2: 向远程 sensing 图像的全面语言引导分割迈进

Zepeng Xin, Kaiyu Li, Luodi Chen, Wanchen Li, Yuchen Xiao, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分支)

专题命中 推理评测 :reasoning(abstract)

AI总结 SegEarth-R2通过MLLM架构实现远程 sensing 图像的全面语言引导分割,解决复杂场景下的多目标和隐含意图识别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19990 2025-12-24 cs.CV 50%

A Dual-Branch Local-Global Framework for Cross-Resolution Land Cover Mapping

面向跨分辨率土地覆盖制图的双分支局部-全局框架

Peng Gao, Ke Li, Di Wang, Yongshan Zhu, Yiming Zhang, Xuemei Luo, Yifeng Wang

机构 * Guangzhou Institute of Technology(广州科技研究院) Xidian University(西安电子科技大学) School of Computer Science and Technology(计算机科学与技术学院) University of California(加州大学) Department of Mathematics(数学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 DDTM通过双分支框架解耦局部语义细化与全局上下文推理,提升跨分辨率土地覆盖制图的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12711 2025-12-24 cs.CV 50%

Drifting Away from Truth: GenAI-Driven News Diversity Challenges LVLM-Based Misinformation Detection

远离真相:生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测的挑战

Fanxiao Li, Jiaying Wu, Tingchao Fu, Yunyun Dong, Bingbing Song, Wei Zhou

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测系统造成的挑战,通过DriftBench基准揭示了现有系统在多级漂移下的鲁棒性问题,并指出需要更稳健的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00898 2025-12-23 cs.GR 50%

Empowering LLMs with Structural Role Inference for Zero-Shot Graph Learning

通过结构角色推理增强大语言模型用于零样本图学习

Heng Zhang, Jing Liu, Jiajun Wu, Haochen You, Lubin Gan, Yuling Shi, Xiaodong Gu, Zijian Zhang, Shuai Chen, Wenjun Huang, Jin Huang

专题命中 推理评测 :reasoning(abstract)

AI总结 DuoGLM通过双视角框架实现结构感知的图推理,提升零样本节点分类和跨领域迁移性能

Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18563 2025-12-23 cs.CV 50%

OpenView: Empowering MLLMs with Out-of-view VQA

OpenView: 通过视图外视觉问答增强大规模语言模型

Qixiang Chen, Cheng Zhang, Chi-Wing Fu, Jingwen Ye, Jianfei Cai

机构 * Monash University(墨尔本大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 OpenView通过全景图像生成多选VQA,提升大规模语言模型在视图外视觉问答任务中的性能。

Comments Code: https://github.com/q1xiangchen/OpenView

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15528 2025-12-22 cs.CV 50%

EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration

EmoCaliber: 通过置信度 verbalization 和校准推进可靠的视觉情绪理解

Daiqing Wu, Dongbao Yang, Can Ma, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息研究所) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EmoCaliber通过置信度 verbalization 和校准提升视觉情绪理解的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21540 2025-12-22 cs.HC 50%

Designing an LLM-Based Behavioral Activation Chatbot for Young People with Depression: Insights from an Evaluation with Artificial Users and Clinical Experts

设计一个基于LLM的行为激活聊天机器人以帮助有抑郁症的青少年:基于人工用户和临床专家评估的见解

Florian Onur Kuhlmeier, Leon Hanschmann, Melina Rabe, Stefan Luettke, Eva-Lotta Brakemeier, Alexander Maedche

专题命中 推理评测 :reasoning(abstract)

AI总结 本文设计了一个基于LLM的行为激活聊天机器人,通过人工用户和临床专家评估,验证了其在抑郁症干预中的保真度和安全性,同时指出临床推理能力仍需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17389 2025-12-22 cs.IR 50%

The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability

大语言模型在推荐系统中的心理世界:关联性、个性化与知识性基准测试

Guangneng Hu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出LRWorld基准,评估大语言模型在推荐系统中的关联性、个性化和知识性能力,发现其在浅层相似性任务上表现良好,但在深度个性化嵌入和多模态推理方面仍有不足。

Comments 21 pages, 13 figures, 27 tables, submission to KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07313 2025-12-22 cs.CV 50%

DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding

DocR1: 证据页面引导的GRPO用于多页文档理解

Junyu Xiong, Yonghui Wang, Weichao Zhao, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

专题命中 推理评测 :reasoning(abstract)

AI总结 DocR1通过证据页面引导的GRPO框架,提升多页文档理解能力,实现高质量模型训练与多任务性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏