arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2512.01298 2025-12-02 cs.CV 50%

TBT-Former: Learning Temporal Boundary Distributions for Action Localization

TBT-Former:基于时间边界分布的学习用于动作定位

Thisara Rathnayaka, Uthayasanker Thayasivam

机构 * Dept. of Computer Science \& Engineering University of Moratuwa Sri Lanka

专题命中 推理评测 :reasoning(abstract)

AI总结 TBT-Former通过改进的Transformer架构和边界分布回归头,提升动作定位性能,实现THUMOS14和EPIC-Kitchens 100数据集上的新高。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21053 2025-12-02 cs.RO cs.CV 50%

AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios

AerialMind:迈向无人机场景中的指称多目标跟踪

Chenglizhao Chen, Shaofeng Liang, Runwei Guan, Xiaolou Sun, Haocheng Zhao, Haiyun Jiang, Tao Huang, Henghui Ding, Qing-Long Han

专题命中 推理评测 :planning(abstract)

AI总结 AerialMind是首个针对无人机场景的RMOT基准,通过COALA框架和HETrack方法提升无人机的自然语言交互能力与多目标跟踪性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23220 2025-12-01 cs.CV 50%

Instruction Tuning of Large Language Models for Tabular Data Generation-in One Day

针对表格数据生成的大型语言模型指令微调——一天内完成

Milad Abdollahzadeh, Abdul Raheem, Zilong Zhao, Uzair Javaid, Kevin Yee, Nalam Venkata Abhishek, Tram Truong-Huu, Biplab Sikdar

机构 * SIT(新加坡科技学院) NUS(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种在有限资源下通过指令微调提升LLM表格数据生成能力的方法,利用高质量数据集和少量指令实现与GPT-4o相当的生成性能。

Comments Accepted International Conference on Machine Learning (ICML 2025), 1st Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06754 2025-12-01 cs.RO cs.CV 50%

SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation

SlotVLA:迈向机器人操作中物体-关系表示的建模

Taisei Hanyu, Nhat Chung, Huy Le, Toan Nguyen, Yuki Ikebe, Anthony Gunderman, Duy Nguyen Ho Minh, Khoa Vo, Tung Kieu, Kashu Yamazaki, Chase Rainwater, Anh Nguyen, Ngan Le

机构 * University of Arkansas(亚拉巴马大学) FPT Software AI Center(FPT软件人工智能中心) University of Stuttgart(斯图加特大学) Aalborg University(奥尔堡大学) Carnegie Mellon University(卡内基梅隆大学) University of Liverpool(利物浦大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)

专题命中 推理评测 :reasoning(abstract)

AI总结 SlotVLA通过引入LIBERO+数据集和基于槽注意力的框架,实现高效且可解释的机器人操作中物体-关系表示建模。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06224 2025-12-01 cs.CV 50%

TEFormer: Texture-Aware and Edge-Guided Transformer for Semantic Segmentation of Urban Remote Sensing Images

TEFormer:面向城市遥感图像语义分割的纹理感知与边缘引导变换器

Guoyu Zhou, Jing Zhang, Yi Yan, Hui Zhang, Li Zhuo

专题命中 推理评测 :planning(abstract)

AI总结 TEFormer通过纹理感知和边缘引导的变换器提升城市遥感图像语义分割的精度与鲁棒性。

Comments Accepted by IEEE GRSL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22256 2025-12-01 cs.CV 50%

UMind-VL: A Generalist Ultrasound Vision-Language Model for Unified Grounded Perception and Comprehensive Interpretation

UMind-VL:一种通用的超声视觉-语言模型,用于统一的 grounded perception 和全面的 interpretation

Dengbo Chen, Ziwei Zhao, Kexin Zhang, Shishuang Zhao, Junjie Hou, Yaqian Wang, Nianxi Liao, Anlan Sun, Fei Gao, Jia Ding, Yuhang Liu, Dong Wang

机构 * Yizhun Medical AI Team(义诊医疗AI团队)

专题命中 推理评测 :reasoning(abstract)

AI总结 UMind-VL 是一种通用超声视觉-语言模型,通过统一的 grounded perception 和 comprehensive interpretation 实现对医学影像的高效理解和诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20330 2025-12-01 cs.RO cs.CV 50%

ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation

ArtiBench 和 ArtiBrain:可泛化的视觉-语言操纵基准测试

Yuhan Wu, Tiantian Wei, Shuo Wang, ZhiChao Wang, Yanyong Zhang, Daniel Cremers, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 ArtiBench和ArtiBrain通过统一高层推理与自适应低层控制,提升可操纵物体操作的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18842 2025-12-01 cs.CV 50%

Enhancing Descriptive Image Quality Assessment with A Large-scale Multi-modal Dataset

通过大规模多模态数据集增强描述性图像质量评估

Zhiyuan You, Jinjin Gu, Xin Cai, Zheyuan Li, Kaiwen Zhu, Chao Dong, Tianfan Xue

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Sofia University(索菲亚大学) University of Macau(澳门大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出DepictQA-Wild模型,通过构建大规模多模态数据集提升图像质量评估的准确性和实用性。

Comments Accepted by TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21380 2025-11-27 cs.SE 50%

Multi-Agent Systems for Dataset Adaptation in Software Engineering: Capabilities, Limitations, and Future Directions

多智能体系统在软件工程数据集适应中的应用:能力、限制与未来方向

Jingyi Chen, Xiaoyan Guo, Songqiang Chen, Shing-Chi Cheung, Jiasi Shen

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了多智能体系统在软件工程数据集适应中的能力与限制,发现提示干预能显著提升适应效果,为未来更可靠的智能体发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20573 2025-11-26 cs.CV 50%

VQ-VA World: Towards High-Quality Visual Question-Visual Answering

VQ-VA世界:迈向高质量的视觉问题-视觉回答

Chenhui Gou, Zilong Chen, Zeyu Wang, Feng Li, Deyao Zhu, Zicheng Duan, Kunchang Li, Chaorui Deng, Hongyi Yuan, Haoqi Fan, Cihang Xie, Jianfei Cai, Hamid Rezatofighi

专题命中 推理评测 :reasoning(abstract)

AI总结 VQ-VA World通过大规模数据构建框架提升开源模型的视觉问题-视觉回答能力,实现性能超越现有开源基线并接近专有系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19477 2025-11-26 cs.SE 50%

Building Browser Agents: Architecture, Security, and Practical Solutions

构建浏览器代理:架构、安全与实用解决方案

Aram Vardanyan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出通过专用工具和编程约束构建安全浏览器代理,实现85%的成功率。

Comments 30 pages, 22 figures. Production architecture and benchmark evaluation of browser agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19021 2025-11-25 cs.CV 50%

Dynamic Granularity Matters: Rethinking Vision Transformers Beyond Fixed Patch Splitting

动态粒度至关重要:超越固定补丁分割的视觉变换器重新思考

Qiyang Yu, Yu Fang, Tianrui Li, Xuemei Cao, Yan Chen, Jianghao Li, Fan Min

机构 * School of Computer Science and Software Engineering, Southwest Petroleum University(计算机科学与软件工程学院,西南石油大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学) School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(计算与人工智能学院,西南财经大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Grc-ViT,通过动态调整视觉粒度提升细粒度辨别能力,实现更高效的特征学习。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09938 2025-11-25 cs.HC 50%

Design and Evaluation of Generative Agent-based Platform for Human-Assistant Interaction Research: A Tale of 10 User Studies

生成性代理平台的设计与评估:人类-助手交互研究的叙述:10项用户研究

Ziyi Xuan, Yiwen Wu, Xuhai Xu, Vinod Namboodiri, Mooi Choo Chuah, Yu Yang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种生成性代理模拟平台,用于研究人类-助手交互,通过模拟十项现有研究验证了其有效性,为高效研究助手代理设计提供了新方法。

Journal ref Proc. ACM Interact. Mob. Wearable Ubiquitous Technol. 9, 4, Article 229 (December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18448 2025-11-25 cs.CV 50%

EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs

EventBench: 向事件驱动的大语言模型全面评估迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EventBench通过八个任务指标和大规模数据集全面评估事件驱动MLLMs的能力,揭示其在细粒度识别和空间推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18343 2025-11-25 cs.SE 50%

A Needle in a Haystack: Intent-driven Reusable Artifacts Recommendation with LLMs

在 haystack 中寻找针:基于意图的可重用 artifacts 推荐 with LLMs

Dongming Jin, Zhi Jin, Xiaohong Chen, Zheng Fang, Linyu Li, Yuanpeng He, Jia Li, Yirang Zhang, Yingtao Fang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出 TreeRec 框架,通过语义抽象组织 artifacts 成层次结构树,提升 LLMs 在意图驱动推荐中的性能和效率。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV 50%

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02387 2025-11-25 cs.RO cs.SY eess.SY 50%

RGBSQGrasp: Inferring Local Superquadric Primitives from Single RGB Image for Graspability-Aware Bin Picking

RGBSQGrasp: 从单张RGB图像推断局部超二次曲面原语以实现抓取感知的托盘拾取

Yifeng Xu, Fan Zhu, Ye Li, Sebastian Ren, Xiaonan Huang, Yuhao Chen

机构 * University of Michigan(密歇根大学) University of Waterloo(滑铁卢大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 RGBSQGrasp通过单目RGB图像推断抓取姿态,利用超二次曲面原语提升托盘拾取任务的抓取稳定性和适应性。

Comments 8 pages, 6 figures, IROS2025 RGMCW Best Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16853 2025-11-24 cs.CV 50%

Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation

面向地球观测森林生态分析的统一视觉语言模型

Xizhe Xue, Xiao Xiang Zhu

机构 * Xizhe Xue 1, 2 Xiao Xiang Zhu 1, 2

专题命中 推理评测 :reasoning(abstract)

AI总结 REO-Instruct提出首个面向地球观测森林生态分析的统一视觉语言模型基准,旨在解决描述与回归任务中的多模态感知与生物物理变量对齐问题。

Comments AAAI2026 AI for Environmental Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09439 2025-11-24 eess.AS cs.SD 50%

Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?

Omni-R1:你真的需要音频来微调你的音频大语言模型吗?

Andrew Rouditchenko, Saurabhchand Bhati, Edson Araujo, Samuel Thomas, Hilde Kuehne, Rogerio Feris, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Goethe University of Frankfurt(法兰克福歌德大学) IBM Research AI(IBM人工智能研究部) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 Omni-R1通过强化学习方法GRPO微调多模态大语言模型,实现了在音频问答任务上的新SOTA性能,同时发现文本推理能力提升对音频性能有显著贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20470 2025-11-21 cs.CV 50%

Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence

Conan:基于多尺度视觉证据的逐步学习以像侦探一样推理

Kun Ouyang, Yuanxin Liu, Linli Yao, Yishuo Cai, Hao Zhou, Jie Zhou, Fandong Meng, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

专题命中 推理评测 :reasoning(abstract)

AI总结 Conan通过多阶段渐进冷启动策略和AIR RLVR框架,实现证据基础的多步视频推理,超越基线模型,达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24709 2025-11-20 cs.CV 50%

IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video?

Yang Chen, Minghao Liu, Yufan Shen, Yunwen Li, Tianyuan Huang, Xinyu Fang, Tianyu Zheng, Wenxuan Huang, Cheng Yang, Daocheng Fu, Jianbiao Mei, Rong Wu, Yunfei Zhao, Licheng Wen, Xuemeng Yang, Song Mao, Qunshu Lin, Zhi Yu, Yongliang Shen, Yu Qiao, Botian Shi

机构 * IWR-Bench Team(IWR-Bench团队)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14937 2025-11-20 cs.CR 50%

CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent Memory in LLMs

Niloofar Mireshghallah, Neal Mangaokar, Narine Kokhlikyan, Arman Zharmagambetov, Manzil Zaheer, Saeed Mahloujifar, Kamalika Chaudhuri

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00261 2025-11-20 cs.CV cs.HC 50%

Spot The Ball: A Benchmark for Visual Social Inference

Neha Balamurugan, Sarah Wu, Adam Chun, Gabe Gaw, Cristobal Eyzaguirre, Tobias Gerstenberg

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13909 2025-11-19 cs.CV 50%

Mind the Gap: Evaluating LLM Understanding of Human-Taught Road Safety Principles

Chalamalasetti Kranti

机构 * uni-potsdam(波恩大学)

专题命中 推理评测 :reasoning(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23947 2025-11-19 cs.HC 50%

The Social Gaze of LLMs: A Literature Review of Multimodal Approaches to Human Behavior Understanding

Zihan Liu, Parisa Rabbani, Veda Duddu, Kyle Fan, Madison Lee, Yun Huang

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16597 2025-11-19 cs.CV 50%

EventHallusion: Diagnosing Event Hallucinations in Video LLMs

Jiacheng Zhang, Yang Jiao, Shaoxiang Chen, Na Zhao, Zhiyu Tan, Hao Li, Xingjun Ma, Jingjing Chen

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13242 2025-11-18 cs.CV 50%

MMD-Thinker: Adaptive Multi-Dimensional Thinking for Multimodal Misinformation Detection

Junjie Wu, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12363 2025-11-18 cs.CV 50%

Explainable AI-Generated Image Detection RewardBench

Michael Yang, Shijian Deng, William T. Doan, Kai Wang, Tianyu Yang, Harsh Singh, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) University of Notre Dame(诺特大学) Stony Brook University(石溪大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09415 2025-11-18 cs.CV 50%

FaceShield: Explainable Face Anti-Spoofing with Multimodal Large Language Models

Hongyang Wang, Yichen Shi, Zhuofu Tao, Yuhao Gao, Liepiao Zhang, Xun Lin, Jun Feng, Xiaochen Yuan, Zitong Yu, Xiaochun Cao

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by AAAI 2025. Hongyang Wang and Yichen Shi contribute equally. Corresponding author: Zitong Yu

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10810 2025-11-18 cs.CV 50%

SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding

Zhenyu Yang, Yuhang Hu, Zemin Du, Dizhan Xue, Shengsheng Qian, Jiahong Wu, Fan Yang, Weiming Dong, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技) Zhengzhou University(郑州大学) ShanghaiTech University(上海科技大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理评测 :reasoning(abstract)

Comments ICLR 2025 Accepted (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏