arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-25 至 2025-11-25 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 32 篇

2511.15065 2025-11-25 cs.CV cs.AI 83%

Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks

通过视频推理:首次评估视频模型在迷宫解决任务中的推理能力

Cheng Yang, Haiyuan Wan, Yiran Peng, Xin Cheng, Zhaoyang Yu, Jiayi Zhang, Junchi Yu, Xinlei Yu, Xiawu Zheng, Dongzhan Zhou, Chenglin Wu

机构 * DeepWisdom Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文首次评估视频模型在迷宫解决任务中的推理能力,提出VR-Bench基准,展示视频生成在空间推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13837 2025-11-25 cs.AI cs.CL cs.CV 81%

Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

强化学习真的能激励大语言模型在基础模型之外提升推理能力吗?

Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Yang Yue, Shiji Song, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学 LeapLab) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现RLVR方法未有效激发LLMs的新型推理能力,而蒸馏方法能更有效地扩展模型推理能力。

Comments 31 pages, 27 figures

Journal ref NeurIPS 2025 Oral; ICML 2025 AI4MATH workshop best paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19005 2025-11-25 cs.AI 79%

Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding

引入视觉场景和推理:一个更现实的口语语言理解基准

Di Wu, Liting Jiang, Ruiyu Fang, Bianjing, Hongyan Xie, Haoxiang Su, Hao Huang, Zhongjiang He, Shuangyong Song, Xuelong Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VRSLU数据集,通过引入视觉信息和显式推理提升口语语言理解的现实应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17775 2025-11-25 cs.CL 79%

FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks

FoREST: 空间推理任务中的参考框架评估

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 FoREST基准通过空间引导提示法提升LLMs在空间推理任务中的参考框架理解能力。

Comments 10 pages, 3 Figures, 4 Tables, EMNLP-2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11025 2025-11-25 cs.CV cs.AI 79%

AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning

AirCopBench: 多无人机协作具身感知与推理的基准测试

Jirong Zha, Yuxuan Fan, Tianyu Zhang, Geng Chen, Yingfeng Chen, Chen Gao, Xinlei Chen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AirCopBench是一个针对多无人机协作具身感知与推理的首个全面基准测试,通过模拟与现实数据生成14600+问题,评估MLLMs在复杂协作场景中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07852 2025-11-25 cs.AI 79%

FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning

FinMR:面向高级金融推理的知识密集型多模态基准

Shuangyan Deng, Haizhou Peng, Jiachen Xu, Rui Mao, Ciprian Doru Giurcăneanu, Jiamou Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 FinMR是一个面向高级金融推理的知识密集型多模态基准,通过精心设计的问题-答案对和多样化的金融主题,评估专业分析师级别的金融推理能力。

Comments The methodology section contains inaccuracies that may lead to misleading interpretations. The authors have withdrawn this version for correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18572 2025-11-25 cs.CV cs.LG 79%

GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model

GeoReasoner: 基于大规模视觉-语言模型的街景地理定位

Ling Li, Yu Ye, Yao Zhou, Bingchuan Jiang, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tongji University(同济大学) Independent Researcher(独立研究者) Information Engineering University(信息工程大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 GeoReasoner通过整合外部知识和改进的微调方法,提升了街景地理定位的性能,优于现有模型并节省训练资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18437 2025-11-25 cs.CV 78%

Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning

基于感知证据的强化学习用于多模态推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Zhixiong Zeng, Siqi Yang, Peng Shi, Lin Ma, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Meituan Inc(美团公司) The University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 PEARL通过将推理锚定在验证的视觉证据上,提升多模态推理能力,有效解决视觉幻觉和奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17755 2025-11-25 cs.CV 78%

CORA: Consistency-Guided Semi-Supervised Framework for Reasoning Segmentation

CORA: 一致性引导的半监督框架用于推理分割

Prantik Howlader, Hoang Nguyen-Canh, Srijan Das, Jingyi Xu, Hieu Le, Dimitris Samaras

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 CORA通过一致性引导的半监督方法实现高效推理分割,在Cityscapes和PanNuke数据集上分别提升2.3%和2.4%

Comments WACV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17584 2025-11-25 cs.LG cs.AI 76%

LLM-Powered Text-Attributed Graph Anomaly Detection via Retrieval-Augmented Reasoning

通过检索增强推理的大型语言模型驱动的文本属性图异常检测

Haoyan Xu, Ruizhi Qian, Zhengtao Yao, Ziyi Liu, Li Li, Yuqi Li, Yanshu Li, Wenqing Zheng, Daniele Rosa, Daniel Barcklow, Senthil Kumar, Jieyu Zhao, Yue Zhao

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出基于检索增强推理的LLM驱动文本属性图异常检测框架,通过生成语义连贯但上下文不一致的异常节点,提升异常检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18177 2025-11-25 cs.CL 74%

Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector Reasoning Systems in the Financial Domain for Large Language Models

重新思考检索:从传统检索增强生成到金融领域大语言模型中的代理和非向量推理系统

Elias Lumer, Matt Melich, Olivia Zino, Elena Kim, Sara Dieter, Pradeep Honaganahalli Basavaraju, Vamse Kumar Subbiah, James A. Burke, Roberto Hernandez

机构 * PricewaterhouseCoopers U.S.(普华永道美国公司)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出基于向量的代理RAG方法,在金融问答中优于非向量方法,通过交叉编码器重排序和小到大块检索显著提升检索精度和回答质量,但需权衡成本性能。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09711 2025-11-25 cs.CL cs.AI 73%

PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry

PsychiatryBench: 一个面向心理治疗的多任务基准测试

Aya E. Fouda, Abdelrahamn A. Hassan, Radwa J. Hanafy, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 PsychiatryBench通过权威教科书和病例书构建多任务基准,评估LLMs在心理治疗中的临床一致性与安全性,揭示模型在多轮随访等任务中的不足,推动专门调优和更严谨的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18298 2025-11-25 cs.AI 70%

Cross-Disciplinary Knowledge Retrieval and Synthesis: A Compound AI Architecture for Scientific Discovery

跨学科知识检索与综合:一种用于科学发现的复合AI架构

Svitlana Volkova, Peter Bautista, Avinash Hiriyanna, Gabriel Ganberg, Isabel Erickson, Zachary Klinefelter, Nick Abele, Hsien-Te Kao, Grant Engberson

机构 * Aptima, Inc.(Aptima公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 BioSage通过整合LLMs与RAG,利用专门代理实现跨学科知识检索与综合,提升科学发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20495 2025-11-25 cs.CL cs.AI cs.IR cs.LG cs.SE 67%

ReCode: Updating Code API Knowledge with Reinforcement Learning

ReCode: 通过强化学习更新代码API知识

Haoze Wu, Yunzhi Yao, Wenhao Yu, Ningyu Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReCode通过强化学习方法提升LLMs在动态API环境下的代码生成能力,尤其在CodeUpdateArena任务中表现优异。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19100 2025-11-25 cs.AI cs.FL cs.LG 62%

Extracting Robust Register Automata from Neural Networks over Data Sequences

从数据序列中的神经网络提取鲁棒的寄存器自动机

Chih-Duo Hong, Hongjian Jiang, Anthony W. Lin, Oliver Markgraf, Julian Parsert, Tony Tan

机构 * National Chengchi University(国立成功大学) University of Kaiserslautern-Landau(凯撒斯劳滕-劳恩堡大学) University of Liverpool(利物浦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种从神经网络中提取鲁棒寄存器自动机的方法,通过结合鲁棒性检查器与自动机学习算法,实现对神经网络的鲁棒性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10727 2025-11-25 cs.CL cs.AI 62%

Word-level Annotation of GDPR Transparency Compliance in Privacy Policies using Large Language Models

基于大型语言模型的GDPR透明性合规性隐私政策词级注释

Thomas Cory, Wolf Rieder, Julia Krämer, Philip Raschke, Patrick Herbke, Axel Küpper

机构 * Erasmus University Rotterdam(埃因霍温大学)

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的隐私政策词级注释方法,用于评估GDPR透明性合规性,通过模块化管道和双层评估提升注释准确性。

Comments Accepted to Proceedings on Privacy Enhancing Technologies (PoPETs) 1 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14268 2025-11-25 cs.CL cs.AI cs.SI 62%

Can Large Language Models Detect Misinformation in Scientific News Reporting?

大型语言模型能否在科学新闻报道中检测虚假信息?

Yupeng Cao, Aishwarya Muralidharan Nair, Nastaran Jamalipour Soofi, Elyon Eyimife, K. P. Subbalakshmi

机构 * Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了使用大型语言模型检测科学新闻中虚假信息的可能性,并提出了SciNews数据集及多种基线架构进行验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17602 2025-11-25 cs.LG cs.AI 62%

Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models

超越表层相似性:面向基础模型合成训练数据的分层污染检测

Sushant Mehta

机构 * Sushant Mehta

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出分层污染检测框架,用于检测基础模型中合成训练数据的语义污染问题,提升评估准确性与数据可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07793 2025-11-25 cs.CL cs.AI 62%

LLM4Cell: A Survey of Large Language and Agentic Models for Single-Cell Biology

LLM4Cell: 一种用于单细胞生物学的大语言和代理模型综述

Sajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Department of Computational Modeling and Data Analytics, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算建模与数据分析系) Institute of Information and Technology, University of Dhaka, Dhaka, Bangladesh(达卡大学信息技术学院) Fralin Biomedical Research Institute at VTC: Cancer Research Center, Washington DC, USA(弗拉林生物医学研究中心:癌症研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LLM4Cell综述了58个用于单细胞生物学的大语言和代理模型,分析了其在注释、轨迹建模和药物反应预测等任务中的表现,并指出了可解释性、标准化和可信模型开发的挑战。

Comments 34 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19492 2025-11-25 cs.CL cs.AI 62%

MedHalu: Hallucinations in Responses to Healthcare Queries by Large Language Models

MedHalu:大型语言模型在医疗查询中生成幻觉的研究

Vibhor Agarwal, Yiqiao Jin, Mohit Chandra, Munmun De Choudhury, Srijan Kumar, Nishanth Sastry

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MedHalu研究了LLM在医疗查询中生成幻觉的问题,提出MedHalu基准和MedHaluDetect框架,发现LLM在检测医学幻觉方面表现不佳,提出专家在环方法提升检测效果。

Comments Accepted at ICWSM2026. https://netsys.surrey.ac.uk/datasets/medhalu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19427 2025-11-25 cs.SE cs.AI 57%

Prompt Less, Smile More: MTP with Semantic Engineering in Lieu of Prompt Engineering

无需提示,微笑更多:通过语义工程替代提示工程的MTP

Jayanaka L. Dantanarayana, Savini Kashmira, Thakee Nathees, Zichen Zhang, Krisztian Flautner, Lingjia Tang, Jason Mars

机构 * University of Michigan(密歇根大学) Jaseci Labs(Jaseci实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 通过语义工程替代提示工程,提升AI集成编程中提示的准确性与开发者效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18854 2025-11-25 cs.SE cs.AI 57%

Time Travel: LLM-Assisted Semantic Behavior Localization with Git Bisect

时间旅行:借助Git Bisect的LLM辅助语义行为定位

Yujing Wang, Weize Hong

机构 * University of Waterloo(滑铁卢大学) Brock University(布罗克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用LLM和Git Bisect进行语义行为定位,通过结构化推理链提升故障定位准确率,实验显示成功率提升6.4个百分点,平均bisect时间减少2倍。

Comments submitted to Git Bisect SCALCOM 2025 Calgary (to be published)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01285 2025-11-25 cs.AI cs.IR stat.AP 57%

BioDisco: Multi-agent hypothesis generation with dual-mode evidence, iterative feedback and temporal evaluation

BioDisco:基于双模式证据、迭代反馈和时间评估的多智能体假设生成

Yujing Ke, Kevin George, Kathan Pandya, David Blumenthal, Maximilian Sprang, Gerrit Großmann, Sebastian Vollmer, David Antony Selby

机构 * Data Science and its Applications, DFKI(数据科学及其应用,德系人工智能研究所) DFKI Friedrich-Alexander-Universität Erlangen-Nürnberg(德系人工智能研究所,弗赖堡-埃朗根-纽伦堡大学) University of Saarland(萨尔大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(弗赖堡-埃朗根-纽伦堡大学) University of Kaiserslautern–Landau (RPTU)(凯撒斯劳滕-兰道大学(RPTU)) Department of Dermatology, University Medical Center Mainz(梅奥医学中心法兰克福大学皮肤科)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BioDisco通过双模式证据系统、迭代反馈和时间评估,实现多智能体生成新颖且证据支持的科学假设。

Comments 12 pages main content, 31 including appendices. 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18436 2025-11-25 cs.CL 57%

Can Code-Switched Texts Activate a Knowledge Switch in LLMs? A Case Study on English-Korean Code-Switching

代码切换文本能否在LLMs中激活知识切换?一种英语-韩语代码切换案例研究

Seoyeon Kim, Huiseo Kim, Chanjun Park, Jinyoung Yeo, Dongha Lee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过EnKoQA数据集探讨代码切换是否能激活LLMs中的知识,发现其在低资源语言任务中具有潜力。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18486 2025-11-25 cs.CL 57%

Evaluation of OpenAI o1: Opportunities and Challenges of AGI

OpenAI o1的评估:通用人工智能的机会与挑战

Tianyang Zhong, Zhengliang Liu, Yi Pan, Yutong Zhang, Zeyu Zhang, Yifan Zhou, Shizhe Liang, Zihao Wu, Yanjun Lyu, Peng Shu, Xiaowei Yu, Chao Cao, Hanqi Jiang, Hanxu Chen, Yiwei Li, Junhao Chen, Huawen Hu, Yiheng Liu, Huaqin Zhao, Shaochen Xu, Haixing Dai, Lin Zhao, Ruidong Zhang, Wei Zhao, Zhenyuan Yang, Jingyuan Chen, Peilong Wang, Wei Ruan, Hui Wang, Huan Zhao, Jing Zhang, Yiming Ren, Shihuan Qin, Tong Chen, Jiaxi Li, Arif Hassan Zidan, Afrar Jahin, Minheng Chen, Sichen Xia, Jason Holmes, Yan Zhuang, Jiaqi Wang, Bochen Xu, Weiran Xia, Jichao Yu, Kaibo Tang, Yaxuan Yang, Bolun Sun, Tao Yang, Guoyu Lu, Xianqiao Wang, Lilong Chai, He Li, Jin Lu, Xin Zhang, Bao Ge, Xintao Hu, Lian Zhang, Hua Zhou, Lu Zhang, Shu Zhang, Zhen Xiang, Yudan Ren, Jun Liu, Xi Jiang, Yu Bao, Wei Zhang, Xiang Li, Gang Li, Wei Liu, Dinggang Shen, Andrea Sikora, Xiaoming Zhai, Dajiang Zhu, Tuo Zhang, Tianming Liu

机构 * Department of Mathematical and Statistical Sciences, University of Alberta, Edmonton, Canada(阿尔伯塔大学数学与统计学系) School of Computing, University of Georgia, GA, USA(佐治亚大学计算机科学学院) Institute of Medical Research, Northwestern Polytechnical University, Xi’an, China(西北工业大学医学研究所) Department of Computer Science and Engineering, University of Texas at Arlington, TX, USA(德克萨斯大学阿灵顿分校计算机科学与工程系) College of Arts and Sciences, University of Georgia, Athens, USA(佐治亚大学文理学院) Institute of Plant Breeding, Genetics & Genomics, University of Georgia, Athens, GA, USA(佐治亚大学植物育种、遗传与基因组研究所) School of Computer Science, Northwestern Polytechnical University, Xi’an, China(西北工业大学计算机科学学院) School of Automation, Northwestern Polytechnical University, Xi’an, China(西北工业大学自动化学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 OpenAI o1在多领域复杂推理任务中表现出色,展现出接近或超越人类水平的能力,为通用人工智能的发展提供了重要进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17624 2025-11-25 cs.LG 57%

QML-HCS: A Hypercausal Quantum Machine Learning Framework for Non-Stationary Environments

QML-HCS:一种用于非平稳环境的超因果量子机器学习框架

Hector E Mozo

机构 * NeureonMindFlux Research Lab(NeureonMindFlux研究实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 QML-HCS通过超因果反馈动态和混合执行机制,为非平稳环境中的量子启发式机器学习提供适应性框架。

Comments 11 pages, 10 figures, and 8 tables. The implementation and full source code of the Hypercausal Quantum Machine Learning System (QML-HCS) are openly available on GitHub at: https://github.com/Neureonmindflux-Research-Lab/qml-hcs

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19021 2025-11-25 cs.CV 50%

Dynamic Granularity Matters: Rethinking Vision Transformers Beyond Fixed Patch Splitting

动态粒度至关重要:超越固定补丁分割的视觉变换器重新思考

Qiyang Yu, Yu Fang, Tianrui Li, Xuemei Cao, Yan Chen, Jianghao Li, Fan Min

机构 * School of Computer Science and Software Engineering, Southwest Petroleum University(计算机科学与软件工程学院,西南石油大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学) School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(计算与人工智能学院,西南财经大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Grc-ViT,通过动态调整视觉粒度提升细粒度辨别能力,实现更高效的特征学习。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09938 2025-11-25 cs.HC 50%

Design and Evaluation of Generative Agent-based Platform for Human-Assistant Interaction Research: A Tale of 10 User Studies

生成性代理平台的设计与评估:人类-助手交互研究的叙述:10项用户研究

Ziyi Xuan, Yiwen Wu, Xuhai Xu, Vinod Namboodiri, Mooi Choo Chuah, Yu Yang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种生成性代理模拟平台,用于研究人类-助手交互,通过模拟十项现有研究验证了其有效性,为高效研究助手代理设计提供了新方法。

Journal ref Proc. ACM Interact. Mob. Wearable Ubiquitous Technol. 9, 4, Article 229 (December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18448 2025-11-25 cs.CV 50%

EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs

EventBench: 向事件驱动的大语言模型全面评估迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EventBench通过八个任务指标和大规模数据集全面评估事件驱动MLLMs的能力,揭示其在细粒度识别和空间推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18343 2025-11-25 cs.SE 50%

A Needle in a Haystack: Intent-driven Reusable Artifacts Recommendation with LLMs

在 haystack 中寻找针:基于意图的可重用 artifacts 推荐 with LLMs

Dongming Jin, Zhi Jin, Xiaohong Chen, Zheng Fang, Linyu Li, Yuanpeng He, Jia Li, Yirang Zhang, Yingtao Fang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出 TreeRec 框架,通过语义抽象组织 artifacts 成层次结构树,提升 LLMs 在意图驱动推荐中的性能和效率。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏