arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2603.17930 2026-03-19 cs.CV 78%

Interpretable Traffic Responsibility from Dashcam Video via Legal Multi Agent Reasoning

基于法律多智能体推理的可解释交通责任分析

Jingchun Yang, Jinchang Zhang

机构 * Northeast University(东北大学) SUNY Binghamton University(纽约州立大学布法罗分校)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出C-TRAIL多模态数据集,结合视频与文本描述,通过两阶段框架实现交通责任判定,优于现有方法并提供透明法律推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15015 2026-03-18 cs.MA 78%

MetaCrit: A Critical Thinking Framework for Self-Regulated LLM Reasoning

MetaCrit: 一种用于自主LLM推理的批判性思维框架

Xinmeng Hou, Ziting Chang, Zhouquan Lu, Chen Wenli, Liang Wan, Wei Feng, Hai Hu, Qing Guo

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出MetaCrit框架,通过多智能体机制提升LLM在多跳问题中的推理能力,增强逻辑严谨性并消除有毒输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16181 2026-03-18 cs.CV cs.CR 78%

KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety

KidsNanny:一种集成视觉分类、目标检测、OCR和上下文推理的双阶段多模态内容审查流水线,用于儿童安全

Viraj Panchal, Tanmay Talsaniya, Parag Patel, Meet Patel

机构 * KidsNanny Research Team, Vartit Technology Inc.(KidsNanny研究团队,Vartit技术公司)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出KidsNanny,一种双阶段多模态内容审查架构,通过视觉Transformer和目标检测器进行视觉筛查,结合OCR和基于文本的7B语言模型进行上下文推理,以提高儿童安全的内容审查效率和准确性。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03951 2026-03-18 cs.CV 78%

ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning

ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测

Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出ANTs通过利用多模态大语言模型的理解和推理能力,构建自适应负文本空间,提升OOD检测的准确性和适应性,实验表明在ImageNet上FPR95降低3.1%。

Comments Accepted by CVPR2026, Project Page: https://zhuwenjie98.github.io/ANTS-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13759 2026-03-17 cs.CV 78%

QTrack: Query-Driven Reasoning for Multi-modal MOT

QTrack: 基于查询的多模态 MOT 推理

Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出基于查询的多模态 MOT 推理方法,通过自然语言查询定位和跟踪特定目标,构建了 RMOT26 基准并提出 QTrack 模型,结合多模态推理与跟踪定位,提升语言引导的跟踪性能。

Comments Project Page: https://gaashlab.github.io/QTrack/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03667 2026-03-17 cs.CV 78%

Colon-X: Advancing Intelligent Colonoscopy toward Clinical Reasoning

Colon-X:推动智能结肠镜向临床推理迈进

Ge-Peng Ji, Jingyi Liu, Deng-Ping Fan, Huazhu Fu, Nick Barnes

机构 * NKIARI & SLAI, Shenzhen Futian and VCIP, Nankai University, Tianjin, China(NKIARI与SLAI,深圳福田及VCIP,南开大学,天津,中国) Australian National University (ANU), Canberra, Australia(澳大利亚国立大学(ANU),堪培拉,澳大利亚) King Abdullah University of Science and Technology (KAUST), Thuwal, Saudi Arabia(国王阿卜杜勒·阿齐兹大学(KAUST),图瓦尔,沙特阿拉伯) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科学、技术和研究局(A*STAR),新加坡)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出Colon-X,构建了最全面的结肠镜多模态数据集ColonVQA,并开发了专为结肠镜设计的ColonR1模型,通过任务自适应奖励和梯度稳定策略优化,在数据稀缺条件下实现了56.61%的总体准确率,优于监督微调方法。

Comments Technical report (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07791 2026-03-13 cs.CV 78%

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

GTR-Bench:评估视觉-语言模型中的地理时间推理

Qinghongbing Xie, Zhaoyuan Xia, Feng Zhu, Lijun Gong, Ziyue Li, Rui Zhao, Long Zeng

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Peking University(北京大学) Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。

Comments ICLR 2026, 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10852 2026-03-12 cs.CV 78%

UltrasoundAgents: Hierarchical Multi-Agent Evidence-Chain Reasoning for Breast Ultrasound Diagnosis

超声波智能体:用于乳腺超声诊断的层次多智能体证据链推理

Yali Zhu, Kang Zhou, Dingbang Wu, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学(大学层面)交叉学科学院,北京,中国) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong(人工智能与机器人中心,香港创新科学研究院,中国科学院,香港)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 UltrasoundAgents通过层次多智能体框架实现乳腺超声诊断中的证据链推理,提升诊断准确性和证据可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09478 2026-03-11 cs.MM 78%

MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning

MORE-R1: 通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取的分步推理

Xiang Yuan, Xu Chu, Xinrong Chen, Haochen Li, Zonghong Dai, Hongcheng Fan, Xiaoyue Yuan, Weiping Li, Tong Mo

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MORE-R1通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取,提升推理能力与模型性能。

Comments Accepted by the 31st International Conference on Database Systems for Advanced Applications. This is the Accepted Manuscript (AM) version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07091 2026-03-10 cs.SE 78%

Exploring the Reasoning Depth of Small Language Models in Software Architecture: A Multidimensional Evaluation Framework Towards Software Engineering 2.0

探索小型语言模型在软件架构中的推理深度:一项面向软件工程2.0的多维评估框架

Ha Vo, Nhut Tran, Khang Vo, Phat T. Tran-Truong, Son Ha

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究通过多维评估框架评估小型语言模型在软件架构中的推理深度,发现参数阈值影响推理能力,揭示了中等大小模型在短上下文下的校准机制及语义多样性与幻觉的相关性。

Comments Accepted at ICSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16160 2026-03-10 cs.CV 78%

Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning

Video2Layout: 重建用于空间推理的度量基础认知图

Yibin Huang, Wang Xu, Wanyue Zhang, Helu Zhi, Jingjing Huang, Yangbin Xu, Yangang Sun, Conghui Zhu, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Video2Layout通过重建度量基础的空间布局,提升多模态大语言模型在空间推理中的性能,其方法结合监督微调与强化微调,实现更精确的空间认知图构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06014 2026-03-09 cs.CV 78%

EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

EffectMaker:统一推理与生成以实现定制化视觉效果创建

Shiyuan Yang, Ruihuang Li, Jiale Tao, Shuai Shao, Qinglin Lu, Jing Liao

机构 * Tencent Hunyuan(腾讯文言) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 EffectMaker通过统一推理生成框架实现定制化视觉效果创建,利用多模态模型和扩散变换器提升效果质量和一致性,构建大规模数据集增强泛化能力。

Comments Project page: https://effectmaker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05708 2026-03-09 cs.CV 78%

Interpretable Perception and Reasoning for Audiovisual Geolocation

可解释的视听定位与推理

Yiyang Su, Xiaoming Liu

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出了一种基于可解释感知和多模态推理的视听定位框架,通过合成声学原子与视觉特征,实现高精度全球定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04616 2026-03-06 physics.ed-ph 78%

Chatbot Conversations in Physics Education: Using Artificial Intelligence to Analyze Student Reasoning through Computational Grounded Theory

物理教育中的聊天机器人对话:利用人工智能分析学生推理过程的计算 grounded 理论

Atharva Dange, Ramon E. Lopez

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究利用计算 grounded 理论分析聊天机器人对话数据,揭示学生在物理学习中的常见误解及思维模式,为开发更智能的教育工具提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17623 2026-03-04 cs.MM cs.CV 78%

Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?

合成感知:生成图像能否解锁潜在的视觉先验以用于以文本为中心的推理?

Yuesheng Huang, Peng Zhang, Xiaoxin Wu, Riliang Liu, Jiaqi Liang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文探讨生成图像能否解锁潜在视觉先验以提升文本中心推理,通过多模态融合架构和提示工程策略实现性能提升。

Comments Accepted as a poster at the International Conference on Machine Learning (ICML 2025) NewInML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06499 2026-03-03 cs.CV 78%

SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports

SportR:多模态大语言模型在体育中的推理基准

Haotian Xia, Haonan Ge, Junbo Zou, Hyun Woo Choi, Xuebin Zhang, Danny Suradja, Botao Rui, Ethan Tran, Wendy Jin, Zhen Ye, Xiyang Lin, Christopher Lai, Shengjie Zhang, Junwen Miao, Shichao Chen, Rhys Tracy, Vicente Ordonez, Weining Shen, Hanjie Chen

机构 * Department of Computer Science, Rice University(Rice大学计算机科学系) Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所) Department of Statistics, University of California, Irvine(伊利诺伊大学欧文分校统计系) College of Sciences, Georgia Institute of Technology(佐治亚理工学院科学学院) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 SportR是一个多体育大规模基准,旨在训练和评估多模态大语言模型在体育推理中的能力,通过精细的视觉感知和规则推理任务提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04201 2026-03-03 cs.CV 78%

SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios

SToLa:具有触觉常识推理的自适应触觉-语言框架在开放性场景中

Ning Cheng, Jinan Xu, Jialing Chen, Bin Fang, Wenjuan Han

专题命中 推理评测 :reasoning(title,abstract)

AI总结 SToLa通过专家混合架构实现触觉与语言模态的自适应统一,解决开放性场景中触觉常识推理的挑战,提升多模态推理性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00971 2026-03-03 cs.CV 78%

Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning

揭示认知罗盘:基于理论of-Mind的多模态情感推理

Meng Luo, Bobo Li, Shanqing Xu, Shize Zhang, Qiuchan Chen, Menglu Han, Wenhao Chen, Yanxiang Huang, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出HitEmotion基准和TMPO方法,通过理论of-Mind引导多模态情感推理,提升模型情感理解和认知能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07484 2026-03-03 cs.IR 78%

Reasoning by Exploration: A Unified Approach to Retrieval and Generation over Graphs

通过探索进行推理:一种统一的图检索与生成方法

Haoyu Han, Kai Guo, Harry Shomer, Yu Wang, Yucheng Chu, Hang Li, Li Ma, Jiliang Tang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 RoE通过统一检索与生成过程,利用图探索机制提升大型语言模型在结构化图推理中的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22339 2026-03-03 cs.CV 78%

CircuitSense: A Hierarchical MLLM Benchmark Bridging Visual Comprehension and Symbolic Reasoning in Engineering Design Process

CircuitSense: 一种层次化的MLLM基准,连接视觉理解和符号推理在工程设计过程

Arman Akbari, Jian Gao, Yifei Zou, Mei Yang, Jinru Duan, Dmitrii Torbunov, Yanzhi Wang, Yihui Ren, Xuan Zhang

机构 * Northeastern University(东北大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 CircuitSense提出一个层次化基准,评估工程设计中视觉理解与符号推理的能力,揭示闭源模型在符号推导上的不足,强调数学理解对电路综合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00805 2026-03-02 cs.CV 78%

Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding

通过草稿思考:用于高效长视频理解的推测性时间推理

Pengfei Hu, Meng Cao, Yingyao Wang, Yi Wang, Jiahua Dong, Jun Song, Yu Cheng, Bo Zheng, Xiaodan Liang

机构 * MBZUAI(马克斯·普朗克智能研究院) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 SpecTemp通过协作双模型设计,实现高效长视频理解,平衡效率与准确性,提升推理速度。

Comments Accepted by CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21743 2026-02-27 cs.CV 78%

Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization

通过难度感知分组归一化增强多模态大语言模型推理

Jinghan Li, Junfeng Fang, Jinda Lu, Yuan Wang, Xiaoyan Guo, Tianyu Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出难度感知分组归一化方法,通过感知复杂度和推理不确定性表征样本,提升多模态大语言模型的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21698 2026-02-26 cs.CV 78%

E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought

E-comIQ-ZH: 一种用于评估电子商务海报细粒度的对齐人类数据集和基准

Meiqi Sun, Mingyu Li, Junxiong Zhu

机构 * Taobao & Tmall Group, Alibaba Group(淘宝与天猫集团、阿里巴巴集团)

专题命中 推理评测 :chain-of-thought(title);CoT(abstract)

AI总结 E-comIQ-ZH提出了一种针对中文电子商务海报生成的对齐人类评估框架,通过构建多维评分数据集和专家校准的链式推理模型,实现了细粒度的自动化评估。

Comments 21pages, 19figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21137 2026-02-25 cs.CV 78%

UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

UDVideoQA: 一个用于城市动态多对象时空推理的交通视频问答数据集

Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 UDVideoQA是一个用于城市动态多对象时空推理的交通视频问答数据集,通过统一标注流程生成28K问题-答案对,评估视觉定位和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20291 2026-02-25 cs.CV 78%

De-rendering, Reasoning, and Repairing Charts with Vision-Language Models

图表去渲染、推理与修复:基于视觉-语言模型

Valentin Bonas, Martin Sinnona, Viviana Siless, Emmanuel Iarussi

机构 * Universidad Torcuato Di Tella(托克托迪特拉大学) Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究理事会) Facultad de Ciencias Exactas y Naturales Universidad de Buenos Aires(布宜诺斯艾利斯大学科学与自然学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出了一种结合图表去渲染、自动分析和迭代改进的框架,利用视觉-语言模型提供基于原则的可视化设计反馈,提升可视化质量和素养。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19828 2026-02-24 cs.CV 78%

TextShield-R1: Reinforced Reasoning for Tampered Text Detection

TextShield-R1: 用于篡改文本检测的强化推理

Chenfan Qu, Yiwu Zhong, Jian Liu, Xuekang Zhu, Bohan Yu, Lianwen Jin

专题命中 推理评测 :reasoning(title,abstract)

AI总结 TextShield-R1通过强化学习和OCR校正技术,提升篡改文本检测的准确性和鲁棒性,解决现有方法在微特征识别和跨语言评估中的不足。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19715 2026-02-24 cs.CV 78%

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall

机构 * MBZUAI Monash University(墨尔本大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。

Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09510 2026-02-17 cs.IR 78%

MRMR: A Realistic and Expert-Level Multidisciplinary Benchmark for Reasoning-Intensive Multimodal Retrieval

MRMR:一个面向推理密集型多模态检索的现实且专家级多学科基准

Siyue Zhang, Yuan Gao, Xiao Zhou, Yilun Zhao, Tingyu Song, Arman Cohan, Anh Tuan Luu, Chen Zhao

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MRMR是一个面向推理密集型多模态检索的现实且专家级多学科基准,通过多领域查询和混合模态数据推动检索模型的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12530 2026-02-16 cs.IR 78%

Reasoning to Rank: An End-to-End Solution for Exploiting Large Language Models for Recommendation

推理以排序:一种利用大语言模型进行推荐的端到端解决方案

Kehan Zheng, Deyao Hong, Qian Li, Jun Zhang, Huan Yu, Jie Jiang, Hongning Wang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出了一种端到端的推荐框架,通过强化学习优化大语言模型的推理过程,以提高推荐系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10656 2026-02-12 eess.AS cs.SD 78%

AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval

AudioRAG:一个用于音频推理和信息检索的挑战性基准

Jingru Lin, Chen Zhang, Tianrui Wang, Haizhou Li

专题命中 推理评测 :reasoning(title,abstract)

AI总结 AudioRAG是一个用于评估音频推理和信息检索能力的挑战性基准,通过整合检索增强生成技术,为未来研究提供更强大的基准。

Comments Accepted by Audio-AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏