arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-21 至 2026-01-21 共收录 224 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 31 篇

2601.11579 2026-01-21 cs.CL cs.AI 62%

Bielik 11B v3: Multilingual Large Language Model for European Languages

Bielik 11B v3:面向欧洲语言的多语言大语言模型

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Bielik 11B v3是一款针对波兰语优化,同时支持多种欧洲语言的高性能大语言模型,通过深度扩展和四阶段训练流程实现了高效参数利用和广泛任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11564 2026-01-21 cs.CL cs.AI 62%

Context Discipline and Performance Correlation: Analyzing LLM Performance and Quality Degradation Under Varying Context Lengths

上下文学科与性能相关性:分析在不同上下文长度下LLM性能及质量退化

Ahilan Ayyachamy Nadar Ponnusamy, Karthic Chandran, M Maruf Hossain

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了不同上下文长度下LLM性能与质量退化的关系,发现KV缓存增长导致性能非线性退化,并揭示了MoE架构在高token体积时受基础设施瓶颈影响的问题。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13453 2026-01-21 cs.CL cs.HC 57%

PhysicsSolutionAgent: Towards Multimodal Explanations for Numerical Physics Problem Solving

PhysicsSolutionAgent: 向数值物理问题求解的多模态解释迈进

Aditya Thole, Anmol Agrawal, Arnav Ramamoorthy, Dhruv Kumar

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 PhysicsSolutionAgent通过生成多模态视频解释,提升数值物理问题的可视化教学效果,揭示了多模态推理与评估的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13114 2026-01-21 cs.NI cs.AI cs.SY eess.SY 57%

IntAgent: NWDAF-Based Intent LLM Agent Towards Advanced Next Generation Networks

IntAgent:基于网络切片分析功能的意图LLM代理面向下一代高级网络

Abdelrahman Soliman, Ahmed Refaey, Aiman Erbad, Amr Mohamed

机构 * University of Guelph(圭尔夫大学) Qatar University(卡塔尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 IntAgent通过整合NWDAF分析与工具,实现基于意图的网络自动化管理,提升网络操作的智能化和动态响应能力。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12449 2026-01-21 cs.CR cs.AI 57%

AgenTRIM: Tool Risk Mitigation for Agentic AI

AgenTRIM:代理AI的工具风险缓解

Roy Betser, Shamik Bose, Amit Giloni, Chiara Picardi, Sindhu Padakandla, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究(FRE)) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人有限公司(FRIPL))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 AgenTRIM通过离线和在线阶段检测并缓解代理AI中工具驱动的风险,减少攻击成功率同时保持任务性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21849 2026-01-21 cs.CL cs.MA 57%

Following the TRACE: A Structured Path to Empathetic Response Generation with Multi-Agent Models

遵循TRACE:基于多智能体模型的结构化共情响应生成路径

Ziqi Liu, Ziyang Zhou, Yilin Li, Haiyang Zhang, Yangbin Chen

机构 * School of Advanced Technology (SAT) Xi'an Jiaotong-Liverpool University, Suzhou, China(先进技术学院(SAT)西安交通大学利物浦大学,苏州,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 TRACE通过结构化分解任务,结合深度分析与生成能力,提升共情响应生成的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12030 2026-01-21 cs.AI 57%

ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking Agents

ARC:面向长周期信息检索代理的主动与反思驱动上下文管理

Yilun Yao, Shan Huang, Elsie Dai, Zhewen Tan, Zhenyu Duan, Shousheng Jia, Yanbing Jiang, Tong Yang

机构 * Peking University(北京大学) Beihang University(北京航空航天大学) Qiyuan Tech(启元科技)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ARC 通过主动和反思驱动的上下文管理方法,提升了长周期信息检索代理的性能,显著提高了准确性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11974 2026-01-21 cs.AI 57%

Learn Like Humans: Use Meta-cognitive Reflection for Efficient Self-Improvement

像人类学习:利用元认知反思实现高效的自我改进

Xinmeng Hou, Peiliang Gong, Bohao Qu, Wuqi Wang, Qing Guo, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) A*STAR Chang’an University(长安大学) Nankai University(南开大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MARS通过整合基于原则和程序性的反思,实现高效自我改进,优于现有系统并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11783 2026-01-21 cs.SE cs.CL 57%

The Stability Trap: Evaluating the Reliability of LLM-Based Instruction Adherence Auditing

稳定性陷阱:评估基于大语言模型的指令遵循审计的可靠性

Murtuza N. Shergadwala

机构 * Workday Inc.(Workday公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过引入有界指令分解框架,揭示了基于大语言模型的指令遵循审计中判决稳定性与推理稳定性之间的矛盾,提出需严格限定自动化评估协议以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02888 2026-01-21 cs.LG 57%

RPIQ: Residual-Projected Multi-Collaboration Closed-Loop and Single Instance Quantization for Visually Impaired Assistance

RPIQ: 基于残差投影多协作闭环和单实例量化的方法用于视障辅助

Xuanyu Wang, Haisen Su, Jingtao Zhang, Xiangxiang Wang, Yongbin Yu, Manping Fan, Jialing Xiao, Bo Gong, Siqi Chen, Mingsheng Cao, Liyong Ren, Zhenglin Yang

机构 * School of Information Software Engineering, University of Electronic Science School of Mathematical Sciences, Sichuan Normal University, Chengdu, Sichuan, China Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science Research Unit for Blindness Prevention, Chinese Academy of Medical Sciences, Sichuan Academy of Medical Sciences Sichuan Provincial People’s Hospital, Chengdu, Sichuan, China School of Medicine, University of Electronic Science Tibetan Language Intelligence National Key Laboratory, Qinghai Normal University, Xining, Qinghai, China

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 RPIQ通过残差投影多协作闭环和单实例量化方法,实现大规模模型在4位表示下的高效压缩,显著降低内存消耗并保持高性能,适用于视障辅助系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01652 2026-01-21 cs.CL 57%

MIRAGE: Exploring How Large Language Models Perform in Complex Social Interactive Environments

MIRAGE:探索大型语言模型在复杂社会互动环境中的表现

Yin Cai, Zhouhong Gu, Zhaohan Du, Zheyu Ye, Shaosheng Cao, Yiqian Xu, Hongwei Feng, Ping Chen

机构 * Institute of Big Data, Fudan University(复旦大学大数据研究院) Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(复旦大学计算机学院) School of Computer Science, Fudan University(复旦大学计算机学院) Xiaohongshu Inc.(小红书公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 MIRAGE通过谋杀谜案游戏评估LLMs在复杂社会互动环境中的表现,揭示其在信任、线索调查、互动和指令遵循方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13112 2026-01-21 cs.CR 50%

CODE: A Contradiction-Based Deliberation Extension Framework for Overthinking Attacks on Retrieval-Augmented Generation

CODE:一种基于矛盾的 deliberation 延伸框架,用于对抗检索增强生成中的过度思考攻击

Xiaolei Zhang, Xiaojun Jia, Liquan Chen, Songze Li

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出 CODE 框架,通过构造污染样本引发 RAG 系统的过度思考攻击,导致推理标记消耗激增,同时不影响任务性能。

Comments 12 pages with 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12303 2026-01-21 cs.CV 50%

Concepts from Representations: Post-hoc Concept Bottleneck Models via Sparse Decomposition of Visual Representations

表示法中的概念:通过视觉表示的稀疏分解实现事后概念瓶颈模型

Shizhan Gong, Xiaofan Zhang, Qi Dou

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出PCBM-ReD,通过视觉表示的稀疏分解,实现对预训练模型的可解释性增强,提升图像分类任务的准确性和可解释性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 72 篇

2510.06243 2026-01-21 cs.CL cs.AI 90%

CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning

CoT Referring: 通过 grounded 推理改进指称表达任务

Qihua Dong, Luis Figueroa, Handong Zhao, Kushal Kafle, Jason Kuen, Zhihong Ding, Scott Cohen, Yun Fu

机构 * Adobe Research(Adobe研究院) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 通过 grounded 推理改进指称表达任务,提出CoT Referring方法,提升多模态大语言模型在复杂指称场景中的性能。

Comments MLLM, Referring Expression Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03597 2026-01-21 cs.CL cs.AI 86%

From Chains to Graphs: Self-Structured Reasoning for General-Domain LLMs

从链式到图式:面向通用领域LLM的自结构化推理

Yingjian Chen, Haoran Liu, Yinhong Liu, Sherry T. Tong, Aosong Feng, Jinghui Lu, Juntao Zhang, Yusuke Iwasawa, Yutaka Matsuo, Irene Li

机构 * University of Tokyo(东京大学) Texas A&M University(德克萨斯大学) University of Cambridge(剑桥大学) Yale University(耶鲁大学) Xiaomi EV(小米电动汽车) Henan University(河南大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自图推理框架SGR,通过结构化图表示提升LLM在通用领域问答中的推理一致性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10229 2026-01-21 cs.CL 86%

GeoSteer: Faithful Chain-of-Thought Steering via Latent Manifold Gradients

GeoSteer: 通过潜在流形梯度实现忠实的思维链引导

Kentaro Kazama, Daiki Shirafuji, Tatsuhiko Saito

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract,comments);CoT(abstract);分类 cs.CL

AI总结 GeoSteer通过学习高质量CoT轨迹的低维流形,利用梯度引导提升LLM中间推理质量,实验显示在GSM8k数据集上准确率和推理质量均显著提升。

Comments The Third workshop of NeusymBridge @AAAI 2026 (Bridging Neurons and Symbols for NLP and Knowledge Graph Reasoning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13243 2026-01-21 cs.LG 85%

A Comprehensive Evaluation of LLM Reasoning: From Single-Model to Multi-Agent Paradigms

大语言模型推理的全面评估:从单模型到多智能体范式

Yapeng Li, Jiakuo Yu, Zhixin Liu, Xinnan Liu, Jing Yu, Songze Li, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本研究全面评估了LLM推理范式,包括单模型和多智能体系统,通过新基准测试揭示了不同范式在成本与准确率之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24816 2026-01-21 cs.CV cs.AI 85%

Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection

感知、理解和推理,一个用于视频虚假新闻检测的多模态基准

Cui Yakun, Peng Qi, Fushuo Huo, Hang Du, Weijie Shi, Juntao Dai, Zhenghao Zhu, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出POVFNDB多模态基准,通过10个任务系统评估MLLMs在视频虚假新闻检测中的感知、理解和推理能力,并通过微调Qwen2.5VL-7B-Instruct达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14084 2026-01-21 cs.CV cs.AI cs.CL 81%

DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning

DermaBench:一种用于皮肤科视觉问答和推理的临床标注基准数据集

Abdurrahim Yilmaz, Ozan Erdem, Ece Gokyayla, Ayda Acar, Burc Bugra Dagtas, Dilara Ilhan Erdil, Gulsum Gencoglan, Burak Temelkuran

机构 * Imperial College London(帝国理工学院伦敦分校) Istanbul Medeniyet University(伊斯坦布尔医学大学) Usak Research and Training Hospital(Usak研究与培训医院) Istanbul Research and Training Hospital(伊斯坦布尔研究与培训医院) Ipswich Hospital(伊普斯韦奇医院) Medicana Atakoy Hospital(Medicana阿塔基医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DermaBench是首个由临床专家标注的皮肤科视觉问答基准数据集,通过精细标注和开放式描述提升多模态模型在皮肤科图像理解与临床推理中的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11625 2026-01-21 cs.AI cs.LG 81%

Reasoning Stabilization Point: A Training-Time Signal for Stable Evidence and Shortcut Reliance

推理稳定点:一种训练时的信号,用于稳定证据和捷径依赖

Sahil Rajesh Dhayalkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出推理稳定点(RSP)作为训练时的信号,用于监测微调过程中决策证据的变化,并帮助选择稳定证据区域的检查点。

Comments 8 pages, Submitted to ACL Rolling Review and is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13401 2026-01-21 cs.CV cs.AI 80%

Reasoning with Pixel-level Precision: QVLM Architecture and SQuID Dataset for Quantitative Geospatial Analytics

基于像素级精度的推理:QVLM架构与SQuID数据集用于定量遥感分析

Peter A. Massih, Eric Cosatto

机构 * Department of Machine Learning, NEC Laboratories America(机器学习系,NEC美国实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出QVLM架构和SQuID数据集,通过解耦语言理解和视觉分析,提升定量空间推理的准确性。

Comments Submitted to CVPR 2026. Introduces the QVLM architecture and the SQuID dataset for quantitative geospatial reasoning. Dataset DOI: 10.57967/hf/7565

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13690 2026-01-21 cs.CL 79%

Dr. Assistant: Enhancing Clinical Diagnostic Inquiry via Structured Diagnostic Reasoning Data and Reinforcement Learning

通过结构化诊断推理数据和强化学习增强临床诊断探究

Yue Guo, Fanfu Wang, Jianwei Lv, Xincheng Shi, Yuchen Li, Youya Wang, Yunsheng Zeng, Yujing Liu, Yunhao Qiao, Gen Li, Junfeng Wang, Bo Yuan

机构 * Baidu Inc.(百度公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Dr. Assistant通过结构化诊断推理数据和强化学习提升临床诊断能力,优于开放源代码模型并接近闭源模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13546 2026-01-21 cs.AI 79%

ChatAD: Reasoning-Enhanced Time-Series Anomaly Detection with Multi-Turn Instruction Evolution

ChatAD: 基于推理增强的多轮指令演化的时序异常检测

Hui Sun, Chang Xu, Haonan Xie, Hao Li, Yuhao Huang, Chuheng Zhang, Ming Jin, Xiaoguang Liu, Gang Wang, Jiang Bian

机构 * Nankai University(南开大学) Microsoft Research Asia(微软亚洲研究院) Huanjiang Laboratory(焕江实验室) University of Manchester(曼彻斯特大学) Nanjing University(南京大学) Griffith University(格里菲斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ChatAD通过多智能体演化算法和Kahneman-Tversky优化,提升了时序异常检测的推理能力和跨任务泛化性能,实现了显著的准确率和F1值提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13183 2026-01-21 cs.CL 79%

OpenExempt: A Diagnostic Benchmark for Legal Reasoning and a Framework for Creating Custom Benchmarks on Demand

OpenExempt:法律推理的诊断基准及自定义基准框架

Sergio Servantez, Sarah B. Lawsky, Rajiv Jain, Daniel W. Linna, Kristian Hammond

机构 * Northwestern University(西北大学) Adobe Research(Adobe研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 OpenExempt通过动态生成法律推理任务和解决方案,提供一个用于诊断评估的基准和框架,揭示模型在复杂推理中的性能差异。

Comments 25 pages, 9 Figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12618 2026-01-21 cs.CL 79%

Disagreement as Data: Reasoning Trace Analytics in Multi-Agent Systems

分歧作为数据:多智能体系统中的推理轨迹分析

Elham Tajik, Conrad Borchers, Bahar Shahrokhian, Sebastian Simon, Ali Keramati, Sonika Pal, Sreecharan Sankaranarayanan

机构 * University at Albany(纽约州立大学阿尔巴尼分校) Carnegie Mellon University(卡内基梅隆大学) Arizona State University(亚利桑那州立大学) Le Mans University(勒曼大学) University of California, Irvine(加州大学尔湾分校) Indian Institute of Technology Bombay(印度班加罗尔理工学院) Extuitive Inc. (Flagship Pioneering)(Extuitive公司(Flagship Pioneering))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出利用LLM代理生成的推理轨迹分析分歧,通过余弦相似度检测和量化代理间的分歧,提升定性编码的解释实践和方法论严谨性。

Comments LAK 2026 conference paper, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11866 2026-01-21 cs.CL 79%

Advances in LLM Reasoning Enable Flexibility in Clinical Problem-Solving

大语言模型推理能力的进步促进了临床问题解决的灵活性

Kie Shidara, Preethi Prem, Jonathan Kim, Anna Podlasek, Feng Liu, Ahmed Alaa, Danilo Bernardo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 大语言模型推理能力的提升增强了其在临床问题解决中的灵活性,使其在医学推理任务中表现接近人类水平。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13705 2026-01-21 cs.CV 78%

Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles

推理还是模式匹配?通过视觉谜题探测大型视觉-语言模型

Maria Lymperaiou, Vasileios Karampinis, Giorgos Filandrianos, Angelos Vlachos, Chrysoula Zerva, Athanasios Voulodimos

机构 * National Technical University of Athens(国家技术大学雅典) Instituto de Telecomunicações(电信研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文通过视觉谜题探测大型视觉-语言模型的推理能力,揭示其在泛化、感知与推理整合及执行一致性方面的局限,并提出未来基准和系统的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12716 2026-01-21 cs.CR 78%

CellularSpecSec-Bench: A Staged Benchmark for Evidence-Grounded Interpretation and Security Reasoning over 3GPP Specifications

CellularSpecSec-Bench: 一个分阶段的基准,用于基于证据的解释和3GPP规范的保安推理

Ke Xie, Xingyi Zhao, Yiwen Hu, Shuhan Yuan, Tian Xie

专题命中 推理评测 :reasoning(title,abstract)

AI总结 CellularSpecSec-Bench通过分阶段基准和统一框架,提升对3GPP规范的解释和安全推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10949 2026-01-21 cs.CV 78%

MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement

MMedExpert-R1: 通过领域特定适应与临床指南强化多模态医学推理

Meidan Ding, Jipeng Zhang, Wenxuan Wang, Haiqin Zhong, Xiaoling Luo, Wenting Chen, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Renmin University of China(中国人民大学) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MMedExpert-R1通过领域特定适应和临床指南强化,提升多模态医学推理能力,实现多专科对齐和高精度推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10427 2026-01-21 cs.CV 78%

STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes

STRIDE-QA:用于城市驾驶场景时空推理的视觉问答数据集

Keishi Ishihara, Kento Sasaki, Tsubasa Takahashi, Daiki Shiono, Yu Yamaguchi

专题命中 推理评测 :reasoning(title,abstract)

AI总结 STRIDE-QA通过大规模视觉问答数据集提升自动驾驶中动态交通场景的时空推理能力,显著提升VLMs在空间定位和未来运动预测中的表现。

Comments Accepted to AAAI 2026 (Oral). project page: https://turingmotors.github.io/stride-qa/

详情

展开后加载摘要…

URL PDF HTML 收藏