arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2601.06707 2026-01-13 cs.CL 79%

Evaluating Accounting Reasoning Capabilities of Large Language Models

评估大型语言模型的会计推理能力

Jie Zhou, Xin Chen, Jie Zhang, Hai Li, Jie Wang, Zhe Li

机构 * School of Computer Engineering, Jiangsu Ocean University(计算机工程学院,江苏海洋大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文评估了大型语言模型在会计推理任务中的能力,通过定义垂直领域会计推理标准,分析了GLM和GPT-4等模型的表现,发现提示设计对性能影响显著,但现有模型仍需优化以满足实际需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06234 2026-01-13 cs.AI 79%

PCoKG: Personality-aware Commonsense Reasoning with Debate

PCoKG:具有辩论机制的个性感知常识推理

Weijie Li, Zhongqing Wang, Guodong Zhou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PCoKG通过引入辩论机制构建个性感知常识知识图谱,提升对话生成的一致性与个性化水平。

Comments Accept by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05693 2026-01-12 cs.AI 79%

Circular Reasoning: Understanding Self-Reinforcing Loops in Large Reasoning Models

循环推理:理解大推理模型中的自增强循环

Zenghao Duan, Liang Pang, Zihao Wei, Wenbin Duan, Yuxin Tian, Shicheng Xu, Jingcheng Deng, Zhiyi Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出LoopBench数据集和CUSUM算法,用于识别和预测大型推理模型中的自增强循环问题,揭示循环推理的机理并提升模型稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04996 2026-01-12 cs.AI 79%

AlgBench: To What Extent Do Large Reasoning Models Understand Algorithms?

AlgBench: 大型推理模型对算法的理解程度有多高?

Henan Sun, Kaichi Yu, Yuyao Wang, Bowen Liu, Xunkai Li, Rong-Hua Li, Nuo Chen, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AlgBench通过算法为中心的基准测试揭示大型推理模型在算法理解上的性能差异和局限性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21329 2026-01-12 cs.CL 79%

Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks

你的推理基准可能并未测试推理:揭示抽象推理基准中的感知瓶颈

Xinhe Wang, Jin Huang, Xingjian Zhang, Tianhao Wang, Jiaqi W. Ma

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究发现抽象推理基准中的性能差距主要源于视觉感知限制,而非推理能力不足,需设计分离感知与推理的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09993 2026-01-12 cs.AI 79%

SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models

SPAN:大型语言模型跨日历时间推理的基准测试与改进

Zhongjian Miao, Hao Fu, Chen Wei

机构 * Li Auto(利亚特)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SPAN通过开发时间代理提升大型语言模型跨日历时间推理能力,实验显示其准确率高达95.31%

Comments Accepted at the AAAI 2026 conference. This version includes the supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05073 2026-01-09 cs.LG 79%

Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward

几何推理的里程碑:通过子目标可验证奖励解锁几何推理

Jianlong Chen, Daocheng Fu, Shengze Xu, Jiawei Chen, Yuan Feng, Yue Yang, Junchi Yan, Hongyuan Zha, Renqiu Xia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04891 2026-01-09 cs.CV cs.LG 79%

Scaling Vision Language Models for Pharmaceutical Long Form Video Reasoning on Industrial GenAI Platform

在工业生成式AI平台上扩展视觉语言模型用于制药长格式视频推理

Suyash Mishra, Qiang Li, Srikanth Patil, Satyanarayan Pati, Baddu Narendra

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出工业GenAI框架,解决制药领域长格式视频推理问题,通过多模态架构和实证分析提升效率并揭示现有VLMs的限制。

Comments Submitted to the Industry Track of Top Tier Conference; currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04086 2026-01-08 cs.CL 79%

KDCM: Reducing Hallucination in LLMs through Explicit Reasoning Structures

KDCM:通过显式推理结构减少大语言模型中的幻觉

Jinbo Hao, Kai Yang, Qingzhen Su, Yifan Li, Chao Jiang

机构 * School of Computer Engineering, Jiangsu Ocean University(江苏海洋大学计算机工程学院) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 KDCM通过显式推理结构减少大语言模型中的幻觉,提升预测可靠性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03400 2026-01-08 cs.CV cs.AI 79%

Eye-Q: A Multilingual Benchmark for Visual Word Puzzle Solving and Image-to-Phrase Reasoning

Eye-Q:一个多语言视觉词谜解决和图像到短语推理的基准

Ali Najar, Alireza Mirrokni, Arshia Izadyari, Sadegh Mohammadian, Amir Homayoon Sharifizade, Asal Meskin, Mobin Bagherian, Ehsaneddin Asgari

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Eye-Q提出一个多语言视觉词谜基准,评估模型在复杂视觉推理中的能力,发现现有模型在抽象和跨语言推理上存在显著差距。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00340 2026-01-08 cs.AI 79%

Better Call CLAUSE: A Discrepancy Benchmark for Auditing LLMs Legal Reasoning Capabilities

更好的CLAUSE:用于审计LLM法律推理能力的差异基准

Manan Roy Choudhury, Adithya Chandramouli, Mannan Anand, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CLAUSE是一个用于评估LLM法律推理能力的基准,通过生成现实扰动合同检测细微法律错误,揭示LLM在识别和解释法律缺陷方面的不足。

Comments 42 pages, 4 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21710 2026-01-07 cs.CL 79%

Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval

Think-on-Graph 3.0: 通过多智能体双进化上下文检索实现高效自适应的异构图LLM推理

Xiaojun Wu, Cehao Yang, Xueyuan Lin, Chengjin Xu, Xuhui Jiang, Yuanliang Sun, Hui Xiong, Jia Li, Jian Guo

机构 * IDEA Research, International Digital Economy Academy(IDEA研究院,国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) DataArc Tech Ltd.(数据弧科技有限公司) Hithink RoyalFlush Information Network Co., Ltd(慧思皇家Flush信息网络有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Think-on-Graph 3.0通过多智能体双进化上下文检索机制,实现高效自适应的异构图LLM推理,提升轻量级模型在复杂推理任务中的性能。

Comments add: reranker agent and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02604 2026-01-07 cs.CL 79%

Scalable Construction of a Lung Cancer Knowledge Base: Profiling Semantic Reasoning in LLMs

可扩展的肺癌知识库构建:在大语言模型中进行语义推理的 profiling

Cesar Felipe Martínez Cisneros, Jesús Ulises Quiroz Bautista, Claudia Anahí Guzmán Solano, Bogdan Kaleb García Rivera, Iván García Pacheco, Yalbi Itzel Balderas Martínez, Kolawole John Adebayoc, Ignacio Arroyo Fernández

机构 * Universidad Tecnológica de la Mixteca(拉巴斯技术大学) Instituto Nacional de Enfermedades Respiratorias (INER) Ismael Cosío Villegas(国家呼吸疾病研究所(INER)伊斯梅尔·科索·维利亚斯) Maynooth University(梅诺特大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出利用OpenIE构建肺癌知识库,通过语义推理提升生物医学NLP性能。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04141 2026-01-07 cs.AI 79%

The Artificial Intelligence Cognitive Examination: A Survey on the Evolution of Multimodal Evaluation from Recognition to Reasoning

人工智能认知测评:多模态评估从识别到推理的演变综述

Mayank Ravishankara, Varindra V. Persad Maharaj

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文综述了多模态AI评估从识别到推理的演变,探讨了测评方法的转变及当前前沿基准的发展。

Journal ref IEEE Access, vol. 14, Dec. 2025, Art. no. 3649182

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10963 2026-01-07 cs.CV cs.CL 79%

MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning

MMMG:大规模、跨学科、多层级的文本到图像推理生成基准

Yuxuan Luo, Yuhui Yuan, Junwen Chen, Haonan Cai, Ziyi Yue, Yuwei Yang, Fatima Zohra Daha, Ji Li, Zhouhui Lian

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MMMG基准,用于评估文本到图像生成模型的推理能力,揭示现有模型在知识图像生成中的不足,并发布FLUX-Reason作为开放基线。

Comments 85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01341 2026-01-06 cs.CL 79%

Reasoning Over Recall: Evaluating the Efficacy of Generalist Architectures vs. Specialized Fine-Tunes in RAG-Based Mental Health Dialogue Systems

基于回忆的推理:评估基于RAG的心理健康对话系统中通用架构与专门微调的有效性

Md Abdullah Al Kafi, Raka Moni, Sumit Kumar Banshal

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过比较通用推理模型与领域特定微调模型,发现通用模型在同理心和上下文理解方面表现更优,表明强大的推理能力比专门训练更能提升心理健康对话系统的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24572 2026-01-06 cs.CL 79%

Korean Canonical Legal Benchmark: Toward Knowledge-Independent Evaluation of LLMs' Legal Reasoning Capabilities

韩国规范法律基准:迈向独立于领域知识的LLM法律推理能力评估

Hongseok Oh, Wonseok Hwang, Kyoung-Woon On

机构 * University of Seoul(首尔大学) LBOX

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 韩国规范法律基准通过问题级支持先例评估LLM法律推理能力,揭示领域知识依赖下的模型差距,展示推理专用模型的优越性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04308 2026-01-06 cs.RO cs.AI cs.CV 79%

RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics

RoboRefer: 向视觉语言模型在机器人中的空间指称推理迈进

Enshen Zhou, Jingkun An, Cheng Chi, Yi Han, Shanyu Rong, Chi Zhang, Pengwei Wang, Zhongyuan Wang, Tiejun Huang, Lu Sheng, Shanghang Zhang

机构 * School of Software, Beihang University(北京航空航天大学软件学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 RoboRefer通过整合深度编码器和强化微调方法,实现了视觉语言模型在机器人中的空间指称推理,提升了复杂场景下的交互能力。

Comments Accepted by NeurIPS 2025. Project page: https://zhoues.github.io/RoboRefer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03104 2026-01-06 cs.AI 79%

ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning

通过合成数据对齐时间序列,利用大语言模型进行增强的理解与推理

Zhe Xie, Zeyan Li, Xiao He, Longlong Xu, Xidao Wen, Tieying Zhang, Jianjun Chen, Rui Shi, Dan Pei

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ChatTS通过合成数据生成方法,首次实现了多变量时间序列的多模态大语言模型,显著提升了时间序列的理解与推理性能。

Comments accepted by VLDB' 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12692 2026-01-06 cs.CL 79%

FormulaReasoning: A Dataset for Formula-Based Numerical Reasoning

FormulaReasoning:一个用于基于公式的数值推理的数据集

Xiao Li, Bolin Zhu, Kaiwen Shi, Sichen Liu, Yin Zhu, Yiwei Liu, Gong Cheng

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 FormulaReasoning数据集通过引入基于物理原理的数值推理任务,提供细粒度注释和扩展版本,评估多种推理框架,揭示公式推理中的关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00029 2026-01-05 cs.AI cs.CV 79%

From Clay to Code: Typological and Material Reasoning in AI Interpretations of Iranian Pigeon Towers

从黏土到代码:AI对伊朗鸽塔的类型学与物质性解读

Abolhassan Pishahang, Maryam Badiei

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究AI对伊朗鸽塔的类型学与物质性解读,揭示AI在重建传统设计智能时的局限与创新。

Comments Proceedings of SIGraDi 2025: XXIX International Conference of the Ibero-American Society of Digital Graphics, Córdoba, Argentina, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24156 2026-01-01 cs.AI 79%

Graph-Based Exploration for ARC-AGI-3 Interactive Reasoning Tasks

基于图的探索用于ARC-AGI-3交互推理任务

Evgenii Rudakov, Jonathan Shock, Benjamin Ultan Cowley

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 基于图的探索方法在ARC-AGI-3任务中实现高效交互推理,无需训练即可解决大量级别,优于LLM方法。

Journal ref AAAI 2026 Workshop on AI for Scientific Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24063 2026-01-01 cs.LG 79%

How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns

LLMs如何泛化:从认知行为到低级模式的细粒度分析

Haoyue Bai, Yiyou Sun, Wenjie Hu, Shi Qiu, Maggie Ziyu Huan, Peiyang Song, Robert Nowak, Dawn Song

机构 * University of Wisconsin, Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) California Institute of Technology(加州理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文通过细粒度分析揭示LLMs在SFT和RL微调下的泛化差异,提出基于核心技能的基准测试,揭示RL模型在推理稳定性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23440 2025-12-30 cs.CL 79%

ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning

ClinDEF: 一种用于大语言模型临床推理的动态评估框架

Yuqi Tang, Jing Yu, Zichang Su, Kehua Feng, Zhihui Zhu, Libin Wang, Lei Liang, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) AntGroup(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 ClinDEF通过模拟诊断对话评估大语言模型的临床推理能力,利用疾病知识图谱生成病例并进行多轮交互,提供细粒度效率分析和诊断质量评估,揭示LLM在临床推理中的关键不足。

Comments 23 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25987 2025-12-30 cs.SE cs.AI 79%

R-Log: Incentivizing Log Analysis Capability in LLMs via Reasoning-based Reinforcement Learning

R-Log: 通过基于推理的强化学习激励大语言模型的日志分析能力

Yilun Liu, Ziang Chen, Song Xu, Minggui He, Shimin Tao, Weibin Meng, Yuming Xie, Tao Han, Chunguang Zhao, Jingzhou Du, Daimeng Wei, Shenglin Zhang, Yongqian Sun

机构 * Nankai University(南开大学) Huawei(华为)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 R-Log通过基于推理的强化学习提升大语言模型的日志分析能力,有效减少幻觉并提升泛化性能。

Comments Accepted by ICSE 2026 (SEIP Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19855 2025-12-29 cs.LG cs.HC 79%

Inducing Causal World Models in LLMs for Zero-Shot Physical Reasoning

在LLM中诱导因果世界模型以实现零样本物理推理

Aditya Sharma, Ananya Gupta, Chengyu Wang, Chiamaka Adebayo, Jakub Kowalski

机构 * Department of Electrical Engineering(电气工程系) Indian Institute of Technology Bombay(印度理工学院孟买分校) Department of Computer Science and Automation(计算机科学与自动化系) Indian Institute of Science(印度科学研究所) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) University of Lagos(拉各斯大学) Faculty of Mathematics, Informatics, and Mechanics(数学、信息学与力学学院) University of Warsaw(华沙大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CWMI框架,通过引入因果物理模块和因果干预损失,使LLM具备因果推理能力,在零样本物理推理任务中取得显著成效。

Comments 12 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21482 2025-12-29 cs.AI 79%

LogicLens: Visual-Logical Co-Reasoning for Text-Centric Forgery Analysis

LogicLens:面向文本导向伪造分析的视觉-逻辑协同推理

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 LogicLens通过视觉-逻辑协同推理框架,提升文本导向伪造分析的准确性和鲁棒性,其在多个基准测试中表现优异。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12140 2025-12-25 cs.CL 79%

Exploring Efficiency Frontiers of Thinking Budget in Medical Reasoning: Scaling Laws between Computational Resources and Reasoning Quality

探索医疗推理中的思维预算效率前沿:计算资源与推理质量之间的缩放规律

Ziqian Bi, Lu Chen, Junhao Song, Hongying Luo, Enze Ge, Junmin Huang, Tianyang Wang, Keyu Chen, Chia Xin Liang, Zihan Wei, Huafeng Liu, Chunjie Tian, Jibin Guan, Joe Yeong, Yongzhi Xu, Peng Wang, Xinyuan Song, Junfeng Hao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过评估医疗推理任务中的思维预算机制,揭示了计算资源与推理质量的缩放规律,并提出了不同效率阶段的优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17019 2025-12-25 cs.CV cs.AI cs.CY 79%

Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework

让安卓梦见电羊:一种受人类启发的图像隐喻理解和推理框架

Chenhao Zhang, Yazhe Niu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出LAD框架,通过三阶段方法解决图像隐喻理解问题,在多个基准测试中取得优异成绩,推动视觉语言推理和人机交互发展。

Comments 19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20403 2025-12-24 cs.LG 79%

BRIDGE: Budget-aware Reasoning via Intermediate Distillation with Guided Examples

BRIDGE:通过引导示例的中间蒸馏实现预算感知推理

Xuan-An Le, Minh-Nam Tran, Son Nguyen

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 BRIDGE通过中间蒸馏和预算不对称性,在减少教师查询的同时提升小型模型性能,实现更高效的模型蒸馏

详情

展开后加载摘要…

URL PDF HTML 收藏