arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-26 至 2025-11-26 共收录 71 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2507.10007 2025-11-26 cs.AI 89%

Deep Hidden Cognition Facilitates Reliable Chain-of-Thought Reasoning

深度隐式认知促进可靠推理链推理

Zijun Chen, Wenbo Hu, Richang Hong

机构 * Zijun Chen, Wenbo Hu, Richang Hong Corresponding Author(对应作者)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract);self-correction(abstract)

AI总结 本文提出利用模型内在真实性编码提升CoT推理的可靠性,通过置信度预测器和束搜索优化推理路径,显著提高数学、符号和常识推理任务的准确性和可靠性。

Comments This paper has been accepted by AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07154 2025-11-26 cs.LG cs.AI 88%

Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning

重新思考扩展测试时间计算时的微调:限制置信度可提升数学推理

Feng Chen, Allan Raventos, Nan Cheng, Surya Ganguli, Shaul Druckmann

机构 * Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.AI、cs.LG

AI总结 通过限制模型置信度改进数学推理,研究发现传统交叉熵损失与测试时间策略pass@N存在不一致,提出改进的训练损失以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03151 2025-11-26 cs.CL cs.LG 81%

Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning (v1)

为何推理重要?多模态推理的进展综述(v1)

Jing Bi, Susan Liang, Xiaofei Zhou, Pinxin Liu, Junjia Guo, Yunlong Tang, Luchuan Song, Chao Huang, Ali Vosoughi, Guangyu Sun, Jinxi He, Jiarui Wu, Shu Yang, Daoan Zhang, Chen Chen, Lianggong Bruce Wen, Zhang Liu, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Central Florida(中央佛罗里达大学) Corning Inc.(康宁公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文综述了多模态推理的进展,探讨了推理在多模态任务中的挑战与优化方法,为未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19822 2025-11-26 cs.LG cs.AI 73%

Mosaic Pruning: A Hierarchical Framework for Generalizable Pruning of Mixture-of-Experts Models

拼图剪枝:一种用于混合专家模型通用剪枝的分层框架

Wentao Hu, Mingkuan Zhao, Shuangyong Song, Xiaoyan Zhu, Xin Lai, Jiayin Wang

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 拼图剪枝通过分层框架实现混合专家模型的通用剪枝,提升模型在多样化下游任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2511.17645 2025-11-26 cs.LG cs.AI cs.CL 67%

BlockCert: Certified Blockwise Extraction of Transformer Mechanisms

BlockCert: Transformer机制的认证分块提取

Sandro Andric

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BlockCert通过认证分块提取Transformer机制,提供可验证的误差界和覆盖率指标,实验证明其在多个模型上有效且具有实际应用价值。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2511.20344 2025-11-26 cs.CL 88%

The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language Models

类比的奇特案例:在大型语言模型中探讨类比推理

Taewhoo Lee, Minju Song, Chanwoong Yoon, Jungwoo Park, Jaewoo Kang

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL

AI总结 本研究探讨了大型语言模型在类比推理中的能力,发现其在编码和应用高层关系概念方面表现出有限但新兴的能力,揭示了与人类认知的相似性和差距。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19914 2025-11-26 cs.RO 67%

CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model

CoC-VLA: 深入研究对抗域转移以实现可解释的自动驾驶 via 链式因果视觉语言动作模型

Dapeng Zhang, Fei Shen, Rui Zhao, Yinda Chen, Peng Zhi, Chenyang Li, Rui Zhou, Qingguo Zhou

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 CoC-VLA通过链式因果视觉语言动作模型实现对抗域转移,提升自动驾驶的可解释性和长尾场景处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20540 2025-11-26 cs.LO cs.AI cs.GT cs.MA 57%

Proceedings Twentieth Conference on Theoretical Aspects of Rationality and Knowledge

第二十届理性与知识理论研讨会会议纪要

Adam Bjorndahl

机构 * Edited by: Adam Bjorndahl(编辑:Adam Bjorndahl)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 TARK 2025会议收录了关于理性与知识理论的最新研究成果,涵盖知识、信念、博弈论等多个领域。

Journal ref EPTCS 437, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00882 2025-11-26 cs.CR 50%

VULSOLVER: Vulnerability Detection via LLM-Driven Constraint Solving

通过LLM驱动的约束求解进行漏洞检测:VULSOLVER

Xiang Li, Yueci Su, Jiahao Liu, Zhiwei Lin, Yuebing Hou, Peiming Gao, Yuanchao Zhang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 VULSOLVER通过LLM驱动的约束求解方法,实现高精度漏洞检测,准确率达97.85%

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 18 篇

2511.19648 2025-11-26 cs.CL cs.AI 84%

Efficient Multi-Hop Question Answering over Knowledge Graphs via LLM Planning and Embedding-Guided Search

通过LLM规划和嵌入引导搜索实现高效的多跳知识图谱问答

Manil Shrestha, Edward Kim

机构 * Department of Computer Science, Drexel University, Philadelphia, PA, USA(计算机科学系,德雷塞尔大学,费城,宾夕法尼亚州,美国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出两种混合算法,通过LLM规划和嵌入引导搜索实现高效且可验证的多跳知识图谱问答,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19912 2025-11-26 cs.CV cs.RO 82%

Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving

Reasoning-VLA: 一种用于自动驾驶的快速且通用的视觉-语言-动作推理模型

Dapeng Zhang, Zhenlong Yuan, Zhangquan Chen, Chih-Ting Liao, Yinda Chen, Fei Shen, Qingguo Zhou, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of New South Wales(新南威尔士大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 Reasoning-VLA通过引入可学习的动作查询和链式思维推理的数据格式,实现了在自动驾驶中快速且通用的视觉-语言-动作推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16274 2025-11-26 cs.LG cs.AI cs.DC cs.PF 81%

STAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning

STAlloc:通过时空规划提升大规模模型训练的内存效率

Zixiao Huang, Junhao Hu, Hao Lin, Chunyang Zhu, Yueran Tang, Quanlu Zhang, Zhen Guo, Zhenhua Li, Shengen Yan, Zhenhua Zhu, Guohao Dai, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence AI Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 STAlloc通过结合离线规划与在线分配,有效减少大规模模型训练中的内存碎片化,提升训练效率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10037 2025-11-26 cs.AI 79%

Beyond ReAct: A Planner-Centric Framework for Complex Tool-Augmented LLM Reasoning

超越ReAct:一种以规划为中心的框架,用于复杂工具增强的大语言模型推理

Xiaolong Wei, Yuehu Dong, Xingliang Wang, Xingyu Zhang, Zhejun Zhao, Dongdong Shen, Long Xia, Dawei Yin

专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.AI

AI总结 本文提出了一种以规划为中心的框架,通过全局DAG规划和两阶段训练方法,提升复杂工具增强LLM的推理能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02966 2025-11-26 cs.CV cs.AI 77%

KEPT: Knowledge-Enhanced Prediction of Trajectories from Consecutive Driving Frames with Vision-Language Models

KEPT: 基于视觉-语言模型的连续驾驶帧轨迹预测增强方法

Yujin Wang, Tianyi Wang, Quanfeng Liu, Wenxian Fan, Junfeng Jiao, Christian Claudel, Yunbing Yan, Bingzhao Gao, Jianqiang Wang, Hong Chen

专题命中 规划推理 :chain-of-thought(abstract);CoT(abstract);planning(abstract);分类 cs.AI

AI总结 KEPT 通过知识增强的视觉-语言模型,利用时间频率-空间融合编码器和检索增强生成流水线,提升自动驾驶中轨迹预测的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18428 2025-11-26 cs.AI cs.CL 73%

Multi-Modal Data Exploration via Language Agents

通过语言代理进行多模态数据探索

Farhad Nooralahzadeh, Yi Zhang, Jonathan Furst, Kurt Stockinger

机构 * Zurich University of Applied Sciences(瑞士应用科学大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M$^2$EX系统,通过语言代理实现多模态数据探索,优于现有系统在准确性和性能指标上

Comments Accepted to the IJCNLP AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17967 2025-11-26 cs.LG cs.AI cs.CV 73%

Adapting Vision-Language Models for Evaluating World Models

为世界模型评估适应视觉-语言模型

Mariya Hendriksen, Tabish Rashid, David Bignell, Raluca Georgescu, Abdelhak Lemkhenter, Katja Hofmann, Sam Devlin, Sarah Parisot

机构 * University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出UNIVERSE,一种基于视觉-语言模型的视频世界模型评估器,通过适应不同任务格式和数据约束,实现了细粒度、时间敏感的评估,与任务特定检查点性能相当,并在多种环境中验证了其与人类判断的一致性。

Comments NeurIPS LAW 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19691 2025-11-26 cs.RO 71%

Multi-Agent gatekeeper: Safe Flight Planning and Formation Control for Urban Air Mobility

多智能体守门人:面向城市空中交通的安全飞行规划与编队控制

Thomas Marshall Vielmetti, Devansh R Agrawal, Dimitra Panagou

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Department of Robotics(机器人学系) Department of Robotics and Department of Aerospace Engineering(机器人学系和航空航天工程系)

专题命中 规划推理 :planning(title)

AI总结 多智能体守门人框架通过安全轨迹备份和碰撞避免算法,实现城市空中交通中的安全飞行规划与编队控制。

Comments 13 pages, 4 figures, to appear AIAA SciTech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02630 2025-11-26 cs.CR cs.AI 70%

AI Agents Under Threat: A Survey of Key Security Challenges and Future Pathways

AI代理面临威胁:关键安全挑战与未来路径的综述

Zehang Deng, Yongjian Guo, Changzhou Han, Wanlun Ma, Junwu Xiong, Sheng Wen, Yang Xiang

机构 * Swinburne University of Technology(斯威本理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了AI代理面临的关键安全挑战,分析了四个关键知识缺口,并探讨了未来安全防护的发展路径。

Comments Submitted to ACM Computing Survey

Journal ref ACM Computing Surveys, Vol. 57, No. 7, Article 182 (July 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20315 2025-11-26 cs.LG cs.AI cs.CL 67%

Geometry of Decision Making in Language Models

语言模型中决策机制的几何学

Abhinav Joshi, Divyanshu Bhatt, Ashutosh Modi

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过分析语言模型中隐藏表示的内在维度,揭示了模型如何通过低维流形结构实现多选问答任务中的决策过程,提供了语言模型泛化和推理机制的几何学视角。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20048 2025-11-26 cs.AI cs.LG cs.PF 62%

Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design

通过基于猜测的算法-系统联合设计降低LLM搜索代理的延迟

Zixiao Huang, Wen Zeng, Tianyu Fu, Tengxuan Liu, Yizhou Sun, Ke Hong, Xinhao Yang, Chengchun Liu, Yan Li, Quanlu Zhang, Guohao Dai, Zhenhua Zhu, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence Lenovo(联想) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SPAgent通过基于猜测的算法-系统联合设计框架,减少LLM搜索代理的延迟,实现端到端加速并保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20590 2025-11-26 cs.MA cs.AI cs.SE 57%

EnergyTwin: A Multi-Agent System for Simulating and Coordinating Energy Microgrids

EnergyTwin: 一种用于模拟和协调能源微电网的多智能体系统

Jakub Muszyński, Ignacy Walużenicz, Patryk Zan, Zofia Wrona, Maria Ganzha, Marcin Paprzycki, Costin Bădică

机构 * Warsaw University of Technology(华沙技术大学) Systems research Institute Polish Academy of Sciences(波兰科学院系统研究 institute) University of Technology and Arts(技术与艺术大学) University of Craiova(克劳日瓦大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 EnergyTwin是一种基于智能体的微电网模拟环境,结合物理建模与预测驱动的滚动时间规划,用于提升微电网的韧性和能源自给率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20284 2025-11-26 cs.CR cs.AI 57%

Can LLMs Make (Personalized) Access Control Decisions?

LLMs能否做出(个性化)访问控制决策?

Friederike Groschupp, Daniele Lain, Aritra Dhar, Lara Magdalena Lazier, Srdjan Čapkun

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Computing Systems Lab, Huawei Technologies Switzerland AG(华为技术瑞士有限公司计算系统实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究LLMs在访问控制决策中的应用,发现其能有效反映用户偏好,但个性化可能影响安全实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19644 2025-11-26 cs.CR cs.AI 57%

IRSDA: An Agent-Orchestrated Framework for Enterprise Intrusion Response

IRSDA:面向企业入侵响应的智能体协调框架

Damodar Panigrahi, Raj Patel, Shaswata Mitra, Sudip Mittal, Shahram Rahimi

机构 * Mississippi State University(密苏里州立大学) The University of Alabama(阿拉巴马大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 IRSDA是一种基于智能体的入侵响应框架,结合自适应计算与知识引导循环,实现自动化防御和政策合规性,提升企业网络安全响应效率与可解释性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04042 2025-11-26 cs.RO cs.AI 57%

An LLM-based Framework for Human-Swarm Teaming Cognition in Disaster Search and Rescue

基于大语言模型的灾难搜索救援中人-群智能协同认知框架

Kailun Ji, Xiaoyu Hu, Xinyu Zhang, Jun Chen

机构 * School of Electronics and Information, Northwestern Polytechnical University(电子工程学院,西北工业大学) Chongqing Institute for Brain and Intelligence, Guangyang Bay Laboratory(脑科学与智能研究院,广阳湾实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的LLM-CRF系统,通过自然交互捕捉意图并实现任务规划,显著提升灾难救援任务效率与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23053 2025-11-26 cs.LG cs.DC 57%

AirFed: A Federated Graph-Enhanced Multi-Agent Reinforcement Learning Framework for Multi-UAV Cooperative Mobile Edge Computing

AirFed: 一种基于联邦图增强的多智能体强化学习框架,用于多无人机协同移动边缘计算

Zhiyu Wang, Suman Raj, Rajkumar Buyya

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 AirFed通过联邦图增强的多智能体强化学习框架,解决多无人机协同移动边缘计算中的轨迹规划、任务卸载和资源分配问题,实现高效知识共享和显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12051 2025-11-26 cs.CL 57%

MedS$^3$: Towards Medical Slow Thinking with Self-Evolved Soft Dual-sided Process Supervision

MedS$^3$: 向医疗慢思考迈进的自演化软双过程监督

Shuyang Jiang, Yusheng Liao, Zhe Chen, Ya Zhang, Yanfeng Wang, Yu Wang

机构 * footnotemark: 1 Corresponding Authors(通讯作者)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 MedS3通过自演化框架和软双过程奖励模型,提升医疗领域小模型的推理能力,实验显示其在准确率上优于现有最佳模型。

Comments 20 pages;Accepted as a Main paper at AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19580 2025-11-26 cs.CY cs.AI cs.HC 57%

Towards Synergistic Teacher-AI Interactions with Generative Artificial Intelligence

迈向生成人工智能的协同教师-人工智能互动

Mutlu Cukurova, Wannapon Suraworachet, Qi Zhou, Sahan Bulathwela

机构 * UCL Knowledge Lab(伦敦大学学院知识实验室) Institute of Education(教育研究所) University College London(伦敦大学学院) UCL Centre for Artificial Intelligence(伦敦大学人工智能中心) Department of Computer Science(计算机科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出教师与生成人工智能协同的五个层次,探讨如何通过协作决策提升教师与AI的共同能力,以实现教育中的伦理和实践协同。

Comments 18 pages, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 8 篇

2509.13733 2025-11-26 cs.RO 82%

FSR-VLN: Fast and Slow Reasoning for Vision-Language Navigation with Hierarchical Multi-modal Scene Graph

基于分层多模态场景图的视觉语言导航:快速与慢速推理

Xiaolin Zhou, Tingyang Xiao, Liu Liu, Yucheng Wang, Maiyue Chen, Xinrui Meng, Xinjie Wang, Wei Feng, Wei Sui, Zhizhong Su

机构 * Horizon Robotics D-Robotics Robotics

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 FSR-VLN通过分层多模态场景图与快速-慢速推理机制,提升视觉语言导航的效率与准确性,实现低延迟高成功率的导航性能。

Comments Demo video are available at https://horizonrobotics.github.io/robot_lab/fsr-vln/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19773 2025-11-26 cs.AI cs.CL cs.CV 81%

Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

在视觉语言模型中实现工具集成推理的规模化代理强化学习

Meng Lu, Ran Xu, Yi Fang, Wenxuan Zhang, Yue Yu, Gaurav Srivastava, Yuchen Zhuang, Mohamed Elhoseiny, Charles Fleming, Carl Yang, Zhengzhong Tu, Yang Xie, Guanghua Xiao, Hanrui Wang, Di Jin, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) Emory University(埃默里大学) KAUST(阿联酋卡塔尔大学) Georgia Tech(佐治亚理工学院) Cisco(思科系统) TAMU(德克萨斯大学奥斯汀分校) UT Southwestern Medical Center(德克萨斯西南医学中心) Eigen AI

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出VISTA-Gym,通过多轮轨迹采样和端到端强化学习,提升视觉语言模型的工具集成推理能力,在多个基准测试中取得显著优势。

Comments 17 pages, 9 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19526 2025-11-26 cs.CV 78%

Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models

感知分类:评估和引导视觉语言模型中的层次场景推理

Jonathan Lee, Xingrui Wang, Jiawei Peng, Luoxin Ye, Zehan Zheng, Tiezheng Zhang, Tao Wang, Wufei Ma, Siyi Chen, Yu-Cheng Chou, Prakhar Kaushik, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出感知分类基准测试,旨在评估和引导视觉语言模型在层次场景推理中的能力,揭示模型在属性驱动推理上的不足,并展示通过上下文示例提升性能的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏