arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-24 至 2025-12-24 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 11 篇

2512.20595 2025-12-24 cs.CL cs.AI cs.CV 84%

Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs

Cube Bench: 一个用于多模态大语言模型空间视觉推理的基准测试

Dhruv Anand, Ehsan Shareghi

机构 * Department of Data Science and AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 推理评测 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 Cube Bench通过评估多模态大语言模型在空间视觉推理中的能力,揭示了模型在复杂任务中的表现差异及自我纠正的局限性。

Comments 27 pages, 5 figures, 9 tables. Cube available at https://github.com/dana-23/cube-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20324 2025-12-24 cs.CL 83%

Can LLMs Solve My Grandma's Riddle? Evaluating Multilingual Large Language Models on Reasoning Traditional Bangla Tricky Riddles

LLMs能解决我奶奶的谜题吗?评估多语言大语言模型在推理传统孟加拉谜题上的能力

Nurul Labib Sayeedi, Md. Faiyaz Abdullah Sayeedi, Khushnur Binte Jahangir, Swakkhar Shatabda, Sarah Masud Preum

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究评估了多语言大语言模型在解决传统孟加拉谜题上的能力,发现其在推理任务中表现有限,但为低资源隐喻推理提供了新的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04826 2025-12-24 cs.CL cs.AI 81%

Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reasoning, and Conversation History

大语言模型人格测量中的持久不稳定性:规模、推理和对话历史的影响

Tommaso Tosato, Saskia Helbling, Yorguin-Jose Mantilla-Ramos, Mahmood Hegazy, Alberto Tosato, David John Lemay, Irina Rish, Guillaume Dumas

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在人格测量中存在持续不稳定性,规模扩大、推理和对话历史等干预措施未能有效提升稳定性。

Comments Accepted at AAAI 2026, Track on AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20403 2025-12-24 cs.LG 79%

BRIDGE: Budget-aware Reasoning via Intermediate Distillation with Guided Examples

BRIDGE:通过引导示例的中间蒸馏实现预算感知推理

Xuan-An Le, Minh-Nam Tran, Son Nguyen

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 BRIDGE通过中间蒸馏和预算不对称性,在减少教师查询的同时提升小型模型性能,实现更高效的模型蒸馏

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20092 2025-12-24 cs.CL 79%

Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents

Memory-T1: 基于强化学习的多会话代理时间推理

Yiming Du, Baojun Wang, Yifan Xiang, Zhaowei Wang, Wenyu Huang, Boyang Xue, Bin Liang, Xingshan Zeng, Fei Mi, Haoli Bai, Lifeng Shang, Jeff Z. Pan, Yuxin Jiang, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co.,Ltd(华为技术有限公司) HKUST(香港科技大学) The University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Memory-T1通过强化学习提升多会话代理的时间推理能力,实现7B模型在Time-Dialog基准上的67.0%高分,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20184 2025-12-24 cs.DC 78%

Reaching Agreement Among Reasoning LLM Agents

使推理LLM代理达成一致

Chaoyi Ruan, Yiliang Wang, Ziji Shi, Jialin Li

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Aegean通过引入基于共识的协议,为多代理推理提供正式模型,有效减少延迟并保持答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15649 2025-12-24 cs.CV cs.AI cs.CL 62%

VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?

VTCBench: 视觉-语言模型能否通过视觉-文本压缩理解长上下文?

Hongbo Zhao, Meng Wang, Fei Zhu, Wenzhuo Liu, Bolin Ni, Fanhu Zeng, Gaofeng Meng, Zhaoxiang Zhang

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 School of Artificial Intelligence, University of Chinese Academy of Sciences 3 Centre for Artificial Intelligence Robotics, Hong Kong Institute of Science \& Innovation, CAS 4 Independent Researcher

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 VTCBench评估视觉-文本压缩对视觉语言模型长上下文理解能力的影响,发现多数模型在处理压缩信息时表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19992 2025-12-24 cs.AI cs.CY 57%

S$^3$IT: A Benchmark for Spatially Situated Social Intelligence Test

S$^3$IT:一种用于空间情境社交智能测试的基准

Zhe Sun, Xueyuan Yang, Yujie Lu, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 S$^3$IT基准通过座位安排任务评估代理在现实情境中整合物理与社会约束的能力,揭示LLMs在空间智能上的不足及在冲突解决中的潜力。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20013 2025-12-24 cs.CV 50%

SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images

SegEarth-R2: 向远程 sensing 图像的全面语言引导分割迈进

Zepeng Xin, Kaiyu Li, Luodi Chen, Wanchen Li, Yuchen Xiao, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分支)

专题命中 推理评测 :reasoning(abstract)

AI总结 SegEarth-R2通过MLLM架构实现远程 sensing 图像的全面语言引导分割,解决复杂场景下的多目标和隐含意图识别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19990 2025-12-24 cs.CV 50%

A Dual-Branch Local-Global Framework for Cross-Resolution Land Cover Mapping

面向跨分辨率土地覆盖制图的双分支局部-全局框架

Peng Gao, Ke Li, Di Wang, Yongshan Zhu, Yiming Zhang, Xuemei Luo, Yifeng Wang

机构 * Guangzhou Institute of Technology(广州科技研究院) Xidian University(西安电子科技大学) School of Computer Science and Technology(计算机科学与技术学院) University of California(加州大学) Department of Mathematics(数学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 DDTM通过双分支框架解耦局部语义细化与全局上下文推理,提升跨分辨率土地覆盖制图的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12711 2025-12-24 cs.CV 50%

Drifting Away from Truth: GenAI-Driven News Diversity Challenges LVLM-Based Misinformation Detection

远离真相:生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测的挑战

Fanxiao Li, Jiaying Wu, Tingchao Fu, Yunyun Dong, Bingbing Song, Wei Zhou

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测系统造成的挑战,通过DriftBench基准揭示了现有系统在多级漂移下的鲁棒性问题,并指出需要更稳健的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏