arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-23 至 2025-12-23 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 21 篇

2512.17911 2025-12-23 cs.CL cs.AI cs.LG 85%

Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models

面向多模态大语言模型的推理保留反学习

Hongji Li, Junchi yao, Manjiang Yu, Priyanka Singh, Xue Li, Di Wang, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) University of Queensland(昆士兰大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任人工智能与数据分析实验室) King Abdullah University of Science and Technology (KAUST)(卡塔尔科学与技术大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出R-MUSE框架,通过子空间指导和自适应引导,在推理过程中有效消除多模态大语言模型中的推理痕迹,同时保留通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19317 2025-12-23 cs.AI 83%

SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models

SafeMed-R1: 为视觉-语言模型中的通用性和鲁棒性医疗推理设计的对抗强化学习

A. A. Gde Yogi Pramana, Jason Ray, Anthony Jaya, Michael Wijaya

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 SafeMed-R1通过对抗训练与组相对策略优化提升视觉-语言模型在医疗推理中的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19526 2025-12-23 cs.AI 79%

QuantiPhy: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models

QuantiPhy:一种评估视觉-语言模型物理推理能力的定量基准

Li Puyin, Tiange Xiang, Ella Mao, Shirley Wei, Xinye Chen, Adnan Masood, Li Fei-fei, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 QuantiPhy通过定量评估视觉-语言模型的物理推理能力,揭示其在运动学属性推断中的数值准确性与定性合理性之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18906 2025-12-23 cs.CL 79%

Remedy-R: Generative Reasoning for Machine Translation Evaluation without Error Annotations

Remedy-R:无错误标注的机器翻译评估生成推理

Shaomu Tan, Ryosuke Mitani, Ritvik Choudhary, Qiyu Wu, Toshiyuki Sekiya, Christof Monz

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Remedy-R是一种无需错误标注的生成式机器翻译评估方法,通过强化学习训练,提供可解释的评估和翻译改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17602 2025-12-23 cs.CL 79%

LexChain: Modeling Legal Reasoning Chains for Chinese Tort Case Analysis

LexChain:为中文侵权案件分析建模法律推理链

Huiyuan Xie, Chenyang Li, Huining Zhu, Chubin Zhang, Yuxiao Ye, Zhenghao Liu, Zhiyuan Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出LexChain框架,用于显式建模中国侵权案件中的法律推理过程,通过构建评估基准和基线方法,提升了语言模型在民事侵权分析中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15210 2025-12-23 cs.CL cs.IR 79%

Deliberation on Priors: Trustworthy Reasoning of Large Language Models on Knowledge Graphs

对先验的探讨:大型语言模型在知识图谱上的可信推理

Jie Ma, Ning Qu, Zhitao Gao, Rui Xing, Jun Liu, Hongbin Pei, Jiang Xie, Linyun Song, Pinghui Wang, Jing Tao, Zhou Su

机构 * MOE KLINNS Lab, Xi’an Jiaotong University(MOE KLINNS实验室,西安交通大学) School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) School of Artificial Intelligence, Chongqing University of Post and Telecommunications(人工智能学院,重庆邮电大学) School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出DP框架,通过整合知识图谱的结构和约束先验,提升大型语言模型在知识图谱上的推理准确性和响应可靠性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI 74%

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17436 2025-12-23 cs.CV 67%

Xiaomi MiMo-VL-Miloco Technical Report

小米 MiMo-VL-Miloco 技术报告

Jiaze Li, Jingyang Chen, Yuxun Qu, Shijie Xu, Zhenru Lin, Junyou Zhu, Boshen Xu, Wenhui Tan, Pei Fu, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Xiaomi(小米)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 小米提出 MiMo-VL-Miloco 模型,专为家庭场景设计,通过两阶段训练提升多模态推理与家庭场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18014 2025-12-23 cs.CL cs.AI cs.LG 67%

ReGal: A First Look at PPO-based Legal AI for Judgment Prediction and Summarization in India

ReGal:基于PPO的法律AI在印度判决预测和摘要中的初步探索

Shubham Kumar Nigam, Tanuj Tyagi, Siddharth Shukla, Aditya Kumar Guru, Balaramamahanthi Deepak Patnaik, Danush Khanna, Noel Shallum, Kripabandhu Ghosh, Arnab Bhattacharya

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReGal通过PPO结合多任务指令微调与强化学习,探索法律AI在印度判决预测和摘要中的应用,揭示了强化学习在法律文本中的挑战与潜力。

Comments Accepted in AILaw @ AAAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19428 2025-12-23 cs.LG cs.AI math.AG 62%

Attention Is Not What You Need

注意力不是你需要的

Zhang Chong

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于格拉斯曼流的无注意力架构,通过低秩子空间操作实现更结构化的神经推理,实验显示其在语言建模和自然推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18309 2025-12-23 cs.LG cs.AI 62%

Embedded Safety-Aligned Intelligence via Differentiable Internal Alignment Embeddings

通过可微内部对齐嵌入实现嵌入式安全对齐智能

Harsh Rathva, Ojas Srivastava, Pruthwik Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布尔·尼尔达理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出嵌入式安全对齐智能框架,通过可微内部对齐嵌入实现多智能体强化学习中的安全对齐,探讨了反事实对齐惩罚、感知注意力等机制及理论性质。

Comments 32 pages, 1 figure. Theoretical framework; no empirical results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19210 2025-12-23 cs.AI 61%

Observer, Not Player: Simulating Theory of Mind in LLMs through Game Observation

观察者,而非玩家:通过游戏观察模拟大语言模型中的理论心理论

Jerry Wang, Ting Yiu Liu

机构 * Department of Management Information Systems, National ChengChi University(管理信息系,国立中正大学)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI

AI总结 通过游戏观察模拟大语言模型中的理论心理论,评估其在顺序行为中的推理能力。

Comments Accepted at NeurIPS Workshop on Foundations of Reasoning in Language Models and Workshop on Bridging Language, Agent, and World Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19537 2025-12-23 cs.CL 57%

Event Extraction in Large Language Model

大规模语言模型中的事件提取

Bobo Li, Xudong Han, Jiang Liu, Yuzhe Ding, Liqiang Jing, Zhaoqi Zhang, Jinheng Li, Xinya Du, Fei Li, Meishan Zhang, Min Zhang, Aixin Sun, Philip S. Yu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Sussex(苏塞克斯大学) Wuhan University(武汉大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了大规模语言模型中事件提取的系统组件,提出通过事件方案、结构和存储提升事件处理的可靠性与智能体准备性。

Comments 38 pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19350 2025-12-23 cs.AI 57%

PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models

PENDULUM: 一个用于评估多模态大语言模型顺从性的基准

A. B. M. Ashikur Rahman, Saeed Anwar, Muhammad Usman, Irfan Ahmad, Ajmal Mian

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18658 2025-12-23 cs.CL 57%

Does It Tie Out? Towards Autonomous Legal Agents in Venture Capital

是否会平局?迈向风险投资领域的自主法律代理

Pierre Colombo, Malik Boudiaf, Allyn Sweet, Michael Desa, Hongxi Wang, Kevin Candra, Syméon del Marmol

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种世界模型架构,旨在实现风险投资领域资本表核对的自动化,为法律智能提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17145 2025-12-23 cs.AI cs.IT math.IT 57%

Solomonoff-Inspired Hypothesis Ranking with LLMs for Prediction Under Uncertainty

受索洛蒙效应启发的基于大语言模型的假设排名用于预测中的不确定性

Josh Barber, Rourke Young, Cameron Coombe, Will Browne

机构 * Queensland University of Technology (QUT)(昆士兰理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的索洛蒙启发方法,通过简洁性和预测适应性加权假设,以提高在不确定性下的预测可靠性。

Comments 10 pages, ACRA 2025, Submitted, Accepted and Presented

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08398 2025-12-23 cs.IR cs.CL 57%

Ontology-Based Knowledge Graph Framework for Industrial Standard Documents via Hierarchical and Propositional Structuring

基于本体的知识图谱框架:通过层次化和命题化结构构建工业标准文档

Jiin Park, Hyuna Jeon, Yoonseo Lee, Jisu Hong, Misuk Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种基于本体的知识图谱框架,通过层次化和命题化结构构建工业标准文档,提升问答性能和领域知识表示能力。

Comments The authors have identified significant technical errors in the paper that invalidate the current findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13524 2025-12-23 cs.AI cs.HC 57%

FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI

FreeAskWorld: 一种面向人类的交互式闭环模拟器用于具身人工智能

Yuhang Peng, Yizhou Pan, Xinning He, Jihaoyu Yang, Xinyu Yin, Han Wang, Xiaoji Zheng, Chao Gao, Jiangtao Gong

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 FreeAskWorld通过整合大语言模型和交互式闭环模拟,提升具身人工智能在复杂社会行为和自然交互中的表现。

Comments 9 pages, 4 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14972 2025-12-23 cs.CL 57%

Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies

多模态文化安全:评估框架与对齐策略

Haoyi Qiu, Kung-Hsiang Huang, Ruichen Zheng, Jiao Sun, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出CROSS基准和CROSS-Eval框架,评估多模态模型的文化安全能力,发现提升推理能力可改善文化对齐,但需结合监督微调和偏好微调策略以增强文化合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00898 2025-12-23 cs.GR 50%

Empowering LLMs with Structural Role Inference for Zero-Shot Graph Learning

通过结构角色推理增强大语言模型用于零样本图学习

Heng Zhang, Jing Liu, Jiajun Wu, Haochen You, Lubin Gan, Yuling Shi, Xiaodong Gu, Zijian Zhang, Shuai Chen, Wenjun Huang, Jin Huang

专题命中 推理评测 :reasoning(abstract)

AI总结 DuoGLM通过双视角框架实现结构感知的图推理,提升零样本节点分类和跨领域迁移性能

Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18563 2025-12-23 cs.CV 50%

OpenView: Empowering MLLMs with Out-of-view VQA

OpenView: 通过视图外视觉问答增强大规模语言模型

Qixiang Chen, Cheng Zhang, Chi-Wing Fu, Jingwen Ye, Jianfei Cai

机构 * Monash University(墨尔本大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 OpenView通过全景图像生成多选VQA,提升大规模语言模型在视图外视觉问答任务中的性能。

Comments Code: https://github.com/q1xiangchen/OpenView

详情

展开后加载摘要…

URL PDF HTML 收藏