arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-12 至 2025-12-12 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 14 篇

2512.10430 2025-12-12 cs.CL 83%

T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground

T-pro 2.0:一种高效的俄语混合推理模型与游乐场

Dmitrii Stoianov, Danil Taranets, Olga Tsymboi, Ramil Latypov, Almaz Dautov, Vladislav Kruglikov, Nikita Surkov, German Abramov, Pavel Gein, Dmitry Abulkhanov, Mikhail Gashkov, Viktor Zelenkovskiy, Artem Batalov, Aleksandr Medvedev, Anatolii Potapov

机构 * Gen-T Team T-Tech(Gen-T团队T-Tech)

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

AI总结 T-pro 2.0是一种高效的俄语混合推理模型,通过开放权重和适应后的EAGLE推测解码流水线实现快速推理和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10080 2025-12-12 cs.CL cs.AI 81%

What Kind of Reasoning (if any) is an LLM actually doing? On the Stochastic Nature and Abductive Appearance of Large Language Models

LLM 实际上在进行何种推理(如果有的话)?关于大语言模型的随机性质及其类比于人类假设推理的性质

Luciano Floridi, Jessica Morley, Claudio Novelli, David Watson

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型的推理机制,指出其生成文本基于学习模式而非真实推理,且其看似假设推理的特性源于训练数据,而非实际推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 79%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10863 2025-12-12 cs.CV cs.AI 77%

MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准

Jingli Lin, Runsen Xu, Shaohao Zhu, Sihan Yang, Peizhou Cao, Yunlong Ran, Miao Hu, Chenming Zhu, Yiman Xie, Yilin Long, Wenbo Hu, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Xi’an Jiaotong University(西安交通大学) University of Hong Kong(香港大学) Fudan University(复旦大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06392 2025-12-12 cs.LG cs.AI 62%

RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs

RLAX:在TPUs上为大语言模型实现大规模分布式强化学习

Runlong Zhou, Lefan Zhang, Shang-Chen Wu, Kelvin Zou, Hanzhi Zhou, Ke Ye, Yihao Feng, Dong Yin, Alex Guillen Garcia, Dmytro Babych, Rohit Chatterjee, Matthew Hopkins, Xiang Kong, Chang Lan, Lezhi Li, Yiping Ma, Daniele Molinari, Senyu Tong, Yanchao Sun, Thomas Voice, Jianyu Wang, Chong Wang, Simon Wang, Floris Weers, Yechen Xu, Guolin Yin, Muyang Yu, Yi Zhang, Zheng Zhou, Danyang Zhuo, Ruoming Pang, Cheng Leong

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RLAX在TPUs上实现大规模分布式强化学习,通过参数服务器架构和新数据集筛选技术,提升大语言模型的推理能力。

Comments The submission is being withdrawn because internal stakeholders determined that it is not appropriate to publish work on this topic at this time

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11375 2025-12-12 cs.AI cs.CL 62%

Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables

在化学表格上评估多模态大语言模型的基准测试

Yitong Zhou, Mingyue Cheng, Qingyang Mao, Yucong Luo, Qi Liu, Yupeng Li, Xiaohan Zhang, Deguang Liu, Xin Li, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Artificial Intelligence Research Institute(人工智能研究院) iFLYTEK Co., Ltd(iFLYTEK公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChemTable基准,用于评估多模态模型在理解化学表格中的能力,揭示了现有模型在跨模态对齐和领域推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01951 2025-12-12 cs.AI cs.CL cs.CY 62%

The LLM Wears Prada: Analysing Gender Bias and Stereotypes through Online Shopping Data

大语言模型穿Prada:通过在线购物数据分析性别偏见和刻板印象

Massimiliano Luca, Ciro Beneduce, Bruno Lepri, Jacopo Staiano

机构 * University of Trento(特伦托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过在线购物数据分析大语言模型中的性别偏见,发现模型在性别预测中受刻板印象影响,且减少偏见指令只能降低预测确定性,无法消除刻板印象模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL 57%

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10384 2025-12-12 cs.CV cs.AI 57%

Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies

基于大视觉语言模型的细粒度识别:基准测试与优化策略

Cong Pang, Hongtao Yu, Zixuan Chen, Lewei Lu, Xin Lou

机构 * ShanghaiTech University(上海科技大学) Southeast University(东南大学) SenseTime Research(商汤科技研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FROW基准测试和优化策略,通过马赛克数据和开放世界数据提升大视觉语言模型的细粒度识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08868 2025-12-12 cs.AI 57%

EcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerce

EcomBench: 向电子商务基础智能体的全面评估迈进

Rui Min, Zile Qiao, Ze Xu, Jiawen Zhai, Wenyu Gao, Xuanzhong Chen, Haozhen Sun, Zhen Zhang, Xinyu Wang, Hong Zhou, Wenbiao Yin, Bo Zhang, Xuan Zhou, Ming Yan, Yong Jiang, Haicheng Liu, Liang Ding, Ling Zou, Yi R. Fung, Yalong Li, Pengjun Xie

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EcomBench通过真实电子商务场景评估智能体的核心能力,提供动态测试环境以衡量其在实际决策中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05647 2025-12-12 cs.CL 57%

A Greek Government Decisions Dataset for Public-Sector Analysis and Insight

一个用于公共部门分析与洞察的希腊政府决策数据集

Giorgos Antoniou, Giorgos Filandrianos, Aggelos Vlachos, Giorgos Stamou, Lampros Kollimenos, Konstantinos Skianis, Michalis Vazirgiannis

机构 * National Technical University of Athens, Greece(希腊国家技术大学) University of Thessaly, Greece(希腊塞萨洛尼基大学) University of Ioannina, Greece(希腊伊奥安尼纳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出了一种大规模公共部门语料库,用于分析和生成公共决策信息,支持高级信息检索和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22888 2025-12-12 cs.CL 57%

When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy

当模型用你的语言思考:控制思考语言会以准确性为代价

Jirui Qi, Shan Chen, Zidi Xiong, Raquel Fernández, Danielle S. Bitterman, Arianna Bisazza

机构 * University of Groningen(格罗宁根大学) Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现,强制模型用用户语言推理虽提高可读性但降低准确性,通过微调可缓解此矛盾,揭示当前大型推理模型在多语言推理上的局限性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10619 2025-12-12 cs.CV 50%

DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM

DOCR-Inspector: 基于VLM的文档解析细粒度与自动化评估

Qintong Zhang, Junyuan Zhang, Zhifei Ren, Linke Ouyang, Zichen Wen, Junbo Niu, Yuan Qu, Bin Wang, Ka-Ho Chow, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) The University of HongKong(香港大学) Shanghai Jiaotong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 DOCR-Inspector通过细粒度错误检测和分析,提供文档解析质量的自动化评估,优于现有商业和开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10487 2025-12-12 cs.CR 50%

LLM-Assisted AHP for Explainable Cyber Range Evaluation

基于大语言模型的AHP可解释性网络评估

Vyron Kampourakis, Georgios Kavallieratos, Georgios Spathoulas, Vasileios Gkioulos, Sokratis Katsikas

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于大语言模型的AHP方法,用于可解释性网络评估,通过多准则决策方法评估CR平台的技术真实性和其他关键因素,实现一致的评估标准和可重复的对比结果。

详情

展开后加载摘要…

URL PDF HTML 收藏