arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-12 至 2025-12-12 共收录 56 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 8 篇

2410.21306 2025-12-12 cs.CL cs.AI 62%

Natural Language Processing for the Legal Domain: A Survey of Tasks, Datasets, Models, and Challenges

法律领域自然语言处理:任务、数据集、模型与挑战的综述

Farid Ariai, Joel Mackenzie, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了法律领域NLP的任务、数据集、模型及挑战,探讨了法律文本处理的独特性与现存问题,并提出了十六项开放研究挑战。

Comments 35 pages

Journal ref ACM Computing Surveys, Volume 58, Issue 6 Article No.: 163, Year: 2025, Pages 1 - 37

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13732 2025-12-12 cs.CL cond-mat.mtrl-sci cs.LG 62%

Enhancing Large Language Models with Domain-Specific Knowledge: The Case in Topological Materials

通过领域特定知识增强大型语言模型:拓扑材料案例

HuangChao Xu, Baohua Zhang, Zhong Jin, Tiannian Zhu, Quansheng Wu, Hongming Weng

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Institute of Physics, Chinese Academy of Sciences(中国科学院物理研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过构建材料知识图谱与提示学习,开发专用对话系统TopoChat,以提升拓扑材料领域的信息检索与知识交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09935 2025-12-12 cs.AI cs.LG 62%

Exploring Health Misinformation Detection with Multi-Agent Debate

探索多智能体辩论中的健康 misinformation 检测

Chih-Han Chen, Chen-Han Tsai, Yu-Shao Peng

机构 * National Taiwan University(台湾国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种两阶段框架,通过多智能体辩论与自动化评分结合,提升健康虚假信息检测的准确性与说服力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19286 2025-12-12 cs.CL 57%

TheMCPCompany: Creating General-purpose Agents with Task-specific Tools

TheMCPCompany:创建通用代理的专用工具

Reza Esfandiarpoor, Vishwas Suryanarayanan, Stephen H. Bach, Vishal Chowdhary, Anthony Aue

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 TheMCPCompany通过评估工具调用代理在现实世界服务交互中的表现,揭示了当前模型在复杂任务中的挑战。

Comments Code: https://github.com/Reza-esfandiarpoor/the-mcp-company

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16989 2025-12-12 cs.LG 57%

Unveiling the Latent Directions of Reflection in Large Language Models

揭示大型语言模型中反思的潜在方向

Fu-Chieh Chang, Yu-Ting Lee, Pei-Yuan Wu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文通过分析模型激活中的潜在方向,揭示了大型语言模型中反思机制的可控性及不同反思层次的区分。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 14 篇

2512.10430 2025-12-12 cs.CL 83%

T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground

T-pro 2.0:一种高效的俄语混合推理模型与游乐场

Dmitrii Stoianov, Danil Taranets, Olga Tsymboi, Ramil Latypov, Almaz Dautov, Vladislav Kruglikov, Nikita Surkov, German Abramov, Pavel Gein, Dmitry Abulkhanov, Mikhail Gashkov, Viktor Zelenkovskiy, Artem Batalov, Aleksandr Medvedev, Anatolii Potapov

机构 * Gen-T Team T-Tech(Gen-T团队T-Tech)

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

AI总结 T-pro 2.0是一种高效的俄语混合推理模型,通过开放权重和适应后的EAGLE推测解码流水线实现快速推理和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10080 2025-12-12 cs.CL cs.AI 81%

What Kind of Reasoning (if any) is an LLM actually doing? On the Stochastic Nature and Abductive Appearance of Large Language Models

LLM 实际上在进行何种推理(如果有的话)?关于大语言模型的随机性质及其类比于人类假设推理的性质

Luciano Floridi, Jessica Morley, Claudio Novelli, David Watson

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型的推理机制,指出其生成文本基于学习模式而非真实推理,且其看似假设推理的特性源于训练数据,而非实际推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 79%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10863 2025-12-12 cs.CV cs.AI 77%

MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准

Jingli Lin, Runsen Xu, Shaohao Zhu, Sihan Yang, Peizhou Cao, Yunlong Ran, Miao Hu, Chenming Zhu, Yiman Xie, Yilin Long, Wenbo Hu, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Xi’an Jiaotong University(西安交通大学) University of Hong Kong(香港大学) Fudan University(复旦大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06392 2025-12-12 cs.LG cs.AI 62%

RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs

RLAX:在TPUs上为大语言模型实现大规模分布式强化学习

Runlong Zhou, Lefan Zhang, Shang-Chen Wu, Kelvin Zou, Hanzhi Zhou, Ke Ye, Yihao Feng, Dong Yin, Alex Guillen Garcia, Dmytro Babych, Rohit Chatterjee, Matthew Hopkins, Xiang Kong, Chang Lan, Lezhi Li, Yiping Ma, Daniele Molinari, Senyu Tong, Yanchao Sun, Thomas Voice, Jianyu Wang, Chong Wang, Simon Wang, Floris Weers, Yechen Xu, Guolin Yin, Muyang Yu, Yi Zhang, Zheng Zhou, Danyang Zhuo, Ruoming Pang, Cheng Leong

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RLAX在TPUs上实现大规模分布式强化学习,通过参数服务器架构和新数据集筛选技术,提升大语言模型的推理能力。

Comments The submission is being withdrawn because internal stakeholders determined that it is not appropriate to publish work on this topic at this time

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11375 2025-12-12 cs.AI cs.CL 62%

Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables

在化学表格上评估多模态大语言模型的基准测试

Yitong Zhou, Mingyue Cheng, Qingyang Mao, Yucong Luo, Qi Liu, Yupeng Li, Xiaohan Zhang, Deguang Liu, Xin Li, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Artificial Intelligence Research Institute(人工智能研究院) iFLYTEK Co., Ltd(iFLYTEK公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChemTable基准,用于评估多模态模型在理解化学表格中的能力,揭示了现有模型在跨模态对齐和领域推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01951 2025-12-12 cs.AI cs.CL cs.CY 62%

The LLM Wears Prada: Analysing Gender Bias and Stereotypes through Online Shopping Data

大语言模型穿Prada:通过在线购物数据分析性别偏见和刻板印象

Massimiliano Luca, Ciro Beneduce, Bruno Lepri, Jacopo Staiano

机构 * University of Trento(特伦托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过在线购物数据分析大语言模型中的性别偏见,发现模型在性别预测中受刻板印象影响,且减少偏见指令只能降低预测确定性,无法消除刻板印象模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL 57%

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10384 2025-12-12 cs.CV cs.AI 57%

Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies

基于大视觉语言模型的细粒度识别:基准测试与优化策略

Cong Pang, Hongtao Yu, Zixuan Chen, Lewei Lu, Xin Lou

机构 * ShanghaiTech University(上海科技大学) Southeast University(东南大学) SenseTime Research(商汤科技研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FROW基准测试和优化策略,通过马赛克数据和开放世界数据提升大视觉语言模型的细粒度识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08868 2025-12-12 cs.AI 57%

EcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerce

EcomBench: 向电子商务基础智能体的全面评估迈进

Rui Min, Zile Qiao, Ze Xu, Jiawen Zhai, Wenyu Gao, Xuanzhong Chen, Haozhen Sun, Zhen Zhang, Xinyu Wang, Hong Zhou, Wenbiao Yin, Bo Zhang, Xuan Zhou, Ming Yan, Yong Jiang, Haicheng Liu, Liang Ding, Ling Zou, Yi R. Fung, Yalong Li, Pengjun Xie

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EcomBench通过真实电子商务场景评估智能体的核心能力,提供动态测试环境以衡量其在实际决策中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05647 2025-12-12 cs.CL 57%

A Greek Government Decisions Dataset for Public-Sector Analysis and Insight

一个用于公共部门分析与洞察的希腊政府决策数据集

Giorgos Antoniou, Giorgos Filandrianos, Aggelos Vlachos, Giorgos Stamou, Lampros Kollimenos, Konstantinos Skianis, Michalis Vazirgiannis

机构 * National Technical University of Athens, Greece(希腊国家技术大学) University of Thessaly, Greece(希腊塞萨洛尼基大学) University of Ioannina, Greece(希腊伊奥安尼纳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出了一种大规模公共部门语料库,用于分析和生成公共决策信息,支持高级信息检索和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22888 2025-12-12 cs.CL 57%

When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy

当模型用你的语言思考:控制思考语言会以准确性为代价

Jirui Qi, Shan Chen, Zidi Xiong, Raquel Fernández, Danielle S. Bitterman, Arianna Bisazza

机构 * University of Groningen(格罗宁根大学) Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现,强制模型用用户语言推理虽提高可读性但降低准确性,通过微调可缓解此矛盾,揭示当前大型推理模型在多语言推理上的局限性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10619 2025-12-12 cs.CV 50%

DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM

DOCR-Inspector: 基于VLM的文档解析细粒度与自动化评估

Qintong Zhang, Junyuan Zhang, Zhifei Ren, Linke Ouyang, Zichen Wen, Junbo Niu, Yuan Qu, Bin Wang, Ka-Ho Chow, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) The University of HongKong(香港大学) Shanghai Jiaotong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 DOCR-Inspector通过细粒度错误检测和分析,提供文档解析质量的自动化评估,优于现有商业和开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10487 2025-12-12 cs.CR 50%

LLM-Assisted AHP for Explainable Cyber Range Evaluation

基于大语言模型的AHP可解释性网络评估

Vyron Kampourakis, Georgios Kavallieratos, Georgios Spathoulas, Vasileios Gkioulos, Sokratis Katsikas

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于大语言模型的AHP方法,用于可解释性网络评估,通过多准则决策方法评估CR平台的技术真实性和其他关键因素,实现一致的评估标准和可重复的对比结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 7 篇

2512.10561 2025-12-12 cs.CL cs.LG 81%

Causal Reasoning Favors Encoders: On The Limits of Decoder-Only Models

因果推理更青睐编码器:关于解码器-only模型极限的探讨

Amartya Roy, Elamparithy M, Kripabandhu Ghosh, Ponnurangam Kumaraguru, Adrian de Wynter

机构 * SIRE, IIT Delhi(IIT德里SIRE) Robert Bosch GmbH, India(印度罗伯特博世集团) IIIT Hyderabad(海得拉巴IIIT) IISER Kolkata(科钦IISER) Microsoft and the University of York(微软和约克大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了因果推理中编码器和编码器-解码器架构相较于仅解码器模型的优势,发现前者在多跳联合推理和分布偏移鲁棒性方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10273 2025-12-12 cs.AI 77%

Reverse Thinking Enhances Missing Information Detection in Large Language Models

逆向思维增强大语言模型中缺失信息检测能力

Yuxin Liu, Chaojie Gu, Yihang Zhang, Bin Qian, Shibo He

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出逆向思维框架,通过引导LLM进行逆向推理来提升缺失信息检测的准确性与鲁棒性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10440 2025-12-12 cs.CL 57%

Enhancing Next-Generation Language Models with Knowledge Graphs: Extending Claude, Mistral IA, and GPT-4 via KG-BERT

通过知识图谱增强下一代语言模型:通过KG-BERT扩展Claude、Mistral IA和GPT-4

Nour El Houda Ben Chaabene, Hamza Hammami

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) National Engineering School of Tunis(突尼斯国家工程学院) Faculty of Sciences of Tunis(突尼斯科学学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 通过KG-BERT将知识图谱与Claude、Mistral IA和GPT-4结合,提升其事实可靠性与上下文感知能力。

Comments This paper was accepted and scheduled for inclusion in the ICALT 2025 proceedings but was ultimately not published due to absence from the conference presentation. It appears in the official program booklet. Conference: 2025 IEEE International Conference on Advanced Learning Technologies (ICALT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10370 2025-12-12 cs.AI 57%

LLM-Empowered Representation Learning for Emerging Item Recommendation

基于大语言模型的表示学习用于新兴物品推荐

Ziying Zhang, Quanming Yao, Yaqing Wang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing Institute of Mathematical Sciences and Applications(北京数学科学研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EmerFlow框架,利用大语言模型生成独特嵌入,通过丰富特征、对齐空间和元学习优化,提升新兴物品推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15456 2025-12-12 cs.CL 57%

Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment

教导语言模型与用户共同进化:面向个性化对齐的动态资料模型

Weixiang Zhao, Xingyu Sui, Yulin Hu, Jiahe Guo, Haixiao Liu, Biye Li, Yanyan Zhao, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出RLPA框架,通过动态资料推断提升个性化对话性能,Qwen-RLPA在多个基准测试中超越现有方法。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00791 2025-12-12 cs.CL cs.CV 57%

Vision-centric Token Compression in Large Language Model

以视觉为中心的标记压缩在大语言模型中

Ling Xing, Alex Jinpeng Wang, Rui Yan, Xiangbo Shu, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学) Nanjing Forestry University(南京林业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Vist通过视觉与语言结合的压缩方法,在减少标记数量的同时保持模型准确性,提升了大语言模型的效率。

Comments NeurIPS 2025 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10238 2025-12-12 cs.SE 50%

Studying and Automating Issue Resolution for Software Quality

研究和自动化软件质量的问题解决

Antu Saha

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究通过提升issue报告质量、表征开发者工作流程和自动化解决任务,推动AI驱动的issue解决,提升软件质量。

Comments 3 pages

详情

展开后加载摘要…

URL PDF HTML 收藏