arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-04 至 2025-12-04 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 14 篇

2512.03082 2025-12-04 cs.CL cs.AI 81%

Alleviating Choice Supportive Bias in LLM with Reasoning Dependency Generation

通过推理依赖生成缓解LLM中的选择支持性偏见

Nan Zhuang, Wenshuo Wang, Lekai Qian, Yuxiao Wang, Boyu Cao, Qi Liu

机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过推理依赖生成缓解LLM中选择支持性偏见的方法,生成无偏推理数据并提升模型在决策任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23143 2025-12-04 cs.AI cs.LG cs.SY eess.SY 81%

MathBode: Measuring the Stability of LLM Reasoning using Frequency Response

MathBode: 通过频率响应测量大语言模型推理的稳定性

Charles L. Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MathBode通过频率响应分析大语言模型推理的稳定性,揭示系统性低通行为和相位滞后,提供可重复的动态诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03838 2025-12-04 cs.CL 79%

Training and Evaluation of Guideline-Based Medical Reasoning in LLMs

在LLM中训练和评估基于指南的医学推理

Michael Staniek, Artem Sokolov, Stefan Riezler

机构 * Computational Linguistics &(计算语言学) IWR, Heidelberg University(海德堡大学IWR部门) Google DeepMind, Berlin, Germany(谷歌DeepMind,柏林,德国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过训练LLM遵循医学共识指南,提升其推理和预测的正确性与价值正确性,改进未来临床变量的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08933 2025-12-04 cs.CL 79%

Reveal-Bangla: A Dataset for Cross-Lingual Multi-Step Reasoning Evaluation

Reveal-Bangla:用于跨语言多步推理评估的数据集

Khondoker Ittehadul Islam, Gabriele Sarti

机构 * Center for Language and Cognition (CLCG)(语言与认知中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一个孟加拉语多步推理数据集,评估了多语言模型在不同语言下的推理能力,发现推理上下文对非二元问题有帮助,但模型在利用相关推理步骤方面表现不佳。

Comments Accepted at BLP workshop @ IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19094 2025-12-04 cs.CV cs.AI 79%

SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring

SATORI-R1: 通过显式视觉锚定激励多模态推理

Chuming Shen, Wei Wei, Xiaoye Qu, Yu Cheng

机构 * Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SATORI-R1通过显式视觉锚定提升多模态推理,采用三个可验证阶段和VQA-Verify数据集,在VQA任务中实现15.7%的准确率提升。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03558 2025-12-04 cs.CV cs.CL 70%

CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding

CartoMapQA: 一个评估视觉-语言模型在制图地图理解上的基础基准数据集

Huy Quang Ung, Guillaume Habault, Yasutaka Nishimura, Hao Niu, Roberto Legaspi, Tomoki Oya, Ryoichi Kojima, Masato Taya, Chihiro Ono, Atsunori Minamikawa, Yan Liu

机构 * KDDI Research, Inc.(KDDI研究公司) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 CartoMapQA通过问答任务评估视觉-语言模型在制图地图理解上的能力,揭示了模型在地图语义和地理推理方面的不足。

Comments Accepted at SIGSPATIAL 2025 (Best paper candidates), 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18214 2025-12-04 cs.CV cs.AI cs.CL cs.LG 67%

VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety

VLSU:联合多模态理解在AI安全中的极限映射

Shruti Palaskar, Leon Gatys, Mona Abdelrahman, Mar Jacobo, Larry Lindsey, Rutika Moharir, Gunnar Lund, Yang Xu, Navid Shiee, Jeffrey Bigham, Charles Maalouf, Joseph Yitan Cheng

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VLSU通过细粒度分类和组合分析,揭示了多模态安全评估中联合理解的缺陷,为改进AI安全研究提供关键测试平台。

Comments 10 pages, 5 figures, 4 tables, detailed appendix. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03582 2025-12-04 cs.CL cs.AI 62%

Fine-grained Narrative Classification in Biased News Articles

细粒度偏见新闻文章中的叙事分类

Zeba Afroz, Harsh Vardhan, Pawan Bhakuni, Aanchal Punia, Rajdeep Kumar, Md. Shad Akhtar

机构 * Indraprastha Institute of Information Technology Delhi(印度普拉斯塔理工大学德里) Bharat Electronics Limited(巴哈特电子有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出INDI-PROP数据集和FANTA/TPTC框架,用于细粒度偏见新闻文章中的叙事分类和说服技巧识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18054 2025-12-04 cs.CL cs.LG 62%

Blu-WERP (Web Extraction and Refinement Pipeline): A Scalable Pipeline for Preprocessing Large Language Model Datasets

Blu-WERP(网络内容提取与精炼流程):一种用于预处理大语言模型数据集的可扩展流程

Gowtham, Sai Rupesh, Sanjay Kumar, Saravanan, Venkata Chaithanya

机构 * BluBridge Research(BluBridge研究机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Blu-WERP是一种用于提升大语言模型训练数据质量的高效预处理流程,通过优化Common Crawl WARC文件,显著提高了模型性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03746 2025-12-04 cs.CV cs.CL 57%

Thinking with Programming Vision: Towards a Unified View for Thinking with Images

通过编程视觉思考:迈向图像思考的统一视角

Zirun Guo, Minjie Hong, Feng Zhang, Kai Jia, Tao Jin

机构 * Zhejiang University(浙江大学) ByteDance BandAI(字节跳动BandAI)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CodeVision提出一种灵活的代码作为工具框架,通过两阶段训练提升模型对图像变化和多工具推理的鲁棒性,实验显示显著提升性能并促进新兴能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03672 2025-12-04 cs.CL 57%

Evaluating Hydro-Science and Engineering Knowledge of Large Language Models

评估大语言模型的水科学与工程知识

Shiruo Hu, Wenbo Shan, Yingjia Li, Zhiqi Wan, Xinpeng Yu, Yunjia Qi, Haotian Xia, Yang Xiao, Dingxiao Liu, Jiaru Wang, Chenxu Gong, Ruixi Zhang, Shuyue Wu, Shibo Cui, Chee Hui Lai, Wei Luo, Yubin He, Bin Xu, Jianshi Zhao

机构 * State Key Laboratory of Hydro-Science and Engineering, Department of Hydraulic Engineering(水利科学与工程国家重点实验室、水利学院) Department of Computer Science and Technology(计算机科学与技术系) Zhipu AI(智谱AI) CHN Energy Dadu River Big Data Services Co., Ltd.(中国能源大渡河大数据服务有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出Hydro-SE LLM评估基准,评估大语言模型在水科学与工程领域的知识和应用能力,揭示其优势与不足。

Comments Hydro-SE Bench sets a new benchmark for the evaluation of LLMs in the Hydro-Science and Engineering domain, with its code and data available at \url{https://github.com/sheishijun/Hydro-SE-Bench}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03064 2025-12-04 cs.SI 50%

Demographic Inference from Social Media Data with Multimodal Foundation Models: Strategies, Evaluation, and Benchmarking

从社交媒体数据中推断人口特征:多模态基础模型的策略、评估与基准测试

Hao Yang, Angela Yao, Eric Chang, Hexiang Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究利用GPT-5多模态基础模型,从社交媒体资料中推断年龄、性别和种族,展示了其在提高人口特征推断准确性、公平性和可扩展性方面的潜力。

Comments 21 pages, 10 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22826 2025-12-04 cs.CV 50%

Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs

某些模态比其他模态更平等:在MLLMs中解码和架构多模态整合

Tianle Chen, Chaitanya Chakka, Arjun Reddy Akula, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了多模态大语言模型对矛盾模态的鲁棒性,提出模态对齐调优策略以提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19582 2025-12-04 cs.CV 50%

Guard Me If You Know Me: Protecting Specific Face-Identity from Deepfakes

Kaiqing Lin, Zhiyuan Yan, Ke-Yue Zhang, Li Hao, Yue Zhou, Yuzhen Lin, Weixiang Li, Taiping Yao, Shouhong Ding, Bin Li

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-腾讯优图联合创新中心) Shenzhen University(深圳大学) School of Electronic and Computer Engineering(电子与计算机工程学院) Peking Univerisity(北京大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏