arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-05 至 2026-01-05 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 12 篇

2601.00029 2026-01-05 cs.AI cs.CV 79%

From Clay to Code: Typological and Material Reasoning in AI Interpretations of Iranian Pigeon Towers

从黏土到代码:AI对伊朗鸽塔的类型学与物质性解读

Abolhassan Pishahang, Maryam Badiei

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究AI对伊朗鸽塔的类型学与物质性解读,揭示AI在重建传统设计智能时的局限与创新。

Comments Proceedings of SIGraDi 2025: XXIX International Conference of the Ibero-American Society of Digital Graphics, Córdoba, Argentina, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19936 2026-01-05 cs.CV 78%

VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs

VisualQuest: 一个用于多模态大语言模型(MLLMs)抽象视觉推理的基准数据集

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * School of Computer Science and Technology, Dalian University of Technology, Dalian, China(大连理工大学计算机科学与技术学院) School of Foreign Languages, Dalian University of Technology, Dalian, China(大连理工大学外语学院) School of Computer Science and Technology, Xinjiang Normal University, Urumqi, China(新疆师范大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 VisualQuest通过风格化图像和针对性问题,评估多模态大语言模型在抽象视觉推理上的能力,发现Gemini和GPT-4o在不同任务上表现突出,揭示多模态理解的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23090 2026-01-05 cs.AI cs.LG 62%

Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients

基准成功,临床失败:当强化学习优化于基准,而非患者

Armin Berger, Manuela Bergau, Helen Schneider, Saad Ahmad, Tom Anglim Lagones, Gianluca Brugnara, Martha Foltyn-Dumitru, Kai Schlamp, Philipp Vollmuth, Rafet Sifa

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) Department of Health Queensland(昆士兰健康部) Griffith University(格里菲斯大学) University Hospital Bonn(波恩大学医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ChexReason通过低资源强化学习在医学影像基准上表现优异,但其跨数据集迁移性下降,揭示了RL范式在临床应用中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00559 2026-01-05 cs.CR cs.AI 57%

Cracking IoT Security: Can LLMs Outsmart Static Analysis Tools?

破解物联网安全:大语言模型能否超越静态分析工具?

Jason Quantrill, Noura Khajehnouri, Zihan Guo, Manar H. Alalfi

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估大语言模型在物联网交互威胁检测中的性能,发现其在语义理解上有潜力,但在结构推理方面表现不佳,需结合符号分析提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00506 2026-01-05 cs.CL 57%

Rule-Based Approaches to Atomic Sentence Extraction

基于规则的方法用于原子句子提取

Lineesha Kamana, Akshita Ananda Subramanian, Mehuli Ghosh, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过分析复杂句子结构对基于规则的原子句子提取性能的影响,提出了依赖关系提取规则,并在WikiSplit数据集上实现了较高的提取准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00254 2026-01-05 cs.SE cs.AI 57%

An Empirical Evaluation of LLM-Based Approaches for Code Vulnerability Detection: RAG, SFT, and Dual-Agent Systems

基于大型语言模型的代码漏洞检测方法实证评估:RAG、SFT和双智能体系统

Md Hasan Saju, Maher Muhtadi, Akramul Azim

机构 * Department of Electrical, Computer, and Software Engineering(电气、计算机与软件工程系) Ontario Tech University(安大略技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过实证评估,比较了RAG、SFT和双智能体系统在代码漏洞检测中的有效性,发现RAG在准确率和F1分数上表现最佳,SFT和双智能体系统也展示了良好的性能,证明了领域专业知识对LLM在实际漏洞检测中的重要性。

Journal ref https://conf.researchr.org/home/cascon-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00166 2026-01-05 cs.CL 57%

Pat-DEVAL: Chain-of-Legal-Thought Evaluation for Patent Description

Pat-DEVAL: 专利描述的法律思维链评估

Yongmin Yoo, Kris W Pan

机构 * Macquarie University(麦考瑞大学) Amazon(亚马逊公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Pat-DEVAL通过法律约束的推理机制,首次提出评估专利描述的多维框架,显著提升法律合规性评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15206 2026-01-05 cs.CV cs.LG cs.RO 57%

AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving

AutoTrust: 评估自动驾驶大视觉语言模型的可信度

Shuo Xing, Hongyuan Hua, Xiangbo Gao, Shenzhe Zhu, Renjie Li, Kexin Tian, Xiaopeng Li, Heng Huang, Tianbao Yang, Zhangyang Wang, Yang Zhou, Huaxiu Yao, Zhengzhong Tu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 AutoTrust研究自动驾驶大视觉语言模型的可信度问题,发现通用模型在可信度上优于专用模型,同时揭示DriveVLMs在隐私、安全和公平性方面的漏洞。

Comments Published at TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00777 2026-01-05 cs.SD cs.CV 50%

Investigating the Viability of Employing Multi-modal Large Language Models in the Context of Audio Deepfake Detection

探讨在音频深度伪造检测中使用多模态大语言模型的可行性

Akanksha Chuchra, Shukesh Reddy, Sudeepta Mishra, Abhijit Das, Abhinav Dhall

机构 * Indian Institute of Technology, Ropar, India(印度理工学院罗帕尔分校) Machine Intelligence Group, Birla Institute of Technology and Science, Pilani, Hyderabad Campus, India(比拉理工科学院帕利尼 Hyderabad 分校机器智能小组) Monash University, Melbourne, Australia(墨尔本大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨了多模态大语言模型在音频深度伪造检测中的可行性,通过结合音频输入与多提示方法,展示了模型在域内数据上的良好表现及潜在应用价值。

Comments Accepted at IJCB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00264 2026-01-05 cs.CV 50%

S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding

S1-MMAlign: 一个大规模、跨学科的数据集用于科学图像-文本理解

He Wang, Longteng Guo, Pengkang Huo, Xuanxu Lin, Yichen Yuan, Jie Jiang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 S1-MMAlign是一个大规模跨学科数据集,通过语义增强提升科学图像与文本的对齐质量,推动AI在科学领域的应用。

Comments 12 pages, 5 figures. Dataset available at https://huggingface.co/datasets/ScienceOne-AI/S1-MMAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00002 2026-01-05 cs.DB 50%

From Metadata to Meaning: A Semantic Units Knowledge Graph for the Biodiversity Exploratories

从元数据到意义:一个语义单元知识图谱用于生物多样性探索

Tarek Al Mustafa

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出语义单元以提升用户与知识图谱的互操作性,并展示如何利用大语言模型和嵌入模型构建结构化、FAIR元数据。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 6 篇

2507.11407 2026-01-05 cs.CL cs.AI 81%

EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes

EXAONE 4.0:整合非推理与推理模式的统一大语言模型

Kyunghoon Bae, Eunbi Choi, Kibong Choi, Stanley Jungkyu Choi, Yemuk Choi, Kyubeen Han, Seokhee Hong, Junwon Hwang, Taewan Hwang, Joonwon Jang, Hyojin Jeon, Kijeong Jeon, Gerrard Jeongwon Jo, Hyunjik Jo, Jiyeon Jung, Euisoon Kim, Hyosang Kim, Jihoon Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Youchul Kim, Edward Hwayoung Lee, Gwangho Lee, Haeju Lee, Honglak Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Young Min Paik, Yongmin Park, Youngyong Park, Sanghyun Seo, Sihoon Yang, Heuiyeen Yeen, Sihyuk Yi, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 EXAONE 4.0通过整合非推理与推理模式,实现了高性能与先进推理能力的统一,支持多语言并提供两种不同规模的模型版本。

Comments Technical Report, 30 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10684 2026-01-05 cs.CL cs.CY 70%

SpiderGen: Towards Procedure Generation For Carbon Life Cycle Assessments with Generative AI

SpiderGen:面向碳生命周期评估的流程生成方法

Anupama Sitaraman, Bharathan Balaji, Yuvraj Agarwal

机构 * Amazon(亚马逊)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 SpiderGen利用生成式AI生成碳生命周期评估的流程图,准确率达65%,显著降低评估成本和人力投入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00339 2026-01-05 cs.AI cs.DC cs.ET cs.MA cs.NE 57%

Bio-inspired Agentic Self-healing Framework for Resilient Distributed Computing Continuum Systems

生物启发的代理自修复框架用于鲁棒分布式计算连续系统

Alaa Saleh, Praveen Kumar Donta, Roberto Morabito, Sasu Tarkoma, Anders Lindgren, Qiyang Zhang, Schahram Dustdar, Susanna Pirttikangas, Lauri Lovén

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ReCiSt通过生物启发的代理自修复框架,实现分布式计算连续系统的快速自我修复与韧性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03402 2026-01-05 cs.CL 57%

Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates

Dual LoRA: 通过幅度和方向更新增强LoRA

Yixing Xu, Chao Li, Xuanwu Yin, Spandan Tiwari, Dong Li, Ashish Sirasao, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Dual LoRA通过引入幅度和方向更新机制,改进LoRA在参数高效微调中的性能,实验表明其在多个NLP任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07675 2026-01-05 cs.DB cs.AI 57%

QUITE: A Query Rewrite System Beyond Rules with LLM Agents

QUITE:超越规则的查询重写系统与LLM代理

Yuyang Song, Hanxu Yan, Jiale Lao, Yibo Wang, Yufei Li, Yuanchun Zhou, Jianguo Wang, Mingjie Tang

机构 * Sichuan University(四川大学) Cornell University(康奈尔大学) Purdue University(普渡大学) Hong Kong University of Science and Technology(香港科学与技术大学) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 QUITE利用LLM代理超越规则,通过多代理框架、中间件和提示注入技术实现更高效的SQL查询重写,提升性能并覆盖更广的查询模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00730 2026-01-05 cs.CV 50%

Grading Handwritten Engineering Exams with Multimodal Large Language Models

用多模态大语言模型评分手写工程考试

Janez Perš, Jon Muhovič, Andrej Košir, Boštjan Murovec

机构 * University of Ljubljana, Faculty of Electrical Engineering(卢布尔雅那大学电子工程学院)

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究利用多模态大语言模型对斯洛文尼亚语手写工程考试进行自动评分,通过多阶段设计实现高可靠性,达到与人工评分约8分的均方差,验证了结构化提示和参考定位的重要性。

Comments 10 pages, 5 figures, 2 tables. Supplementary material available at https://lmi.fe.uni-lj.si/en/janez-pers-2/supplementary-material/

详情

展开后加载摘要…

URL PDF HTML 收藏