arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-05 至 2026-01-05 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 12 篇

2503.12524 2026-01-05 cs.CL cs.AI 81%

EXAONE Deep: Reasoning Enhanced Language Models

EXAONE Deep:增强推理能力的语言模型

Kyunghoon Bae, Eunbi Choi, Kibong Choi, Stanley Jungkyu Choi, Yemuk Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Kijeong Jeon, Gerrard Jeongwon Jo, Hyunjik Jo, Jiyeon Jung, Hyosang Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Youchul Kim, Edward Hwayoung Lee, Haeju Lee, Honglak Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Yongmin Park, Sihoon Yang, Heuiyeen Yeen, Sihyuk Yi, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 EXAONE Deep通过训练专用推理数据集,在数学和编码任务中展现出优于同类模型的能力,并提供大模型版本供研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00029 2026-01-05 cs.AI cs.CV 79%

From Clay to Code: Typological and Material Reasoning in AI Interpretations of Iranian Pigeon Towers

从黏土到代码:AI对伊朗鸽塔的类型学与物质性解读

Abolhassan Pishahang, Maryam Badiei

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究AI对伊朗鸽塔的类型学与物质性解读,揭示AI在重建传统设计智能时的局限与创新。

Comments Proceedings of SIGraDi 2025: XXIX International Conference of the Ibero-American Society of Digital Graphics, Córdoba, Argentina, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19936 2026-01-05 cs.CV 78%

VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs

VisualQuest: 一个用于多模态大语言模型(MLLMs)抽象视觉推理的基准数据集

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * School of Computer Science and Technology, Dalian University of Technology, Dalian, China(大连理工大学计算机科学与技术学院) School of Foreign Languages, Dalian University of Technology, Dalian, China(大连理工大学外语学院) School of Computer Science and Technology, Xinjiang Normal University, Urumqi, China(新疆师范大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 VisualQuest通过风格化图像和针对性问题,评估多模态大语言模型在抽象视觉推理上的能力,发现Gemini和GPT-4o在不同任务上表现突出,揭示多模态理解的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23090 2026-01-05 cs.AI cs.LG 62%

Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients

基准成功,临床失败:当强化学习优化于基准,而非患者

Armin Berger, Manuela Bergau, Helen Schneider, Saad Ahmad, Tom Anglim Lagones, Gianluca Brugnara, Martha Foltyn-Dumitru, Kai Schlamp, Philipp Vollmuth, Rafet Sifa

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) Department of Health Queensland(昆士兰健康部) Griffith University(格里菲斯大学) University Hospital Bonn(波恩大学医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ChexReason通过低资源强化学习在医学影像基准上表现优异,但其跨数据集迁移性下降,揭示了RL范式在临床应用中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00559 2026-01-05 cs.CR cs.AI 57%

Cracking IoT Security: Can LLMs Outsmart Static Analysis Tools?

破解物联网安全:大语言模型能否超越静态分析工具?

Jason Quantrill, Noura Khajehnouri, Zihan Guo, Manar H. Alalfi

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估大语言模型在物联网交互威胁检测中的性能,发现其在语义理解上有潜力,但在结构推理方面表现不佳,需结合符号分析提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00506 2026-01-05 cs.CL 57%

Rule-Based Approaches to Atomic Sentence Extraction

基于规则的方法用于原子句子提取

Lineesha Kamana, Akshita Ananda Subramanian, Mehuli Ghosh, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过分析复杂句子结构对基于规则的原子句子提取性能的影响,提出了依赖关系提取规则,并在WikiSplit数据集上实现了较高的提取准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00254 2026-01-05 cs.SE cs.AI 57%

An Empirical Evaluation of LLM-Based Approaches for Code Vulnerability Detection: RAG, SFT, and Dual-Agent Systems

基于大型语言模型的代码漏洞检测方法实证评估:RAG、SFT和双智能体系统

Md Hasan Saju, Maher Muhtadi, Akramul Azim

机构 * Department of Electrical, Computer, and Software Engineering(电气、计算机与软件工程系) Ontario Tech University(安大略技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过实证评估,比较了RAG、SFT和双智能体系统在代码漏洞检测中的有效性,发现RAG在准确率和F1分数上表现最佳,SFT和双智能体系统也展示了良好的性能,证明了领域专业知识对LLM在实际漏洞检测中的重要性。

Journal ref https://conf.researchr.org/home/cascon-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00166 2026-01-05 cs.CL 57%

Pat-DEVAL: Chain-of-Legal-Thought Evaluation for Patent Description

Pat-DEVAL: 专利描述的法律思维链评估

Yongmin Yoo, Kris W Pan

机构 * Macquarie University(麦考瑞大学) Amazon(亚马逊公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Pat-DEVAL通过法律约束的推理机制,首次提出评估专利描述的多维框架,显著提升法律合规性评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15206 2026-01-05 cs.CV cs.LG cs.RO 57%

AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving

AutoTrust: 评估自动驾驶大视觉语言模型的可信度

Shuo Xing, Hongyuan Hua, Xiangbo Gao, Shenzhe Zhu, Renjie Li, Kexin Tian, Xiaopeng Li, Heng Huang, Tianbao Yang, Zhangyang Wang, Yang Zhou, Huaxiu Yao, Zhengzhong Tu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 AutoTrust研究自动驾驶大视觉语言模型的可信度问题,发现通用模型在可信度上优于专用模型,同时揭示DriveVLMs在隐私、安全和公平性方面的漏洞。

Comments Published at TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00777 2026-01-05 cs.SD cs.CV 50%

Investigating the Viability of Employing Multi-modal Large Language Models in the Context of Audio Deepfake Detection

探讨在音频深度伪造检测中使用多模态大语言模型的可行性

Akanksha Chuchra, Shukesh Reddy, Sudeepta Mishra, Abhijit Das, Abhinav Dhall

机构 * Indian Institute of Technology, Ropar, India(印度理工学院罗帕尔分校) Machine Intelligence Group, Birla Institute of Technology and Science, Pilani, Hyderabad Campus, India(比拉理工科学院帕利尼 Hyderabad 分校机器智能小组) Monash University, Melbourne, Australia(墨尔本大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨了多模态大语言模型在音频深度伪造检测中的可行性,通过结合音频输入与多提示方法,展示了模型在域内数据上的良好表现及潜在应用价值。

Comments Accepted at IJCB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00264 2026-01-05 cs.CV 50%

S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding

S1-MMAlign: 一个大规模、跨学科的数据集用于科学图像-文本理解

He Wang, Longteng Guo, Pengkang Huo, Xuanxu Lin, Yichen Yuan, Jie Jiang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 S1-MMAlign是一个大规模跨学科数据集,通过语义增强提升科学图像与文本的对齐质量,推动AI在科学领域的应用。

Comments 12 pages, 5 figures. Dataset available at https://huggingface.co/datasets/ScienceOne-AI/S1-MMAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00002 2026-01-05 cs.DB 50%

From Metadata to Meaning: A Semantic Units Knowledge Graph for the Biodiversity Exploratories

从元数据到意义:一个语义单元知识图谱用于生物多样性探索

Tarek Al Mustafa

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出语义单元以提升用户与知识图谱的互操作性,并展示如何利用大语言模型和嵌入模型构建结构化、FAIR元数据。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏