arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-22 至 2026-01-22 共收录 68 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 18 篇

2601.14277 2026-01-22 cs.LG 57%

Which Quantization Should I Use? A Unified Evaluation of llama.cpp Quantization on Llama-3.1-8B-Instruct

我应该使用哪种量化?对llama.cpp量化在Llama-3.1-8B-Instruct上的统一评估

Uygar Kurt

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文评估了llama.cpp不同量化方案在Llama-3.1-8B-Instruct模型上的性能,为选择合适的量化方法提供指导。

Comments 17 pages, 6 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11932 2026-01-22 cs.CV 50%

Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs

Hyperphantasia: 一个多模态大语言模型心理可视化能力评估基准

Mohammad Shahab Sepehri, Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 推理评测 :reasoning(abstract)

AI总结 Hyperphantasia是一个评估多模态大语言模型心理可视化能力的合成基准,通过四个精心设计的谜题揭示了人类与当前模型之间的性能差距,并探索了强化学习在提升视觉模拟能力上的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 6 篇

2601.14658 2026-01-22 cs.CL cs.AI 81%

Say Anything but This: When Tokenizer Betrays Reasoning in LLMs

说任何事但并非如此:当分词器背叛大语言模型的推理

Navid Ayoobi, Marcus I Armstrong, Arjun Mukherjee

机构 * University of Houston(休斯顿大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现分词器的不一致导致LLM推理错误,通过一致性探针揭示了分词引起的表征缺陷,并提出分词层面的修复方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22950 2026-01-22 cs.CL 79%

StrucSum: Graph-Structured Reasoning for Long Document Extractive Summarization with LLMs

StrucSum: 图结构推理用于基于LLM的长文档提取式摘要

Haohan Yuan, Sukhwa Hong, Haopeng Zhang

机构 * ALOHA Lab, University of Hawaii at Manoa(夏威夷大学曼纳亚分校ALOHA实验室) University of Hawaii at Hilo(夏威夷大学希洛分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 StrucSum通过图结构推理提升基于LLM的长文档提取式摘要质量,有效增强文档结构建模与关键信息识别能力。

Comments 14 pages. Accepted by the findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14862 2026-01-22 cs.LG cs.CL 62%

Strategic Doctrine Language Models (sdLM): A Learning-System Framework for Doctrinal Consistency and Geopolitical Forecasting

战略道义语言模型(sdLM):一种用于道义一致性和地缘政治预测的学习系统框架

Olaf Yunus Laitinen Imanov, Taner Yilmaz, Derya Umut Kulali

机构 * Department of Applied Mathematics and Computer Science (DTU Compute)(应用数学与计算机科学系(DTU计算)) Technical University of Denmark(丹麦技术大学) Department of Computer Engineering(计算机工程系) Afyon Kocatepe University(阿菲永卡拉伊斯大学) Department of Engineering(工程系) Eskisehir Technical University(埃斯克西赫尔技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 sdLM通过多文档注意力、时间编码和道义一致性层,提升地缘政治预测的准确性和道义一致性,优于通用大语言模型和人类专家。

Comments 13 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11509 2026-01-22 cs.CL cs.AI 62%

Does Less Hallucination Mean Less Creativity? An Empirical Investigation in LLMs

减少幻觉是否意味着减少创造力?在大语言模型中的实证研究

Mohor Banerjee, Nadya Yuki Wangsajaya, Syed Ali Redha Alsagoff, Min Sen Tan, Zachary Choy Kit Chun, Alvin Chan Guo Wei

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了三种减少幻觉的方法对大语言模型创造力的影响,发现CoVe促进发散思维,DoLa抑制创造力,RAG影响较小,为科学应用中的准确性与创造性平衡提供指导。

Comments Accepted at the AAAI 2026 Workshop on AI for Scientific Research (AI4Research)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14921 2026-01-22 cs.RO cs.AI 57%

Vision-Language Models on the Edge for Real-Time Robotic Perception

边缘计算上的视觉-语言模型用于实时机器人感知

Sarat Ahmad, Maryam Hafeez, Syed Ali Raza Zaidi

机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了在边缘计算平台上部署视觉-语言模型以提高机器人感知的实时性与准确性,通过实验对比边缘与云部署的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06658 2026-01-22 cs.SI 50%

ComGPT: Detecting Local Community Structure with Large Language Models

ComGPT:利用大语言模型检测局部社区结构

Li Ni, Haowen Shen, Lin Mu, Yiwen Zhang, Wenjian Luo

专题命中 其他推理 :reasoning(abstract)

AI总结 ComGPT通过结合大语言模型与局部模块度算法,提升社区检测任务的性能,有效解决种子依赖和社区扩散问题。

Journal ref IEEE Transactions on Computational Social Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏