arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-03 至 2025-12-03 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 11 篇

2512.02246 2025-12-03 cs.CL cs.AI 81%

DETAIL Matters: Measuring the Impact of Prompt Specificity on Reasoning in Large Language Models

DETAIL 重要性:测量提示特定性对大语言模型推理的影响

Olivia Kim

机构 * Emory University(埃默里大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过DETAIL框架研究提示特定性对大语言模型推理性能的影响,发现特定性提升准确性,尤其对小型模型和程序性任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02361 2025-12-03 cs.CV cs.AI 70%

VACoT: Rethinking Visual Data Augmentation with VLMs

VACoT:重新思考视觉数据增强与VLMs

Zhengzhuo Xu, Chong Sun, SiNan Du, Chen Li, Jing Lyu, Chun Yuan

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc(腾讯微信视觉部门)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 VACoT通过在推理过程中动态调用图像增强,提升VLMs在挑战性和分布外输入中的鲁棒性,特别是在OCR对抗场景中,通过高效的智能强化学习减少训练开销并增强感知任务的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00663 2025-12-03 cs.CL cs.AI 62%

Graphing the Truth: Structured Visualizations for Automated Hallucination Detection in LLMs

图示真相:用于自动幻觉检测的结构化可视化

Tanmay Agrawal

机构 * Department of Computer Science, University of Arizona(计算机科学系,亚利桑那大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过结构化可视化技术,帮助自动检测大型语言模型中的幻觉问题,提升模型可靠性和响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03001 2025-12-03 cs.AI 57%

Invasive Context Engineering to Control Large Language Models

侵入式上下文工程以控制大语言模型

Thomas Rivasseau

机构 * McGill University(麦吉尔大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出侵入式上下文工程方法,通过在LLM上下文中插入控制句子以提升其安全性,避免长上下文场景下的数据短缺问题。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02280 2025-12-03 cs.AI cs.CV 57%

Bridging the Gap: Toward Cognitive Autonomy in Artificial Intelligence

弥合差距:迈向人工智能的认知自主性

Noorbakhsh Amiri Golilarz, Sindhuja Penchala, Shahram Rahimi

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了人工智能在自我监控、自我纠正和自主调节方面的能力不足,并提出基于神经认知原理的架构以实现认知自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02337 2025-12-03 cs.LG 57%

SpecPV: Improving Self-Speculative Decoding for Long-Context Generation via Partial Verification

SpecPV:通过部分验证改进长上下文生成的自我推测解码

Zhendong Tan, Xingjun Zhang, Chaoyi Hu, Junjie Peng, Kun Xia

机构 * School of Computer Science and Technology, Xi'an Jiaotong University, Xi'an, China(计算机科学与技术学院,西安交通大学,西安,中国)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 SpecPV通过部分验证和周期性完整验证提升长上下文生成效率,实现6倍解码加速

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02069 2025-12-03 cs.CR cs.AI 57%

Large Language Model based Smart Contract Auditing with LLMBugScanner

基于大型语言模型的智能合约审计与LLMBugScanner

Yining Yuan, Yifei Wang, Yichang Xu, Zachary Yahn, Sihao Hu, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 LLMBugScanner通过结合领域知识适应和集成推理,提升智能合约漏洞检测的鲁棒性和泛化能力,提供了一种高效且可扩展的审计框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02654 2025-12-03 cs.CR 50%

Cybersecurity AI: The World's Top AI Agent for Security Capture-the-Flag (CTF)

网络安全AI:世界顶级AI安全夺旗赛(CTF)

Víctor Mayoral-Vilches, Luis Javier Navarrete-Lozano, Francesco Balassone, María Sanz-Gómez, Cristóbal R. J. Veas Chavez, Maite del Mundo de Torres, Vanesa Turiel

专题命中 其他推理 :reasoning(abstract)

AI总结 2025年,网络安全AI在多个顶级CTF比赛中超越人类队伍,通过高效模型实现安全操作的突破,推动CTF赛事向更具挑战性的攻防格式转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01853 2025-12-03 cs.CV 50%

COACH: Collaborative Agents for Contextual Highlighting -- A Multi-Agent Framework for Sports Video Analysis

COACH:基于上下文高亮的协作代理——一种多代理框架用于体育视频分析

Tsz-To Wong, Ching-Chun Huang, Hong-Han Shuai

专题命中 其他推理 :reasoning(abstract)

AI总结 COACH提出一种多代理框架,通过协作代理实现体育视频分析中的上下文高亮,提升时间层次结构的理解与跨任务适应性。

Comments Accepted by AAAI 2026 Workshop LaMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02329 2025-12-03 cs.SE 50%

Towards autonomous normative multi-agent systems for Human-AI software engineering teams

迈向自主规范的多智能体系统用于人机软件工程团队

Hoa Khanh Dam, Geeta Mahala, Rashina Hoda, Xi Zheng, Cristina Conati

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出自主规范的多智能体系统,通过大型语言模型赋能,实现人机协作的高效软件开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00360 2025-12-03 cs.PL 50%

ChopChop: a Programmable Framework for Semantically Constraining the Output of Language Models

ChopChop: 一种可编程框架,用于对语言模型输出进行语义约束

Shaan Nagy, Timothy Zhou, Nadia Polikarpova, Loris D'Antoni

专题命中 其他推理 :reasoning(abstract)

AI总结 ChopChop是一种可编程框架,通过语义约束提升语言模型输出的正确性和类型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏