arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-04 至 2025-12-04 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 10 篇

2512.00601 2025-12-04 cs.AI 79%

Clinical-R1: Empowering Large Language Models for Faithful and Comprehensive Reasoning with Clinical Objective Relative Policy Optimization

Clinical-R1: 通过临床目标相对策略优化赋能大语言模型进行忠实且全面的推理

Boyang Gu, Hongjian Zhou, Bradley Max Segal, Jinge Wu, Zeyu Cao, Hantao Zhong, Lei Clifton, Fenglin Liu, David A. Clifton

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Clinical-R1通过CRPO方法提升大语言模型在医学领域的推理忠实性和全面性,实现多目标强化学习优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03276 2025-12-04 cs.LG 70%

Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval

太迟回忆:多模态知识检索中双跳问题的解释

Constantin Venhoff, Ashkan Khakzar, Sonia Joseph, Philip Torr, Neel Nanda

机构 * University of Oxford(牛津大学) McGill University(麦吉尔大学) Meta MATS

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文研究了多模态知识检索中双跳问题的影响,发现VLMs在处理视觉输入时过晚解决实体表示导致事实回忆性能下降,并提出通过修补和提示方法恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00926 2025-12-04 cs.AI cs.CL 62%

LLMs Position Themselves as More Rational Than Humans: Emergence of AI Self-Awareness Measured Through Game Theory

大语言模型将自己定位为比人类更理性:通过博弈论测量AI自我意识的出现

Kyung-Hoon Kim

机构 * Gmarket Seoul, South Korea(韩国首尔Gmarket)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过博弈论框架测量大语言模型的自我意识,发现先进模型表现出比人类更高的理性认知。

Comments 19 pages, 6 figures, 28 models tested across 4,200 trials

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18212 2025-12-04 cs.AI cs.LG 62%

A Definition of AGI

AGI 的定义

Dan Hendrycks, Dawn Song, Christian Szegedy, Honglak Lee, Yarin Gal, Erik Brynjolfsson, Sharon Li, Andy Zou, Lionel Levine, Bo Han, Jie Fu, Ziwei Liu, Jinwoo Shin, Kimin Lee, Mantas Mazeika, Long Phan, George Ingebretsen, Adam Khoja, Cihang Xie, Olawale Salaudeen, Matthias Hein, Kevin Zhao, Alexander Pan, David Duvenaud, Bo Li, Steve Omohundro, Gabriel Alfour, Max Tegmark, Kevin McGrew, Gary Marcus, Jaan Tallinn, Eric Schmidt, Yoshua Bengio

机构 * Center for AI Safety(AI安全中心) University of California, Berkeley(加州大学伯克利分校) Virtue AI Morph Labs(Morph实验室) University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Oxford(牛津大学) Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Gray Swan AI Carnegie Mellon University(卡内基梅隆大学) Cornell University(康奈尔大学) Hong Kong Baptist University(香港 Baptist大学) HKUST(香港科技大学) Nanyang Technological University(南洋理工大学) KAIST(韩国科学技术院) University of California, Santa Cruz(加州大学圣克鲁兹分校) Massachusetts Institute of Technology(麻省理工学院) University of Tübingen(图宾根大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Beneficial AI Research(有益AI研究) Conjecture Institute for Applied Psychometrics(应用心理测量研究所) New York University(纽约大学) CSER Université de Montréal(蒙特利尔大学) LawZero

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于卡特尔-霍恩-卡罗尔理论的可量化框架,定义AGI为与受过良好教育的成年人认知能力相匹配,并通过心理测量电池评估AI系统,揭示当前AI在基础认知机制上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03882 2025-12-04 cs.LG 57%

Automatic Attack Discovery for Few-Shot Class-Incremental Learning via Large Language Models

通过大语言模型实现少样本类增量学习的自动攻击发现

Haidong Kang, Wei Wu, Hanling Wang

机构 * School of Computer and Communication Engineering(计算机与通信工程学院) School of Information and Communication(信息与通信学院) University of Electronic Science and Technology of China(电子科学与技术大学) Department of Strategic and Advanced Interdisciplinary Research(战略与先进跨学科研究部) Pengcheng Laboratory(鹏城实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ACraft方法,利用大语言模型自动发现针对少样本类增量学习的最优攻击方法,有效提升攻击性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03399 2025-12-04 cs.LG 57%

Full-Stack Alignment: Co-Aligning AI and Institutions with Thick Models of Value

全栈对齐:通过厚价值模型对齐人工智能与机构

Joe Edelman, Tan Zhi-Xuan, Ryan Lowe, Oliver Klingefjord, Vincent Wang-Mascianica, Matija Franklin, Ryan Othniel Kearns, Ellie Hain, Atrisha Sarkar, Michiel Bakker, Fazl Barez, David Duvenaud, Jakob Foerster, Iason Gabriel, Joseph Gubbels, Bryce Goodman, Andreas Haupt, Jobst Heitzig, Julian Jara-Ettinger, Atoosa Kasirzadeh, James Ravi Kirkpatrick, Andrew Koh, W. Bradley Knox, Philipp Koralus, Joel Lehman, Sydney Levine, Samuele Marro, Manon Revel, Toby Shorin, Morgan Sutherland, Michael Henry Tessler, Ivan Vendrov, James Wilken-Smith

机构 * Meaning Alignment Institute(意义对齐研究所) Massachusetts Institute of Technology(麻省理工学院) University College London(伦敦大学学院) University of Oxford(牛津大学) Western University(西方大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学) Stanford University(斯坦福大学) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) UT Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学) Harvard University(哈佛大学) Midjourney Core contributor(Midjourney核心贡献者)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出通过厚价值模型实现全栈对齐,以解决AI与机构目标不一致导致的不良后果,涵盖价值表示、规范推理和集体利益建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03724 2025-12-04 cs.CL 57%

MemOS: A Memory OS for AI System

MemOS:人工智能系统中的内存操作系统

Zhiyu Li, Chenyang Xi, Chunyu Li, Ding Chen, Boyu Chen, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Chen Tang, Qingchen Yu, Jihao Zhao, Yezhaohui Wang, Peng Liu, Zehao Lin, Pengyuan Wang, Jiahao Huo, Tianyi Chen, Kai Chen, Kehang Li, Zhen Tao, Huayi Lai, Hao Wu, Bo Tang, Zhengren Wang, Zhaoxin Fan, Ningyu Zhang, Linfeng Zhang, Junchi Yan, Mingchuan Yang, Tong Xu, Wei Xu, Huajun Chen, Haofen Wang, Hongkang Yang, Wentao Zhang, Zhi-Qin John Xu, Siheng Chen, Feiyu Xiong

机构 * MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Research Institute of China Telecom(中国电信研究院) Tongji University(同济大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Renmin University of China(中国人民大学) Beihang University(北航) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 MemOS是一种面向人工智能系统的内存操作系统,通过统一管理不同类型的内存资源,提升长上下文推理和持续个性化的能力。

Comments 36 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03389 2025-12-04 cs.DB 50%

Continuous Prompts: LLM-Augmented Pipeline Processing over Unstructured Streams

连续提示:基于大语言模型的流处理管道处理

Shu Chen, Deepti Raghavan, Uğur Çetintemel

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出连续提示框架,通过引入大语言模型的持续推理能力,实现对无结构流的持久语义处理,并通过动态优化提升效率与精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03233 2025-12-04 cs.CV 50%

Object Counting with GPT-4o and GPT-5: A Comparative Study

基于GPT-4o和GPT-5的对象计数:比较研究

Richard Füzesséry, Kaziwa Saleh, Sándor Szénási, Zoltán Vámossy

机构 * Software Engineering Institute, Obuda University, Budapest, Hungary(奥布达大学软件工程研究所) Doctoral School of Applied Informatics(应用信息科学博士学院) Applied Mathematics, Obuda University, Budapest, Hungary(应用数学,奥布达大学) John von Neumann Faculty of Informatics, Obuda University, Budapest, Hungary(约翰·冯·诺伊曼信息学院,奥布达大学) Faculty of Economics(经济学院)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文比较了GPT-4o和GPT-5在零样本对象计数任务中的性能,展示了其在FSC-147和CARPK数据集上的表现。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02895 2025-12-04 cs.CV 50%

MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm

MindGPT-4ov: 一种通过多阶段训练范式增强的多模态大语言模型

Wei Chen, Chaoqun Du, Feng Gu, Wei He, Qizhen Li, Zide Liu, Xuhao Pan, Chang Ren, Xudong Rao, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Yufei Zheng, Chunpeng Zhou, Pan Zhou, Xuhan Zhu

机构 * MindGPT-4o Team(MindGPT-4o 团队) Li Auto Inc.(利汽车公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 MindGPT-4ov通过多阶段训练范式提升多模态大语言模型的性能与泛化能力,实现低成本高效率的训练与部署。

Comments 33 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏