arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-23 至 2025-12-23 共收录 280 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 48 篇

2512.18094 2025-12-23 cs.AI cs.MA 77%

Rethinking Multi-Agent Intelligence Through the Lens of Small-World Networks

通过小世界网络的视角重新思考多智能体智能

Boxuan Wang, Zhuoyun Li, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool(计算机科学与信息学院,利物浦大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过小世界网络视角重新思考多智能体智能,提出基于不确定性引导的重 wiring 方案,实现稳定且可扩展的多智能体系统设计。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09284 2025-12-23 cs.AI cs.CL cs.LG 75%

Tree-OPO: Off-policy Monte Carlo Tree-Guided Advantage Optimization for Multistep Reasoning

Tree-OPO: 用于多步推理的逆政策蒙特卡洛树引导优势优化

Bingning Huang, Tu Nguyen, Matthieu Zimmer

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Tree-OPO通过引入分阶段优势估计框架,利用MCTS生成轨迹优化策略学习,提升数学推理任务的准确性与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24511 2025-12-23 cs.LG cs.AI 73%

Can Slow-thinking LLMs Reason Over Time? Empirical Studies in Time Series Forecasting

慢思考LLM能否在时间上进行推理?时间序列预测的实证研究

Mingyue Cheng, Jiahao Wang, Daoyu Wang, Xiaoyu Tao, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨慢思考LLM能否在时间序列预测中进行推理,通过实验证明其零样本预测能力,揭示LLM在时间动态上的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19585 2025-12-23 cs.CL 70%

Increasing the Thinking Budget is Not All You Need

增加思考预算并不足以提升性能

Ignacio Iacobacci, Zhaozhi Qian, Faroq AL-Tam, Muhammad AL-Qurishi, Riad Souissi

机构 * Elm Company(埃尔姆公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了思考预算对模型性能的影响,发现增加预算并非最优策略,而自一致性和反思等配置能更有效提升推理准确性。

Comments 4 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19466 2025-12-23 cs.CY cs.CL cs.HC 70%

Epistemological Fault Lines Between Human and Artificial Intelligence

人类与人工智能之间的知识论断层

Walter Quattrociocchi, Valerio Capraro, Matjaž Perc

机构 * Department of Computer Science, Sapienza University of Rome, Rome, Italy Department of Psychology, University of Milan Bicocca, Milan, Italy Faculty of Natural Sciences Mathematics, University of Maribor, Maribor, Slovenia Community Healthcare Center Dr. Adolf Drolc Maribor, Maribor, Slovenia University College, Korea University, Seoul, Republic of Korea Department of Physics, Kyung Hee University, Seoul, Republic of Korea

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文揭示大型语言模型与人类认知在知识生成机制上的结构性差异,指出LLMs是随机模式完成系统而非知识代理,并识别七种知识断层,对社会评估、治理及知识素养提出影响。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19414 2025-12-23 cs.CR cs.CL 70%

From Retrieval to Reasoning: A Framework for Cyber Threat Intelligence NER with Explicit and Adaptive Instructions

从检索到推理:一个面向网络威胁情报实体识别的框架,具有显式和自适应指令

Jiaren Peng, Hongda Sun, Xuan Tian, Cheng Huang, Zeqing Li, Rui Yan

机构 * Sichuan University(四川大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, Ministry of Education, China(教育部下一代智能搜索与推荐工程研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TTPrompt框架,通过显式指令和反馈驱动细化,提升网络威胁情报实体识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19093 2025-12-23 cs.AI 70%

Tool-Augmented Hybrid Ensemble Reasoning with Distillation for Bilingual Mathematical Problem Solving

工具增强的混合集成推理与蒸馏用于双语数学问题求解

Peiqing Lu, Yuan Zhang, Haoyun Zhang, Jiasen Zheng, Kejian Tong, Wenjun Wu

机构 * Boston University(波士顿大学) University of Pennsylvania(宾夕法尼亚大学) Northwestern University(西北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HERALD通过结合自适应学习、工具强化学习和知识蒸馏,提升双语数学问题求解的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18619 2025-12-23 cs.AI cs.RO 70%

ChronoDreamer: Action-Conditioned World Model as an Online Simulator for Robotic Planning

ChronoDreamer:基于动作的动态世界模型作为机器人规划的在线模拟器

Zhenhao Zhou, Dan Negrut

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 ChronoDreamer通过时空变换器和视觉-语言模型,实现基于动作的动态世界模型,用于机器人规划中的安全动作预测与碰撞检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18605 2025-12-23 cs.AI 70%

Reflective Confidence: Correcting Reasoning Flaws via Online Self-Correction

反思性信心:通过在线自我纠正修正推理缺陷

Qinglin Zeng, Jing Yang, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出反思性信心框架,通过在线自我纠正修正推理缺陷,提升数学推理任务的准确性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02864 2025-12-23 cs.NE cs.AI math.CA math.CO math.MG 70%

Mathematical exploration and discovery at scale

大规模数学探索与发现

Bogdan Georgiev, Javier Gómez-Serrano, Terence Tao, Adam Zsolt Wagner

机构 * Google DeepMind(谷歌DeepMind) Department of Mathematics, Brown University(布朗大学数学系) Institute for Advanced Study(高级研究院) UCLA Department of Mathematics(加州大学洛杉矶分校数学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AlphaEvolve通过进化搜索发现数学构造,提升数学问题解决效率

Comments 81 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20262 2025-12-23 cs.AI cs.CY 70%

AI reasoning effort predicts human decision time in content moderation

AI推理努力预测内容审核中的人类决策时间

Thomas Davidson

机构 * Department of Sociology(社会学系) Rutgers University–New Brunswick(罗格斯大学-新布朗斯维爾)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究发现AI推理努力与人类决策时间存在相关性,揭示了推理痕迹在提升可解释性和决策制定中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19354 2025-12-23 cs.CV 67%

ReasonCD: A Multimodal Reasoning Large Model for Implicit Change-of-Interest Semantic Mining

ReasonCD: 一种用于隐含兴趣语义挖掘的多模态推理大模型

Zhenyang Huang, Xiao Yu, Yi Zhang, Decheng Wang, Hang Ruan

机构 * Beijing Institute of Tracking and Telecommunications Technology(北京跟踪与电信技术研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ReasonCD通过利用预训练大语言模型的推理能力,挖掘用户隐含任务意图,实现更高效的变化检测与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05769 2025-12-23 cs.CV 67%

Digital Twin Buildings: 3D Modeling, GIS Integration, and Visual Descriptions Using Gaussian Splatting, ChatGPT/Deepseek, and Google Maps Platform

数字孪生建筑:利用高斯点扩散、ChatGPT/DeepSeek和Google地图平台进行3D建模、GIS集成和视觉描述

Kyle Gao, Dening Lu, Liangzhi Li, Nan Chen, Hongjie He, Linlin Xu, Jonathan Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于高斯点扩散、ChatGPT和Google地图平台的数字孪生建筑框架,用于实现建筑的3D建模、GIS集成和视觉描述。

Comments -Fixed minor typo

Journal ref IEEE Geoscience and Remote Sensing Letters 22 (2025) 6013405

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19428 2025-12-23 cs.LG cs.AI math.AG 62%

Attention Is Not What You Need

注意力不是你需要的

Zhang Chong

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于格拉斯曼流的无注意力架构,通过低秩子空间操作实现更结构化的神经推理,实验显示其在语言建模和自然推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19084 2025-12-23 cs.AI 57%

$γ(3,4)$ `Attention' in Cognitive Agents: Ontology-Free Knowledge Representations With Promise Theoretic Semantics

$γ(3,4)$ 注意力在认知代理中的应用:基于承诺理论语义的知识表示

Mark Burgess

机构 * Oslo University College Chitek-i AS(奥斯陆大学学院奇特克-艾公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出基于承诺理论语义的$γ(3,4)$图表示方法,通过特征角色分类替代复杂本体,提升不确定性条件下的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16214 2025-12-23 cs.AI 57%

PDE-Agent: A toolchain-augmented multi-agent framework for PDE solving

PDE-Agent:一种增强工具链的多智能体框架用于PDE求解

Jianming Liu, Ren Zhu, Jian Xu, Kun Ding, Xu-Yao Zhang, Gaofeng Meng, Cheng-Lin Liu

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 PDE-Agent通过增强工具链的多代理协作框架,实现从自然语言描述中自动化的PDE求解。

Comments Adding Affiliation Information on arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18174 2025-12-23 cs.LG cs.CR cs.CY 57%

Conscious Data Contribution via Community-Driven Chain-of-Thought Distillation

通过社区驱动的推理链蒸馏实现意识数据贡献

Lena Libon, Meghana Bhange, Rushabh Solanki, Elliot Creager, Ulrich Aïvodji

机构 * ETH Zurich(苏黎世联邦理工学院) ÉTS Montréal, Mila(蒙特利尔ÉTS, Mila) University of Waterloo, Vector Institute(多伦多大学, 向量研究所)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 本文提出通过社区驱动的推理链蒸馏方法,使低效用社区能生成更符合自身目标的替代模型,提升数据可移植性和用户自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00908 2025-12-23 cs.CV cs.GR 50%

GraphGeo: Multi-Agent Debate Framework for Visual Geo-localization with Heterogeneous Graph Neural Networks

GraphGeo: 多智能体辩论框架用于具有异构图神经网络的视觉地定位

Heng Zheng, Yuling Shi, Xiaodong Gu, Haochen You, Zijian Zhang, Lubin Gan, Hao Zhang, Wenjun Huang, Jin Huang

专题命中 推理与问题求解 :language model(abstract)

AI总结 GraphGeo通过异构图神经网络的多智能体辩论框架,提升视觉地定位的准确性与鲁棒性。

Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11960 2025-12-23 cs.RO 50%

Human Centric General Physical Intelligence for Agile Manufacturing Automation

以人为中心的敏捷制造通用物理智能

Sandeep Kanta, Mehrdad Tavassoli, Varun Teja Chirkuri, Venkata Akhil Kumar, Santhi Bharath Punati, Praveen Damacharla, Sunny Katyara

机构 * Northeastern University(东北大学) Bmade Robotics(Bmade机器人)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文探讨了通过VLA模型实现通用物理智能在敏捷制造中的应用,系统回顾了最新进展并提出未来研究方向。

Comments Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 63 篇

2511.02376 2025-12-23 cs.CL cs.AI cs.CR cs.LG 91%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:面向大语言模型多轮对抗性提示的自动化 jailbreaking

Aashray Reddy, Andrew Zagula, Nicholas Saban

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI、cs.LG

AI总结 AutoAdv通过多轮自适应机制实现高成功率的对抗性提示攻击,揭示当前安全机制在多轮对话中的脆弱性。

Comments Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18622 2025-12-23 cs.DB cs.AI cs.CL cs.HC cs.MA 90%

A Multi-agent Text2SQL Framework using Small Language Models and Execution Feedback

基于小型语言模型和执行反馈的多智能体文本到SQL框架

Thanh Dat Hoang, Thanh Trung Huynh, Matthias Weidlich, Thanh Tam Nguyen, Tong Chen, Hongzhi Yin, Quoc Viet Hung Nguyen

机构 * Griffith University (Australia)(格里菲斯大学) VinUniversity (Vietnam)(文大学) Humboldt-Universitat zu Berlin (Germany)(柏林洪堡大学) The University of Queensland, Australia (2025)(昆士兰大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title);LLM(abstract);large language model(abstract)

AI总结 MATS是一种针对小型语言模型的文本到SQL框架,通过多智能体机制和强化学习训练方案,在有限参数下实现与大规模LLM相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12399 2025-12-23 cs.AI 89%

A Survey of Vibe Coding with Large Language Models

基于大语言模型的Vibe编码调研

Yuyao Ge, Lingrui Mei, Zenghao Duan, Tianhao Li, Yujia Zheng, Yiwei Wang, Lexin Wang, Jiayu Yao, Tianyu Liu, Yujun Cai, Baolong Bi, Fangda Guo, Jiafeng Guo, Shenghua Liu, Xueqi Cheng

机构 * Institute of Computing Technology Chinese Academy of Sciences(中国科学院计算技术研究所) Duke University(杜克大学) University of California Merced(加州大学默塞德分校) Peking University(北京大学) University of Queensland(昆士兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文调研了基于大语言模型的Vibe编码方法,系统分析了其理论基础和五个开发模型,揭示了上下文工程与协作模式对成功的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09337 2025-12-23 cs.CL 89%

Decoding Neural Emotion Patterns through Large Language Model Embeddings

通过大型语言模型嵌入解码神经情绪模式

Gideon Vos, Maryam Ebrahimpour, Liza van Eijk, Zoltan Sarnyai, Mostafa Rahimi Azghadi

机构 * College of Science and Engineering, James Cook University(科学与工程学院,詹姆斯库克大学) College of Health Care Sciences, James Cook University(健康护理科学学院,詹姆斯库克大学) College of Public Health, Medical, and Vet Sciences, James Cook University(公共健康、医学与兽医学学院,詹姆斯库克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 通过大型语言模型嵌入解码神经情绪模式,实现情绪与大脑区域的映射,区分抑郁人群与基本情绪分布,提供AI情感表达的脑基准评估。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02800 2025-12-23 cs.CL 89%

Survey and Experiments on Mental Disorder Detection via Social Media: From Large Language Models and RAG to Agents

面向社交媒体的抑郁症检测综述与实验:从大型语言模型和RAG到代理

Zhuohan Ge, Darian Li, Yubo Wang, Nicole Hu, Xinyi Zhu, Haoyang Li, Xin Zhang, Mingtao Zhang, Shihao Qi, Yuming Xu, Han Shi, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述并实验了基于社交媒体的抑郁症检测方法,探讨了LLM、RAG和代理系统在提升检测可靠性与推理能力中的应用。

Comments 20 pages, 10 figures. This is an extension of ICDEW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19114 2025-12-23 cs.LG cs.AI 88%

HyperLoad: A Cross-Modality Enhanced Large Language Model-Based Framework for Green Data Center Cooling Load Prediction

HyperLoad: 一种基于大语言模型的跨模态增强框架用于绿色数据中心冷却负荷预测

Haoyu Jiang, Boan Qu, Junjie Zhu, Fanjie Zeng, Xiaojie Lin, Wei Zhong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 HyperLoad通过预训练大语言模型解决绿色数据中心小样本负载预测问题,利用跨模态知识对齐和多尺度特征建模提升预测精度,实现高效能绿色数据中心管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17992 2025-12-23 cs.RO 88%

Unifying Deep Predicate Invention with Pre-trained Foundation Models

统一深度谓词发明与预训练基础模型

Qianwei Wang, Bowen Li, Zhanpeng Luo, Yifan Xu, Alexander Gray, Tom Silver, Sebastian Scherer, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Computer Science and Engineering Division, University of Michigan(密歇根大学计算机科学与工程系) Department of Computer Science, University of Pittsburgh(匹兹堡大学计算机科学系) Centaur AI Institute(Centaur人工智能研究所) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 UniPred通过双层学习框架统一深度谓词发明与预训练基础模型,提升机器人任务的可扩展性和灵活性。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19350 2025-12-23 cs.AI 88%

PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models

PENDULUM: 一个用于评估多模态大语言模型顺从性的基准

A. B. M. Ashikur Rahman, Saeed Anwar, Muhammad Usman, Irfan Ahmad, Ajmal Mian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18244 2025-12-23 cs.CR cs.AI 88%

Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation

打破思维,打破系统:通过类人心理操纵进行大语言模型的劫持攻击

Zehao Liu, Xi Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出类人心理操纵方法,通过操纵大语言模型的心理状态实现高成功率的劫持攻击,验证了心理安全机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19238 2025-12-23 cs.CL cs.AI cs.LG 87%

Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation

识别与偏见相关的93个被污名化的群体特征及语言模型的安全防护措施

Anna-Maria Gueorguieva, Aylin Caliskan

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了语言模型对93个污名化群体的偏见来源,并测试了防护模型对减少偏见的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17638 2025-12-23 cs.AI cs.CL cs.LG 87%

LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena

LLM-as-a-Prophet: 通过Prophet Arena理解预测智能

Qingchuan Yang, Simon Mahns, Sida Li, Anri Gu, Jibang Wu, Haifeng Xu

机构 * University of Southern California(南加州大学) Meta The University of Chicago(芝加哥大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Prophet Arena评估了LLMs在预测任务中的表现,揭示了其预测能力及存在的瓶颈。

Comments https://www.prophetarena.co/

详情

展开后加载摘要…

URL PDF HTML 收藏