arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-08 至 2025-12-08 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 28 篇

2502.03916 2025-12-08 cs.CL cs.AI 90%

Experiments with Large Language Models on Retrieval-Augmented Generation for Closed-Source Simulation Software

在闭源仿真软件上使用检索增强生成进行大型语言模型实验

Andreas Baumann, Peter Eberhard

机构 * Institute of Engineering and Computational Mechanics, University of Stuttgart(工程与计算力学研究所,斯图加特大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究测试了RAG系统在闭源仿真软件Pasimodo中的表现,发现定制信息提供能显著提升响应质量,凸显了改进闭源仿真模型信息检索的重要性。

Comments 16 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07640 2025-12-08 cs.AI 89%

Enhancing Large Language Models through Neuro-Symbolic Integration and Ontological Reasoning

通过神经符号整合和本体推理增强大型语言模型

Ruslan Idelfonso Magana Vsevolodovna, Marco Monti

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一种结合符号本体推理和机器学习的方法,通过迭代反馈提升LLM输出的一致性和事实准确性。

Comments Withdrawn because Version 1 contains inaccuracies in references and architecture description. A corrected and improved version will be submitted separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18526 2025-12-08 cs.AI cs.LG 88%

Counterfactual Reasoning for Steerable Pluralistic Value Alignment of Large Language Models

反事实推理用于可操控的多元价值观对齐大语言模型

Hanze Guo, Jing Yao, Xiao Zhou, Xiaoyuan Yi, Xing Xie

机构 * Renmin University of China(中国人民大学) Microsoft Research Asia(微软亚洲研究院) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 COUPLE通过反事实推理框架实现多元价值观对齐,解决现有方法在处理细粒度价值目标时的依赖性和优先级控制问题。

Comments NeurIPS 2025. 41 pages, 7 figures

Journal ref The Thirty-Ninth Annual Conference on Neural Information Processing Systems. (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16054 2025-12-08 cs.CV 88%

Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model

基于多模态大语言模型的语言引导推理用于群体活动检测

Jihua Peng, Qianxiong Xu, Yichen Liu, Chenxi Liu, Cheng Long, Rui Zhao, Ziyue Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LIR-GAD框架,通过多模态大语言模型实现群体活动检测,引入活动标记和群体标记以提升语义理解和分类性能。

Comments This work is being incorporated into a larger study

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05256 2025-12-08 cs.CL q-bio.QM 87%

Enhancing Clinical Note Generation with ICD-10, Clinical Ontology Knowledge Graphs, and Chain-of-Thought Prompting Using GPT-4

利用ICD-10、临床本体知识图谱和链式推理提示法提升临床笔记生成

Ivan Makohon, Mohamad Najafi, Jian Wu, Mathias Brochhausen, Yaohang Li

机构 * Computer Science, Old Dominion University(旧 Dominion 大学计算机科学系) Biomedical Informatics, University of Arkansas for Medical Sciences(阿肯色医学科学大学生物医学信息学系)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究利用ICD-10、临床本体知识图谱和链式推理提示法提升临床笔记生成质量,通过GPT-4在六个临床案例中验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19552 2025-12-08 cs.CV 87%

iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning

iFinder: 结构化零样本视觉基于LLM的地面定位用于行车记录仪视频推理

Manyi Yao, Bingbing Zhuang, Sparsh Garg, Amit Roy-Chowdhury, Christian Shelton, Manmohan Chandraker, Abhishek Aich

机构 * NEC Laboratories, America(NEC美国实验室) University of California, Riverside(加州大学河滨分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 iFinder通过结构化语义接地框架,利用行车记录仪视频中的关键线索提升LLM在驾驶视频推理中的性能。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05836 2025-12-08 cs.AI 86%

Using Large Language Models to Create Personalized Networks From Therapy Sessions

利用大语言模型从治疗会谈中创建个性化网络

Clarissa W. Ong, Hiba Arnaout, Kate Sheehan, Estella Fox, Eugen Owtscharow, Iryna Gurevych

机构 * Department of Psychological and Brain Sciences, University of Louisville, U.S.A(心理与脑科学系,路易斯维尔大学,美国) Department of Computer Science, TU Darmstadt, Germany(计算机科学系,图恩-达姆斯塔特大学,德国) Department of Psychology, University of Toledo, U.S.A(心理学系,托莱多大学,美国)

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.AI

AI总结 本研究利用大语言模型从治疗记录中自动生成个性化网络,通过上下文学习和聚类方法提升临床效用和可解释性,为治疗个性化提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05419 2025-12-08 cs.LG 86%

TS-HINT: Enhancing Semiconductor Time Series Regression Using Attention Hints From Large Language Model Reasoning

基于大语言模型推理的注意力提示的半导体时间序列回归增强方法

Jonathan Adam Rico, Nagarajan Raghavan, Senthilnath Jayavelu

机构 * Engineering Product Development (EPD), SUTD, Singapore(新加坡南洋理工大学工程产品开发部) Institute for Infocomm Research (I$^2$R), A*STAR, Singapore(新加坡信息通信研究所)

专题命中 推理与问题求解 :large language model(title);language model(title);foundation model(abstract);分类 cs.LG

AI总结 TS-Hint通过结合大语言模型推理提供注意力提示,提升半导体时间序列回归在有限数据下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08475 2025-12-08 cs.SE cs.AI 85%

Designing LLM-based Multi-Agent Systems for Software Engineering Tasks: Quality Attributes, Design Patterns and Rationale

设计基于大语言模型的多智能体系统用于软件工程任务:质量属性、设计模式与理由

Yangxiao Cai, Ruiyin Li, Peng Liang, Mojtaba Shahin, Zengyang Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院) School of Computer Science, Central China Normal University(中央师范大学计算机学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了基于大语言模型的多智能体系统在软件工程任务中的设计,发现代码生成是最常见任务,功能性适应性是主要关注的质量属性,基于角色的合作是最常用的设计模式,提高生成代码质量是主要设计动机。

Comments 35 pages, 4 images, 7 tables, Manuscript submitted to a Journal (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18574 2025-12-08 cs.SE 85%

SpecTra: Enhancing the Code Translation Ability of Language Models by Generating Multi-Modal Specifications

SpecTra: 通过生成多模态规范提升语言模型的代码翻译能力

Vikram Nitin, Rahul Krishna, Baishakhi Ray

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 SpecTra通过生成多模态规范提升LLM的代码翻译能力,实现高达46%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18491 2025-12-08 cs.CL cs.AI 81%

MindEval: Benchmarking Language Models on Multi-turn Mental Health Support

MindEval: 在多轮心理健康支持中对语言模型进行基准测试

José Pombal, Maya D'Eon, Nuno M. Guerreiro, Pedro Henrique Martins, António Farinhas, Ricardo Rei

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MindEval通过与临床心理学家合作,提出了一种自动评估语言模型在多轮心理健康对话中表现的框架,评估了12种先进模型,发现其在复杂交互中表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05318 2025-12-08 cs.CL cs.AI cs.LG 80%

To Think or Not to Think: The Hidden Cost of Meta-Training with Excessive CoT Examples

思考还是不思考:过度使用Co-T示例的元训练隐藏成本

Vignesh Kothapalli, Ata Fatahibaarzi, Hamed Firooz, Maziar Sanjabi

机构 * Stanford University(斯坦福大学) LinkedIn AI

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoT-Recipe方法,通过调节元训练序列中CoT和非CoT示例的比例,提升大型语言模型在新任务上的推理准确性,实验显示在无CoT示例时准确率可提升300%。

Comments 26 pages, 45 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05580 2025-12-08 cs.CL 77%

Structured Reasoning with Tree-of-Thoughts for Bengali Math Word Problems

基于树状思维的结构化推理用于孟加拉语数学应用题

Aurprita Mahmood, Sabrin alam, Neloy kumer Sagor, Md. Abdul Hadi, Md. Sehab Al Islam, Minhajul Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Ahsanullah University of Science and Technology(阿沙努尔大学科学与技术学院) Southeast University(东南大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出基于树状思维的结构化推理方法,用于提升孟加拉语数学应用题的解决效果,通过实验验证ToT在中等至大规模模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15718 2025-12-08 cs.AI 77%

ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset

ToolMind技术报告:一个大规模、推理增强的工具使用数据集

Chen Yang, Ran Le, Yun Xing, Zhenwei An, Zongchao Chen, Wayne Xin Zhao, Yang Song, Tao Zhang

机构 * Nanbeige Lab, BOSS Zhipin(纳米白实验室,BOSS智聘) Gaoling School of Artificial Intelligence, Renmin University of China(甘露人工智能学院,中国人民大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ToolMind是一个大规模、高质量的工具使用数据集,通过合成和增强数据提升LLM代理的推理能力和工具使用性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05760 2025-12-08 cs.AI 70%

Evolutionary System 2 Reasoning: An Empirical Proof

进化系统2推理:一个实证证明

Zeyuan Ma, Wenqi Huang, Guo-Huan Song, Hongshu Guo, Sijie Ma, Zhiguang Cao, Yue-Jiao Gong

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出进化推理优化框架,通过进化策略提升LLM的推理能力,实验证实即使弱模型也能通过简单进化获得强大推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05365 2025-12-08 cs.AI q-bio.QM 70%

MCP-AI: Protocol-Driven Intelligence Framework for Autonomous Reasoning in Healthcare

MCP-AI:面向医疗领域自主推理的协议驱动智能框架

Zag ElSayed, Craig Erickson, Ernest Pedapati

机构 * School of Information Technology University of Cincinnati Ohio, USA(信息科技学院 俄亥俄州立大学 奥哈伊俄州) Adolescent Psychiatry Cincinnati Children’s Hospital Medical Center Ohio, USA(青少年精神病学 奥克兰儿童医院医疗中心 奥哈伊俄州)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCP-AI是一种基于模型上下文协议的医疗自主推理框架,通过整合临床逻辑和安全协作,提升医疗决策的可解释性和适应性。

Comments 6 pages, 4 figures

Journal ref IEEE ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04563 2025-12-08 cs.CV 67%

COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence

COOPER:一种用于空间智能中协作感知与推理的统一模型

Zefeng Zhang, Xiangzhao Hao, Hengzhu Tang, Zhenyu Zhang, Jiawei Sheng, Xiaodong Li, Zhenyang Li, Li Gao, Daiting Shi, Dawei Yin, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 COOPER是一种统一的多模态大语言模型,通过整合深度和分割等辅助模态,提升空间感知与推理能力,实现空间智能的增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18200 2025-12-08 cs.CV 67%

InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity

InfiniBench:用于可定制场景复杂度的无限基准测试

Haoming Wang, Qiyao Xue, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract)

AI总结 InfiniBench通过可定制的3D场景生成方法,提升视觉语言模型在复杂空间推理任务中的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05542 2025-12-08 cs.LG cs.AI 66%

RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs

RoBoN: 基于路由的在线最佳-n方法用于多LLM测试时间扩展

Jonathan Geuter, Gregor Kornhardt

机构 * Kempner Institute for the Study of Natural & Artificial Intelligence(自然与人工智能研究 institute)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG;language model(comments)

AI总结 RoBoN通过在线路由多LLM生成过程,提高测试时间扩展性能,无需额外训练,有效提升准确率。

Comments 20 pages, 3 figures. 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05908 2025-12-08 cs.SE cs.AI cs.CL cs.IR 62%

Natural Language Summarization Enables Multi-Repository Bug Localization by LLMs in Microservice Architectures

自然语言摘要通过LLM在微服务架构中多仓库Bug定位

Amirkia Rafiei Oskooei, S. Selcan Yukcu, Mehmet Cevheri Bozoglan, Mehmet S. Aktas

机构 * Yildiz Technical University, Dept. of Computer Eng.(Yildiz技术大学,计算机工程系) Yildiz Technical University, Department of Computer Engineering(Yildiz技术大学,计算机工程系)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 利用自然语言摘要和LLM技术,通过多仓库微服务架构实现更高效的Bug定位,显著提升定位准确率和透明度。

Comments Accepted at LLM4Code Workshop, ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05824 2025-12-08 cs.AI cs.CV 57%

Multimodal Oncology Agent for IDH1 Mutation Prediction in Low-Grade Glioma

多模态肿瘤代理用于低级别胶质瘤IDH1突变预测

Hafsa Akebli, Adam Shephard, Vincenzo Della Mea, Nasir Rajpoot

机构 * Department of Mathematics, Computer Science and Physics, University of Udine(乌迪大学数学、计算机科学与物理系) Tissue Image Analytics Centre, Department of Computer Science, University of Warwick(沃里克大学计算机科学系组织图像分析中心) Histofy Ltd(Histofy有限公司)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本研究提出多模态肿瘤代理,结合组织学工具和外部生物医学资源,实现低级别胶质瘤IDH1突变的高精度预测。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05809 2025-12-08 cs.CV cs.AI 57%

Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling

通过测试时缩放探查世界模型在空间推理中的有效性

Saurav Jha, M. Jehanzeb Mirza, Wei Lin, Shiqi Yang, Sarath Chandar

机构 * MILA – Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔理工学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Institute for Machine Learning, Johannes Kepler University Linz(林茨约瑟夫·夫兰克大学机器学习研究所) Nankai University(南开大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出ViSA框架,通过可验证的微断言改进世界模型的空间推理能力,但发现当前模型在复杂任务中仍存在信息瓶颈。

Comments Extended abstract at World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05576 2025-12-08 cs.AI 57%

CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning

CureAgent:一种无需训练的执行-分析框架用于临床推理

Ting-Ting Xie, Yixin Zhang

机构 * Cambridge(剑桥)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 CureAgent提出无需训练的执行-分析框架,通过模块化架构和分层集合策略提升临床推理性能,实现CURE-Bench上的最佳表现。

Comments 2nd Place Solution to the CURE-Bench Competition @ NeurIPS 2025. Code available at https://github.com/June01/CureAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05502 2025-12-08 cs.LG 57%

GRASP: Graph Reasoning Agents for Systems Pharmacology with Human-in-the-Loop

GRASP:具有人机交互循环的图推理代理用于系统药理学

Omid Bazgir, Vineeth Manthapuri, Ilia Rattsev, Mohammad Jafarnejad

机构 * Clinical Pharmacology, Genentech(基因泰克临床药理部) Preclinical & Translational PKPD, Genentech Inc.(基因泰克预临床与转化药代动力学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 GRASP通过图推理代理实现系统药理学模型开发的自动化与严谨性,提升生物医学建模的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05122 2025-12-08 cs.AI 57%

Documenting SME Processes with Conversational AI: From Tacit Knowledge to BPMN

用对话式AI记录中小企业流程:从隐性知识到BPMN

Unnikrishnan Radhakrishnan

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的对话助手,通过访谈式对话将中小企业隐性知识转化为BPMN图表,实现流程文档化,降低文档化门槛,提升运营透明度。

Comments Presented at 2025 International Workshop on Low-Cost Digital Solutions for Industrial Automation (LODISA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16567 2025-12-08 cs.CV cs.AI 57%

V-CECE: Visual Counterfactual Explanations via Conceptual Edits

V-CECE:通过概念编辑生成视觉反事实解释

Nikolaos Spanos, Maria Lymperaiou, Giorgos Filandrianos, Konstantinos Thomas, Athanasios Voulodimos, Giorgos Stamou

机构 * National Technical University of Athens(国家技术大学雅典)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 V-CECE通过概念编辑生成反事实解释,无需训练即可产生人类水平的可解释性结果。

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05965 2025-12-08 cs.CV 50%

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

EditThinker: 解锁任何图像编辑器的迭代推理

Hongyu Li, Manyuan Zhang, Dian Zheng, Ziyu Guo, Yimeng Jia, Kaituo Feng, Hao Yu, Yexin Liu, Yan Feng, Peng Pei, Xunliang Cai, Linjiang Huang, Hongsheng Li, Si Liu

机构 * Beihang University(北航大学) Meituan(美团) CUHK MMLab CUHK IMIXR Tsinghua University(清华大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 EditThinker通过迭代推理框架提升图像编辑指令遵循能力,利用强化学习优化编辑过程,显著提高模型性能。

Comments Project page: https://appletea233.github.io/think-while-edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05398 2025-12-08 cs.CV 50%

The Dynamic Prior: Understanding 3D Structures for Casual Dynamic Videos

动态先验:为随意动态视频理解3D结构

Zhuoyuan Wu, Xurui Yang, Jiahui Huang, Yue Wang, Jun Gao

机构 * PKU(北京大学) NVIDIA(英伟达) USC(南加州大学) University of Michigan(密歇根大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出动态先验模型,利用Vision-Language Models和SAM2实现无需任务特定训练的动态物体识别,提升结构3D理解的准确性和鲁棒性。

Comments Code is available at https://github.com/wuzy2115/DYNAPO

详情

展开后加载摘要…

URL PDF HTML 收藏