arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-04 至 2025-12-04 共收录 166 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 37 篇

2503.23315 2025-12-04 cs.AI cs.CE cs.LG 73%

AI Agents in Engineering Design: A Multi-Agent Framework for Aesthetic and Aerodynamic Car Design

工程设计中的AI代理:一种用于汽车外观和空气动力学设计的多代理框架

Mohamed Elrefaie, Janet Qian, Raina Wu, Qian Chen, Angela Dai, Faez Ahmed

机构 * Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院机械工程系) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院电气工程与计算机科学系) Department of Computer Science, Technical University of Munich, Munich, Germany(慕尼黑技术大学计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种多代理框架,利用AI代理提升汽车设计的美学和空气动力学性能,通过自动化任务加速设计流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07768 2025-12-04 cs.CV 71%

Test-time Correction: An Online 3D Detection System via Visual Prompting

测试时校正:通过视觉提示的在线3D检测系统

Hanxue Zhang, Zetong Yang, Yanan Sun, Li Chen, Fei Xia, Fatma Güney, Hongyang Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) GAC R&D Center(GAC研发中心) The University of Hong Kong(香港大学) Google(谷歌) Koç University(科克大学)

专题命中 效率与部署 :prompting(title)

AI总结 本文提出一种通过视觉提示实现在线3D检测的测试时校正系统,旨在提升自动驾驶系统在部署后的实时纠错能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16411 2025-12-04 cs.RO cs.LG 70%

The Duality of Generative AI and Reinforcement Learning in Robotics: A Review

生成式人工智能与强化学习在机器人中的双重性:综述

Angelo Moroncelli, Vishal Soni, Marco Forgione, Dario Piga, Blerina Spahiu, Loris Roveda

机构 * SUPSI(瑞士苏黎世联邦理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述了生成式人工智能与强化学习在机器人中的双重性,探讨了两者的整合方法、挑战及未来研究方向。

Comments Submitted for publication to Information Fusion

Journal ref Information Fusion Volume 129, May 2026, 104003

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03413 2025-12-04 cs.IR cs.AI 70%

BookRAG: A Hierarchical Structure-aware Index-based Approach for Retrieval-Augmented Generation on Complex Documents

BookRAG: 一种面向复杂文档的基于层次结构的索引方法用于检索增强生成

Shu Wang, Yingli Zhou, Yixiang Fang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BookRAG通过构建层次化索引结构,提升复杂文档在问答任务中的检索与生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03673 2025-12-04 cs.CV 67%

ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers

ConvRot:基于旋转的插拔式4位量化用于扩散变换器

Feice Huang, Zuliang Han, Xing Zhou, Yihuang Chen, Lifei Zhu, Haoqian Wang

机构 * SIGS, Tsinghua University(清华大学信号与信息系) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 ConvRot提出基于旋转的4位量化方法,通过正则Hadamard变换抑制异常值,实现扩散变换器的插拔式W4A4推理,提升速度和内存效率同时保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04025 2025-12-04 cs.CV cs.AI cs.LG 62%

PSA: Pyramid Sparse Attention for Efficient Video Understanding and Generation

PSA: 基于金字塔稀疏注意力的高效视频理解和生成

Xiaolong Li, Youping Gu, Xi Lin, Weijie Wang, Bohan Zhuang

机构 * ZIP Lab, Zhejiang University(浙江大学浙大信息实验室)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 PSA通过多级池化键值表示实现高效视频理解和生成,相比现有稀疏注意力方法在效率和质量上表现更优。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03571 2025-12-04 cs.AI cs.LG cs.PL 62%

EnCompass: Enhancing Agent Programming with Search Over Program Execution Paths

EnCompass:通过程序执行路径搜索增强智能体编程

Zhening Li, Armando Solar-Lezama, Yisong Yue, Stephan Zheng

机构 * Asari AI MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Caltech CMS(加州理工学院 CMS)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 EnCompass通过解耦智能体工作流逻辑与推理策略,提供一种基于Python的框架,允许快速提升智能体可靠性并灵活切换推理策略。

Comments 65 pages, 2 figures, published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00882 2025-12-04 cs.CV cs.AI 57%

Look, Recite, Then Answer: Enhancing VLM Performance via Self-Generated Knowledge Hints

看、复述、然后回答:通过自动生成的知识提示提升VLM性能

Xisheng Feng

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 通过自动生成的知识提示提升VLM性能,采用模块化设计减少幻觉,实现精准农业中杂草识别准确率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11599 2025-12-04 cs.CV cs.AI 57%

A$^2$LC: Active and Automated Label Correction for Semantic Segmentation

A$^2$LC: 语义分割中的主动和自动化标签校正

Youjin Jeon, Kyusik Cho, Suhan Woo, Euntai Kim

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 A$^2$LC通过主动和自动化标签校正框架,显著提升语义分割的效率和性能,仅用20%的预算就超越现有方法。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03500 2025-12-04 cs.CV 50%

EEA: Exploration-Exploitation Agent for Long Video Understanding

EEA:长视频理解的探索-利用代理

Te Yang, Xiangyu Zhu, Bo Wang, Quan Chen, Peng Jiang, Zhen Lei

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Kuaishou Technology(快手科技) Centre for Artificial Intelligence and Robotics, HKISI, Chinese Academy of Sciences(人工智能与机器人中心,HKISI,中国科学院)

专题命中 效率与部署 :language model(abstract)

AI总结 EEA通过语义引导的分层树搜索实现长视频理解中的探索与利用平衡,结合视觉语言模型和语义先验提升视频分析的效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20923 2025-12-04 cs.CV 50%

Revisiting Data Challenges of Computational Pathology: A Pack-based Multiple Instance Learning Training Framework

重新审视计算病理学的数据挑战:一种基于包的多实例学习训练框架

Wenhao Tang, Heng Fang, Ge Wu, Xiang Li, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Huazhong University of Science and Technology(华中科技大学) Nankai International Advanced Research Institute (Shenzhen Futian)(南开国际先进研究院(深圳福田))

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出一种基于包的多实例学习框架,通过打包变长特征序列和引入残差分支,提升计算病理学中WSI处理的效率和准确性。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 15 篇

2512.00601 2025-12-04 cs.AI 91%

Clinical-R1: Empowering Large Language Models for Faithful and Comprehensive Reasoning with Clinical Objective Relative Policy Optimization

Clinical-R1: 通过临床目标相对策略优化赋能大语言模型进行忠实且全面的推理

Boyang Gu, Hongjian Zhou, Bradley Max Segal, Jinge Wu, Zeyu Cao, Hantao Zhong, Lei Clifton, Fenglin Liu, David A. Clifton

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 Clinical-R1通过CRPO方法提升大语言模型在医学领域的推理忠实性和全面性,实现多目标强化学习优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03672 2025-12-04 cs.CL 89%

Evaluating Hydro-Science and Engineering Knowledge of Large Language Models

评估大语言模型的水科学与工程知识

Shiruo Hu, Wenbo Shan, Yingjia Li, Zhiqi Wan, Xinpeng Yu, Yunjia Qi, Haotian Xia, Yang Xiao, Dingxiao Liu, Jiaru Wang, Chenxu Gong, Ruixi Zhang, Shuyue Wu, Shibo Cui, Chee Hui Lai, Wei Luo, Yubin He, Bin Xu, Jianshi Zhao

机构 * State Key Laboratory of Hydro-Science and Engineering, Department of Hydraulic Engineering(水利科学与工程国家重点实验室、水利学院) Department of Computer Science and Technology(计算机科学与技术系) Zhipu AI(智谱AI) CHN Energy Dadu River Big Data Services Co., Ltd.(中国能源大渡河大数据服务有限公司)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究提出Hydro-SE LLM评估基准,评估大语言模型在水科学与工程领域的知识和应用能力,揭示其优势与不足。

Comments Hydro-SE Bench sets a new benchmark for the evaluation of LLMs in the Hydro-Science and Engineering domain, with its code and data available at \url{https://github.com/sheishijun/Hydro-SE-Bench}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03737 2025-12-04 cs.CL cs.IR 85%

AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation

AR-Med: 通过LLM驱动的信息增强实现医疗搜索的自动化相关性增强

Chuyue Wang, Jie Feng, Yuxi Wu, Hang Zhang, Zhiguo Fan, Bing Cheng, Wei Lin

机构 * Meituan Inc.(美团公司) Tsinghua University(清华大学) Independent Researcher(独立研究者)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AR-Med通过LLM驱动的信息增强,实现医疗搜索的自动化相关性提升,提高了准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03439 2025-12-04 cs.IR 85%

LLM as Explainable Re-Ranker for Recommendation System

大语言模型作为可解释的重排序器用于推荐系统

Yaqi Wang, Haojia Sun, Shuting Zhang

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用大语言模型作为可解释的重排序器,结合传统推荐模型提升推荐系统的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08863 2025-12-04 cs.SE 85%

GeoJSON Agents:A Multi-Agent LLM Architecture for Geospatial Analysis-Function Calling vs Code Generation

GeoJSON代理:一种用于地理空间分析的多智能体LLM架构——功能调用与代码生成

Qianqian Luo, Qingming Lin, Liuchang Xu, Sensen Wu, Ruichen Mao, Chao Wang, Hailin Feng, Bo Huang, Zhenhong Du

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 GeoJSON代理通过功能调用与代码生成技术,提升地理空间分析任务的准确性和稳定性,展现多智能体LLM在复杂任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00887 2025-12-04 cs.CV 80%

Multilingual Training-Free Remote Sensing Image Captioning

多语言免训练 遥感图像描述生成

Carlos Rebelo, Gil Rocha, João Daniel Silva, Bruno Martins

机构 * INESC-ID(葡萄牙里斯本INESC-ID研究所) Instituto Superior Técnico(葡萄牙里斯本技术大学) Faculdade de Engenharia da Universidade do Porto(葡萄牙波尔图大学工程学院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种无需训练的多语言遥感图像描述生成方法,通过检索增强提示和图基重新排序策略,实现跨语言的高效描述生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03750 2025-12-04 cs.LG cond-mat.mtrl-sci 79%

Universally Converging Representations of Matter Across Scientific Foundation Models

跨科学基础模型中物质的普遍收敛表示

Sathya Edamadaka, Soojung Yang, Ju Li, Rafael Gómez-Bombarelli

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 研究揭示科学基础模型在不同模态和数据集上对物质的普遍表示收敛性,表明模型学习了共同的物理现实表示,但受限于训练数据和归纳偏置。

Comments Oral spotlight at NeurIPS 2025 UniReps Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03068 2025-12-04 cs.CY cs.AI 79%

Echoes of AI Harms: A Human-LLM Synergistic Framework for Bias-Driven Harm Anticipation

AI危害的回响:一种人机协同框架用于偏见驱动的危害预见

Nicoleta Tantalaki, Sophia Vei, Athena Vakali

机构 * Aristotle University(亚里士多德大学)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出ECHO框架,通过系统映射人工智能偏见类型到危害结果,实现主动危害预见,用于高风险领域中的偏见驱动危害检测与治理。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03694 2025-12-04 cs.MA 75%

SRPG: Semantically Reconstructed Privacy Guard for Zero-Trust Privacy in Educational Multi-Agent Systems

SRPG:用于教育多智能体系统的语义重建隐私保护

Shuang Guo, Zihui Li

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SRPG通过双流重建机制在教育多智能体系统中实现零PII泄露,提升教学效果与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03097 2025-12-04 cs.CR cs.LG cs.MA 70%

Many-to-One Adversarial Consensus: Exposing Multi-Agent Collusion Risks in AI-Based Healthcare

多对一对抗共识:揭示基于AI的医疗保健中多智能体合谋的风险

Adeela Bashir, The Anh han, Zia Ush Shamszaman

机构 * School of Computing, Engineering and Digital Technologies(计算、工程与数字技术学院) Teesside University(泰赛德大学) Center for Digital Innovation(数字创新中心)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究揭示了基于AI的医疗保健中多智能体合谋的风险,提出了一种轻量级防御机制以确保临床指南的准确性。

Comments 7 pages Conference level paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03501 2025-12-04 cs.CY 67%

SocraticAI: Transforming LLMs into Guided CS Tutors Through Scaffolded Interaction

SocraticAI: 通过支架式交互将LLMs转化为指导性计算机科学导师

Karthik Sunil, Aalok Thakkar

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 SocraticAI通过结构化约束将LLMs整合到计算机科学教育中,培养学生战略性的人工智能交互能力。

Comments Presented in the Best Practices Track of COMPUTE 2025 (arXiv:2512.02349)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03838 2025-12-04 cs.CL 57%

Training and Evaluation of Guideline-Based Medical Reasoning in LLMs

在LLM中训练和评估基于指南的医学推理

Michael Staniek, Artem Sokolov, Stefan Riezler

机构 * Computational Linguistics &(计算语言学) IWR, Heidelberg University(海德堡大学IWR部门) Google DeepMind, Berlin, Germany(谷歌DeepMind,柏林,德国)

专题命中 领域大模型 :LLM(abstract);分类 cs.CL

AI总结 本文通过训练LLM遵循医学共识指南,提升其推理和预测的正确性与价值正确性,改进未来临床变量的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08553 2025-12-04 stat.ML cs.LG 57%

A Common Pipeline for Harmonizing Electronic Health Record Data for Translational Research

用于转化研究的电子健康记录数据统一通用管道

Jessica Gronsbell, Vidul Ayakulangara Panickan, Doudou Zhou, Chris Lin, Thomas Charlon, Chuan Hong, Xin Xiong, Linshanshan Wang, Jianhui Gao, Shirley Zhou, Yuan Tian, Yaqi Shi, Ziming Gan, Tianxi Cai

专题命中 领域大模型 :language model(abstract);分类 cs.LG

AI总结 PEHRT提供了一种统一EHR数据的通用管道,通过标准化本体、表示学习和跨机构协同训练,提升数据一致性与分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03214 2025-12-04 cs.CL cs.CY 57%

Identifying attributions of causality in political text

在政治文本中识别因果归因

Paulina Garcia-Corral

机构 * Hertie School(赫尔蒂学校)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 本文提出了一种用于检测和解析政治文本中因果解释的框架,通过训练轻量级因果语言模型,实现结构化数据集的生成,以提高对因果关系的分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03775 2025-12-04 cs.CR 50%

"MCP Does Not Stand for Misuse Cryptography Protocol": Uncovering Cryptographic Misuse in Model Context Protocol at Scale

MCP并非指误用密码协议:在大规模模型上下文协议中揭示密码误用

Biwei Yan, Yue Zhang, Minghui Xu, Hao Wu, Yechao Zhang, Kun Li, Guoming Zhang, Xiuzhen Cheng

专题命中 领域大模型 :LLM(abstract)

AI总结 研究提出MICRYSCOPE框架,通过跨语言中间表示、混合依赖分析和基于污点的检测器,揭示MCP中密码学误用问题,并识别出大量存在安全漏洞的服务器实例。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识编辑与模型理解 7 篇

2512.03208 2025-12-04 stat.ML cs.LG 90%

Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback

大语言模型奖励学习中异质人类反馈的不确定性量化

Pangpang Liu, Junwei Lu, Will Wei Sun

机构 * Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Department of Biostatistics, Harvard University(哈佛大学生物统计学系) Department of Quantitative Methods, Purdue University(普渡大学定量方法系)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

AI总结 本文提出了一种异质偏好框架,通过双凸优化解决大语言模型奖励学习中的不确定性量化问题,并通过理论保证和实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04968 2025-12-04 cs.MM cs.AI 77%

The Dream Within Huang Long Cave: AI-Driven Interactive Narrative for Family Storytelling and Emotional Reflection

黑龙洞之梦:由AI驱动的互动叙事用于家庭故事讲述与情感反思

Jiayang Huang, Lingjie Li, Kang Zhang, David Yip

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 《黑龙洞之梦》通过AI驱动的互动叙事,探索家庭关系中的情感连接与大他者不存在的概念。

Comments 8 pages,8 figures, International Symposium on Electronic/Emerging Art (ISEA)

Journal ref Proceedings of the International Symposium on Electronic/Emerging Art (ISEA 2025), Seoul, Republic of Korea, 2025, pp.247-254

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03107 2025-12-04 cs.LG cs.CL q-fin.CP stat.ML 73%

Detecting AI Hallucinations in Finance: An Information-Theoretic Method Cuts Hallucination Rate by 92%

在金融领域检测AI幻觉:一种信息论方法将幻觉率降低92%

Mainak Singha

机构 * Astrophysics Science Division, NASA, Goddard Space Flight Center(国家航空航天局(NASA)天体物理学科学部门,戈达德太空飞行中心) Department of Physics, The Catholic University of America(美国天主教大学物理系)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ECLIPSE框架,通过信息论方法检测金融领域AI幻觉,显著提升检测性能。

Comments 17 pages, 7 figures. Information-theoretic, hallucination detector for financial application. Feedback from researchers and practitioners is welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08785 2025-12-04 cs.CL 57%

Privacy-protected Retrieval-Augmented Generation for Knowledge Graph Question Answering

隐私保护的检索增强生成用于知识图谱问答

Yunfeng Ning, Mayi Xu, Jintao Wen, Qiankun Pi, Yuanyuan Zhu, Ming Zhong, Jiawei Jiang, Tieyun Qian

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.CL

AI总结 本文提出ARoG框架,通过关系中心和结构导向的抽象策略,解决隐私保护下的知识图谱问答中的检索与隐私问题。

Comments Accepted by AAAI 2026, camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏