arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7596 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7596 篇

2608.16657 2026-08-18 cs.CY 新提交 86%

The ultimate carbon cost of a ChatGPT query

一次ChatGPT查询的最终碳成本

Paul Kron

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究结合多领域成果,估算ChatGPT类LLM单次查询最终碳成本约0.4美元、对应10gCO₂eq,引入QCC概念以凸显AI对地球健康的影响,为相关研究提供方向。

Comments 5 pages,0 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv:LOCO2026/P15

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08622 2026-08-11 cs.CV 新提交 86%

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

VADER:用于视频大语言模型幻觉缓解的自适应去偏方法

Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title)

AI总结 本研究针对视频大语言模型的幻觉问题,提出无训练自适应去偏框架VADER,通过视觉焦点重分配与选择性证据擦除模块结合对比解码,在LLaVA-Video-7B等模型的EventHallusion任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07521 2026-08-11 cs.HC 新提交 86%

CyberSelf: Embodied Self-Distancing for Emotional Support in Virtual Reality

CyberSelf:用于虚拟现实中情绪支持的具身自我疏离

Bing Li, Dr Yan Hu, Tinghui Li, Yinuo Zhang, Wen Ma, Yuanfeng Zhou, Professor Yiran Shen

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出VR情绪支持系统CyberSelf,整合相似化身、克隆语音与LLM实时对话,短期及长期研究显示其可提升情绪与应对指标,实现具身自我疏离以支持情绪调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04635 2026-07-31 cs.RO 版本更新 86%

Relational Scene Graphs for Object Grounding of Natural Language Commands

基于关系场景图的对象接地自然语言指令

Julia Kuhn, Francesco Verdoja, Tsvetomila Mihaylova, Ville Kyrki

机构 * School of Electrical Engineering, Aalto University(艾尔沃大学电气工程学院) School of Science, Aalto University(艾尔沃大学科学学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于关系场景图的方法,通过结合LLM和VLM增强自然语言指令中对象接地的准确性。

Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19371 2026-07-23 cs.AI cs.CL cs.LG 新提交 86%

Mitigating Scaffolding Collapse in Socratic Tutors via Representation Alignment

通过表示对齐减轻苏格拉底式导师中的支架坍塌

Jing Shao, Qifeng Wu, Hanyu Zhang, Sixia Sun, Jun Zhuang

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究基于大语言模型的苏格拉底式导师的支架坍塌问题,提出支架保留表示对齐方法,先监督微调预热,再结合轨迹加权优化与表示损失,经多学科和策略评估,该方法能提升长程苏格拉底辅导的鲁棒性。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 86%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11132 2026-06-25 cs.SE 版本更新 86%

Rethinking Technology Stack Selection with AI Coding Proficiency

重新思考基于AI编程能力的技术栈选择

Xiaoyu Zhang, Weipeng Jiang, Shiqing Ma, Qingshuang Bao, Chenhao Lin, Chao Shen, Tianlin Li, Juan Zhai

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出AI编程能力概念,通过170个第三方库和6个LLM的实证研究发现,相似功能的库在LLM生成代码质量上差异高达84%,呼吁将AI编程能力纳入技术选择框架。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18114 2026-06-23 cs.CL cs.AI cs.LG 86%

Evaluating Evaluation Metrics -- The Mirage of Hallucination Detection

评估评估指标——幻觉检测的幻象

Atharva Kulkarni, Yuan Zhang, Joel Ruben Antony Moniz, Xiou Ge, Bo-Hsiang Tseng, Dhivya Piraviperumal, Swabha Swayamdipta, Hong Yu

机构 * University of Southern California(南加州大学) Apple Inc.(苹果公司)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文评估了6种幻觉检测指标在4个数据集、37个语言模型和5种解码方法上的表现,发现现有指标与人类判断不一致,且参数规模影响不一致,LLM评估和模式寻求解码方法能有效减少幻觉。

Comments Accepted at EMNLP 2025 Findings (Short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11908 2026-06-03 cs.AI cs.CL cs.LG 86%

When Should LLMs Be Less Specific? Selective Abstraction for Reliable Long-Form Text Generation

LLM何时应降低具体性?面向可靠长文本生成的选择性抽象

Shani Goren, Ido Galil, Ran El-Yaniv

机构 * Technion(技术离子大学) NVIDIA(英伟达)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在长文本生成中因低置信度而丢弃有价值信息的问题,提出选择性抽象框架,通过原子级抽象替换不确定内容,在保持语义的同时提升准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03658 2026-05-18 cs.CL cs.AI cs.LG stat.ML 86%

The Linear Representation Hypothesis and the Geometry of Large Language Models

线性表示假说与大语言模型的几何学

Kiho Park, Yo Joong Choe, Victor Veitch

机构 * University of Chicago(芝加哥大学)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨线性表示的定义及其在表示空间中的几何意义,通过反事实语言形式化并证明其与线性探测和模型操控的关联,提出非欧几里得内积统一线性表示概念,实验验证概念表示的存在及其对解释与控制的重要性。

Comments Accepted for a presentation at ICML 2024 and an oral presentation at NeurIPS 2023 Workshop on Causal Representation Learning. Code is available at https://github.com/KihoPark/linear_rep_geometry

Journal ref In Proceedings of the 41st International Conference on Machine Learning (ICML), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09602 2026-05-12 physics.ed-ph 86%

Performance and failure modes of AI chatbots on a novel concept inventory on relativity in classical mechanics

人工智能聊天机器人在相对论经典力学新概念库存中的性能与故障模式

Eugenio Tufino, Caterina Giovanzana, Andrea Zamboni, Pasquale Onorato, Stefano Oss

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究评估了三种前沿LLM在新开发的相对论经典力学概念库存中的表现,发现其性能依赖于具体问题,且错误模式与学生不同,提示概念库存的实施需考虑此类依赖性。

Comments 19 pages,3 figures, 2 tables, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25264 2026-04-29 cs.CR cs.SE 86%

MARD: A Multi-Agent Framework for Robust Android Malware Detection

MARD:一种用于鲁棒Android恶意软件检测的多智能体框架

Xueying Zeng, Youquan Xian, Sihao Liu, Xudong Mou, Yanze Li, Lei Cui, Bo Li

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 MARD通过结合LLM的语义理解和传统静态分析,提出多智能体框架,有效降低APK深度分析成本,实现高可解释性检测,F1得分达93.46%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20202 2026-04-23 cs.SE 86%

Hallucination Inspector: A Fact-Checking Judge for API Migration

幻觉检查员:一种用于API迁移的事实核查法官

Marcos Tileria, Santanu Kumar Dash, Profir-Petru Pârţachi, Earl T. Barr

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Hallucination Inspector,一种静态分析工具,用于检测LLM生成代码中的幻觉错误,通过轻量评估框架验证抽象语法树中的符号与API文档知识库的一致性,有效减少误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17108 2026-03-25 cs.CV 86%

LLM-Powered Flood Depth Estimation from Social Media Imagery: A Vision-Language Model Framework with Mechanistic Interpretability for Transportation Resilience

基于大语言模型的社交媒体影像洪水深度估计:一种具有机制可解释性的视觉-语言模型框架用于交通韧性

Nafis Fuad, Xiaodong Qian

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(title)

AI总结 本文提出FloodLlama,一种基于视觉-语言模型的洪水深度估计框架,通过合成数据集和多模态传感管道实现厘米级实时洪水深度估计,提升交通网络韧性。

Comments There is a update in result, which is needed to be addressed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02250 2026-03-04 cs.SD eess.AS 86%

SGPA: Spectrogram-Guided Phonetic Alignment for Feasible Shapley Value Explanations in Multimodal Large Language Models

SGPA: 基于频谱的语音对齐用于多模态大语言模型中可行的谢普利值解释

Paweł Pozorski, Jakub Muszyński, Maria Ganzha

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title)

AI总结 SGPA通过结合连接主义时间分类和频谱边界细化,实现了多模态大语言模型中可行的音频解释,显著减少了模型评估次数并保持了全局轮廓。

Comments Submitted for admission in Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04058 2026-01-27 cs.GR cs.CV 86%

SMooGPT: Stylized Motion Generation using Large Language Models

SMooGPT:利用大语言模型进行风格化动作生成

Lei Zhong, Yi Yang, Changjian Li

机构 * University of Edinburgh(爱丁堡大学)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract)

AI总结 SMooGPT通过利用大语言模型的推理、组合和生成能力,实现风格化动作生成,提升动作控制和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12065 2025-11-21 cs.NI 86%

Towards a Wireless Physical-Layer Foundation Model: Challenges and Strategies

迈向无线物理层基础模型:挑战与策略

Jaron Fontaine, Adnan Shahid, Eli De Poorter

专题命中 知识编辑与模型理解 :foundation model(title,abstract);large language model(abstract,comments);language model(abstract,comments)

AI总结 本文提出统一的无线物理层基础模型,旨在解决无线网络中任务特定AI策略的问题,通过预训练任务和语义学习提升模型的通用性和可交互性。

Comments This paper is accepted and part of the WS33 IEEE ICC 2024 1st Workshop on The Impact of Large Language Models on 6G Networks proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07334 2025-11-17 cs.CV 86%

Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment

Xing Xie, Jiawei Liu, Ziyue Lin, Huijie Fan, Zhi Han, Yandong Tang, Liangqiong Qu

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract)

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16078 2025-06-23 cs.LG cs.AI cs.CL cs.CR 86%

Probing the Robustness of Large Language Models Safety to Latent Perturbations

Tianle Gu, Kexin Huang, Zongqi Wang, Yixu Wang, Jie Li, Yuanqi Yao, Yang Yao, Yujiu Yang, Yan Teng, Yingchun Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际 Graduate School, 清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12384 2025-06-17 cs.AI cs.CL cs.LG 86%

Model Merging for Knowledge Editing

Zichuan Fu, Xian Wu, Guojing Li, Yingying Zhang, Yefeng Zheng, Tianshi Ming, Yejing Wang, Wanyu Wang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯 Jarvis 实验室) Westlake University(西湖大学) Tongji University(同济大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 11 pages, 3 figures

Journal ref ACL 2025 (Industry) Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04741 2025-05-09 cs.LG cs.AI cs.CL 86%

When Bad Data Leads to Good Models

Kenneth Li, Yida Chen, Fernanda Viégas, Martin Wattenberg

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05348 2024-05-10 cs.CL cs.AI cs.LG 86%

The Effect of Model Size on LLM Post-hoc Explainability via LIME

Henning Heyen, Amy Widdicombe, Noah Y. Siegel, Maria Perez-Ortiz, Philip Treleaven

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments Published at ICLR 2024 Workshop on Secure and Trustworthy Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17168 2026-08-21 cs.CL 版本更新 85%

RepSelect: Robust LLM Unlearning via Representation Selectivity

RepSelect: 通过表示选择性实现鲁棒的大语言模型遗忘

Filip Sondej, Yushi Yang, Adam Mahdi

机构 * Independent(独立) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);prompting(abstract);分类 cs.CL

AI总结 针对现有遗忘方法易被微调或少样本提示逆转的问题,提出RepSelect方法,通过梯度主成分坍塌隔离遗忘集表示,实现深度鲁棒遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07894 2026-08-11 cs.LG cs.PL 新提交 85%

LLM-Based Embeddings for Program Analysis and Optimization

基于大语言模型嵌入的程序分析与优化

Calvin Higgins, Marco Alvarez

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究首次将LLMCompiler生成的程序嵌入应用于程序分析与优化任务,结合源与IR代码嵌入在算法分类上错误率1.54%、较SOTA提升12%,为代码优化提供新方向。

Journal ref 2025 International Joint Conference on Neural Networks (IJCNN), Rome, Italy, 2025, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02124 2026-08-04 cs.CV cs.CL 新提交 85%

HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models

HAFI-VLM:用于诊断和增强视觉语言模型中视觉感知的频率视角

Jin Cui, Chuanchang Su, Jiayi Lu, Xinyue Long, Boran Zhao, Pengju Ren

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对VLMs视觉预测不可靠的频谱响应刚性问题,提出HAFI-VLM,通过任务条件频率通路与相关组件优化,在多个VLMs基准上提升了视觉感知性能。

Comments 11 pages, 8 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01710 2026-08-04 cs.AI 新提交 85%

Beyond Single-Use Tokens: Durable Authorization State for Replay-Resistant LLM Agent Actions

超越单次使用令牌:面向抗重放的大语言模型智能体行动的持久授权状态

Jinghan Xu, Longze Fan, Zeyuan Wang, Xinjin Li, Hankai Liu

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体重规划等行为引发的语义重放问题,提出 CapLease 授权消耗层,结合服务器账本实现抗重放,证明持久授权状态是抗重放智能体执行的系统要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10645 2026-07-21 cs.CL cs.MA cs.SI 版本更新 85%

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

MafiaScope:社交推理游戏中对大语言模型智能体的非侵入性、时间分辨信念探测

Ilia Karpov

机构 * HSE University(俄罗斯高等经济研究大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL

AI总结 研究社交推理游戏中LLM智能体信念探测问题,提出MafiaScope测试平台,通过结构化问题让智能体私下作答并自动评分,可视化呈现信念轨迹,以DeepSeek为例进行研究,得出相关校准误差等结果并开源相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06310 2026-07-21 cs.CY cs.AI cs.MA 85%

Too Human to Model:The Uncanny Valley of LLMs in Social Simulation -- When Generative Language Agents Misalign with Modelling Principles

过于人性化的模型:LLM在社交模拟中的怪诞谷--当生成语言代理与建模原则不一致时

Yongchao Zeng, Calum Brown, Mark Rounsevell

专题命中 知识编辑与模型理解 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了LLM在社交模拟中因过于人性化的特性导致的抽象与自然性矛盾,指出其在建模原则下的局限性,并提出重新定位LLM代理以适应不同应用场景的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09503 2026-07-13 cs.CV cs.AI 新提交 85%

What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

VGGT 对重叠的理解:探索共可见性的几何基础模型

Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究三维重建和机器人定位中共可见性问题,通过探索 VGGT 模型,发现其隐式编码共可见性及层间特性,引入 Co-VGGT 方法,该方法冻结 VGGT 并训练轻量级头,在基准测试中表现出色,提升了共可见性分类效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04963 2026-07-07 cs.AI 新提交 85%

STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training

STAPO:用于大语言模型智能体训练的选择性轨迹感知策略优化

Qiuyi Qi, Tian Liang, Mutian Bao, Jinjian Zhang, Dongnan Liu, Wei Zhou, Linjian Mo, Ming Kong, Jie Liu, Feng Zhang, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学) College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对强化学习训练大语言模型智能体时轨迹忽视问题,提出归一化熵,引入STAPO框架,利用其定位异常步骤,通过联合机制优化,提升轨迹感知并保持训练稳定性,实验验证其有效性和鲁棒性。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏