arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-30 至 2025-12-30 共收录 244 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 15 篇

2512.22508 2025-12-30 cs.LG cs.AI 88%

Predicting LLM Correctness in Prosthodontics Using Metadata and Hallucination Signals

利用元数据和幻觉信号预测牙科修复学中大语言模型的正确性

Lucky Susanto, Anasta Pranawijayana, Cortino Sukotjo, Soni Prasad, Derry Wijaya

机构 * 1 Department of Data Science, Monash University Indonesia, Tangerang, Indonesia 2 Independent Researcher 3 Department of Prosthodontics, University of Pittsburgh, Pittsburgh, Pennsylvania 4 Department of Restorative Sciences, University of North Carolina Adams School of Dentistry, Chapel Hill, North Carolina 5 Department of Computer Science, Boston University, Boston, Massachusetts

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究通过元数据和幻觉信号预测牙科修复学中LLM的正确性,发现元数据方法可提升准确性,但需进一步改进以适应高风险应用。

Comments Accepted as a Short Paper at HEALTHINF2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23518 2025-12-30 cs.CL 85%

Single LLM Debate, MoLaCE: Mixture of Latent Concept Experts Against Confirmation Bias

单个LLM辩论,MoLaCE:混合潜在概念专家对抗确认偏见

Hazel Kim, Philip Torr

机构 * Department of Computer Science University of Oxford(牛津大学计算机科学系)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MoLaCE通过混合潜在概念专家减少LLM的确认偏见,提升鲁棒性并高效实现多智能体辩论效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22250 2025-12-30 cs.SE 85%

Hallucination Detection for LLM-based Text-to-SQL Generation via Two-Stage Metamorphic Testing

通过双阶段元测试检测基于大语言模型的文本到SQL生成中的幻觉

Bo Yang, Yinfen Xia, Weisong Sun, Yang Liu

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过双阶段元测试方法检测基于大语言模型的文本到SQL生成中的幻觉,无需地面真实数据,提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22245 2025-12-30 cs.LG cs.AI 81%

Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation

校准大语言模型法官:用于快速可靠不确定性估计的线性探针

Bhaktipriya Radharapu, Eshika Saxena, Kenneth Li, Chenxi Whitehouse, Adina Williams, Nicola Cancedda

机构 * FAIR at Meta(Meta 的 FAIR 研究所) Meta Superintelligence Labs(Meta 超智能实验室)

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于线性探针的校准方法,通过Brier分数损失训练,实现快速可靠的LLM法官不确定性估计,相比现有方法在计算效率和泛化能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06474 2025-12-30 cs.CV cs.AI cs.LG 81%

Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding

通过不确定性引导的丢弃解码增强视觉-语言模型的可靠性

Yixiong Fang, Ziran Yang, Zhaorun Chen, Zhuokai Zhao, Jiawei Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学) University of Chicago(芝加哥大学) Stony Brook University(石溪大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过不确定性引导的丢弃解码方法,有效减少视觉-语言模型的幻觉问题,提升输出的可靠性和质量。

Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23453 2025-12-30 cs.CV cs.AI 79%

CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models

CoFi-Dec:通过粗到细的生成反馈在大视觉-语言模型中实现抗幻觉解码

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 CoFi-Dec通过粗到细的生成反馈机制,在大视觉-语言模型中减少幻觉,提升解码的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05407 2025-12-30 cs.LG cs.AI stat.ML 79%

Dictionary Learning: The Complexity of Learning Sparse Superposed Features with Feedback

字典学习:通过反馈学习稀疏叠加特征的复杂性

Akash Kumar

机构 * Department of Computer Science \& Engineering, University of California, San Diego, USA

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过反馈机制,研究在稀疏设置下学习字典特征的复杂性,并验证了理论结果在特征恢复和字典提取中的有效性。

Comments ICML'25, 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23557 2025-12-30 cs.CR cs.AI 77%

Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks

迈向可信的代理AI:一种多模态框架用于防止提示注入攻击

Toqeer Ali Syed, Mishal Ateeq Almutairi, Mahmoud Abdel Moaty

机构 * Faculty of Computer and Information System(计算机与信息系统系) Islamic University of Madinah(麦地那伊斯兰大学) Arab Open University-Bahrain(巴林阿拉伯开放大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过溯源感知机制防止代理AI中的提示注入攻击,提升系统安全性和稳定性。

Comments It is accepted in a conference paper, ICCA 2025 in Bahrain on 21 to 23 December

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23547 2025-12-30 cs.CL cs.AI 73%

Lie to Me: Knowledge Graphs for Robust Hallucination Self-Detection in LLMs

对谎言说谎:知识图谱在大语言模型鲁棒性幻觉自检测中的应用

Sahil Kale, Antonio Luca Alfeo

机构 * eCampus University(eCampus大学)

专题命中 知识编辑与模型理解 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出利用知识图谱提升大语言模型幻觉自检的鲁棒性,通过转换响应为图谱并估算幻觉可能性,实现准确率和F1分数的显著提升。

Comments Accepted to ICPRAM 2026 in Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22744 2025-12-30 cs.LG 70%

Bridging Global Intent with Local Details: A Hierarchical Representation Approach for Semantic Validation in Text-to-SQL

弥合全局意图与局部细节:一种用于文本到SQL语义验证的层次表示方法

Rihong Qiu, Zhibang Yang, Xinke Jiang, Weibin Liao, Xin Gao, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * Peking University(北京大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 HEROSQL通过整合逻辑计划和抽象语法树,提升文本到SQL的语义验证效果,实现更准确的细粒度语义检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22423 2025-12-30 cs.CV cs.AI cs.LG 62%

Bright 4B: Scaling Hyperspherical Learning for Segmentation in 3D Brightfield Microscopy

Bright 4B: 通过超球面学习实现3D明场显微镜中分割的扩展

Amil Khan, Matheus Palhares Viana, Suraj Mishra, B. S. Manjunath

机构 * UC Santa Barbara(UC圣芭芭拉大学) Allen Institute for Cell Sciences(细胞科学研究院)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 Bright-4B通过超球面学习实现3D明场显微镜中无需荧光的亚细胞结构分割,提供高精度的细胞形态分割方法。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22511 2025-12-30 cs.LG 57%

Decomposing Task Vectors for Refined Model Editing

任务向量分解以实现精细模型编辑

Hamed Damirchi, Ehsan Abbasnejad, Zhen Zhang, Javen Shi

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Monash University(莫纳什大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 本文提出一种任务向量分解方法,通过分离共享知识和独特信息,提升模型编辑的精度和效果。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09614 2025-12-30 cs.CV cs.CL 57%

RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance

RAVEL:通过图驱动的关系引导进行罕见概念生成与编辑

Kavana Venkatesh, Yusuf Dalva, Ismini Lourentzou, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学) UIUC(伊利诺伊大学香槟分校)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.CL

AI总结 RAVEL通过图驱动的关系引导方法,提升罕见概念生成与编辑的可控性和可解释性,适用于长尾领域。

Comments Project Page: https://ravel-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20032 2025-12-30 cs.CV 50%

VALLR-Pin: Uncertainty-Factorized Visual Speech Recognition for Mandarin with Pinyin Guidance

VALLR-Pin:基于拼音引导的中文视觉语音识别中的不确定性因子化方法

Chang Sun, Dongliang Xie, Wanpeng Xie, Bo Qin, Hong Yang

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) First Research Institute of the Ministry of Public Security of the People’s Republic of China(中华人民共和国公安部第一研究所)

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 VALLR-Pin通过引入拼音作为中间表示,结合轻量LLM细化模块,提升了中文视觉语音识别的转录准确性,尤其在多说话人条件下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他LLM 20 篇

2512.22603 2025-12-30 cs.CL 89%

Structured Prompting and LLM Ensembling for Multimodal Conversational Aspect-based Sentiment Analysis

结构化提示与大语言模型集成用于多模态对话基于方面的情感分析

Zhiqiang Gao, Shihao Gao, Zixing Zhang, Yihao Guo, Hongyu Chen, Jing Han

机构 * Hunan University(湖南大学) University of Cambridge(剑桥大学)

专题命中 其他LLM :prompting(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出结构化提示与大语言模型集成方法,用于多模态对话基于方面的情感分析,有效提升情感识别与翻转检测的准确性。

Journal ref ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03831 2025-12-30 cs.LG physics.atm-clus physics.chem-ph physics.comp-ph 88%

A large language model-type architecture for high-dimensional molecular potential energy surfaces

用于高维分子势能面的大型语言模型型架构

Xiao Zhu, Srinivasan S. Iyengar

机构 * Department of Chemistry, Department of Physics(化学系、物理系) the Indiana University Quantum Science(印第安纳大学量子科学) Engineering Center (IU-QSEC), Indiana University, 800 E. Kirkwood Ave, Bloomington, IN-47405(工程中心(IU-QSEC),印第安纳大学,800 E. Kirkwood Ave,布卢明顿,IN-47405)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于图神经网络的架构,用于高效计算高维分子势能面,实现了对186维势能面的高精度预测。

Comments 31 pages, 35 figures

Journal ref Phys. Rev. X, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23136 2025-12-30 cs.HC 87%

Understanding EFL Learners' Code-Switching and Teachers' Pedagogical Approaches in LLM-Supported Speaking Practice

理解外语学习者在LLM支持下的语用转换及教师教学方法

Junyeong Park, Jieun Han, Yeon Su Park, Youngbin Lee, Suin Kim, Juho Kim, Alice Oh, So-Yeon Ahn

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了LLM支持下EFL学习者语用转换的使用及教师教学策略,发现学习者通过语用转换表达文化情感,教师采用动态支架策略促进有意义学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05499 2025-12-30 cs.CR cs.AI cs.CL cs.SE 86%

Prompt Injection attack against LLM-integrated Applications

针对集成大语言模型应用的提示注入攻击

Yi Liu, Gelei Deng, Yuekang Li, Kailong Wang, Zihao Wang, Xiaofeng Wang, Tianwei Zhang, Yepang Liu, Haoyu Wang, Yan Zheng, Leo Yu Zhang, Yang Liu

机构 * Griffith University(格里菲斯大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Huazhong University of Science and Technology(华中科技大学) Indiana University at Bloomington(印第安纳大学布卢明顿分校) Southern University of Science and Technology(南方科技大学) Tianjin University(天津大学)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出HouYi技术,揭示LLM集成应用中提示注入攻击的潜在风险及缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22625 2025-12-30 cs.AI cs.MA 85%

The Wisdom of Deliberating AI Crowds: Does Deliberation Improve LLM-Based Forecasting?

众智AI深思:深思是否能提升基于LLM的预测?

Paul Schneider, Amalie Schramm

机构 * PRIORB

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨通过让LLM互相审查预测是否能提升其准确性,发现结构化深思在多样化模型中有效,但对同质模型无帮助。

Comments 13 pages, 2 figures, 5 tables, for source code and data see https://github.com/priorb-source/delib-ai-wisdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22790 2025-12-30 cs.HC 85%

ChatGraPhT: A Visual Conversation Interface for Multi-Path Reflection with Agentic LLM Support

ChatGraPhT: 多路径反思的视觉对话界面与代理LLM支持

Geoff Kimm, Linus Tan

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 ChatGraPhT通过可视化对话地图和代理LLM支持,提升复杂任务中的反思深度与灵活性。

Comments Early-stage research prototype; exploratory study

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22462 2025-12-30 cs.HC cs.CY 85%

Relational Mediators: LLM Chatbots as Boundary Objects in Psychotherapy

关系调解者:LLM聊天机器人作为心理治疗中的边界对象

Jiatao Quan, Ziyue Li, Tian Qi Zhu, Yuxuan Li, Baoying Wang, Wanda Pratt, Nan Gao

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出动态边界调解框架,旨在通过LLM聊天机器人调解心理治疗中的关系复杂性,解决边缘化用户在信任建立、身份教育和自我披露中的挑战。

Comments To be published in CSCW 2026, Issue 2 of PACMHCI, 35 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00256 2025-12-30 cs.SE 85%

LLM4FP: LLM-Based Program Generation for Triggering Floating-Point Inconsistencies Across Compilers

LLM4FP: 基于大型语言模型的程序生成以触发不同编译器间的浮点不一致

Yutong Wang, Cindy Rubio-González

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 LLM4FP通过生成浮点程序触发不同编译器间的不一致,提升数值不一致检测能力,揭示更多优化级别间的不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10321 2025-12-30 cs.LG cs.AI cs.CL cs.CR 85%

AdvPrefix: An Objective for Nuanced LLM Jailbreaks

AdvPrefix: 一种面向 nuanced LLM 模型 jailbreak 的目标

Sicheng Zhu, Brandon Amos, Yuandong Tian, Chuan Guo, Ivan Evtimov

机构 * University of Maryland, College Park(马里兰大学 College Park分校) FAIR, Meta(Meta的FAIR)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AdvPrefix 提出了一种新的目标,通过结合高预填充攻击成功率和低负对数似然来选择模型依赖的前缀,以提升 jailbreak 攻击的精确性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23676 2025-12-30 cs.AI cs.CL cs.CV 79%

Web World Models

Jichen Feng, Yifan Zhang, Chenggong Zhang, Yifu Lu, Shilong Liu, Mengdi Wang

机构 * Princeton University(普林斯顿大学) University of California(加州大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);language agent(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://github.com/Princeton-AI2-Lab/Web-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11239 2025-12-30 cs.CV 78%

Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition

跨模态提示用于平衡不完整多模态情绪识别

Wen-Jue He, Xiaofeng Zhu, Zheng Zhang

专题命中 其他LLM :prompting(title,abstract)

AI总结 本文提出跨模态提示方法,通过增强模态特定特征和动态加权提升多模态情绪识别的准确性和鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24408 2025-12-30 cs.CR cs.LG 77%

FuncPoison: Poisoning Function Library to Hijack Multi-agent Autonomous Driving Systems

FuncPoison:用于劫持多智能体自动驾驶系统的中毒函数库

Yuzhen Long, Songze Li

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FuncPoison通过注入恶意工具篡改多智能体自动驾驶系统的函数库,导致决策错误和系统误导,揭示了该领域的重要安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22725 2025-12-30 cs.CL cs.CY 77%

Mitigating Social Desirability Bias in Random Silicon Sampling

在随机硅采样中缓解社会可取性偏差

Sashank Chapala, Maksym Mironov, Songgaojun Deng

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过提示工程方法减轻LLM中的社会可取性偏差,提升硅样本与人类数据的一致性。

Comments 31 pages, 9 figures, and 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22903 2025-12-30 cs.LG cs.CL 73%

Debugging Tabular Log as Dynamic Graphs

基于动态图的表格日志调试

Chumeng Liang, Zhanyang Jin, Zahaib Akhtar, Mona Pereira, Haofei Yu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出GraphLogDebugger框架,利用动态图模型高效调试表格日志,优于大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22382 2025-12-30 cs.LG cs.AI stat.ML 73%

Completed Hyperparameter Transfer across Modules, Width, Depth, Batch and Duration

跨模块、宽度、深度、批大小和持续时间的超参数转移

Bruno Mlodozeniec, Pierre Ablin, Louis Béthune, Dan Busbridge, Michal Klein, Jason Ramapuram, Marco Cuturi

机构 * Apple(苹果公司)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一宽度、深度、批大小和持续时间缩放的参数化方法,实现了跨模块超参数的优化与转移,提升了大规模模型的训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23300 2025-12-30 cs.CL 70%

AI4Reading: Chinese Audiobook Interpretation System Based on Multi-Agent Collaboration

AI4Reading: 基于多智能体协作的中文有声书解读系统

Minjiang Huang, Jipeng Qiang, Yi Zhu, Chaowei Zhang, Xiangyu Zhao, Kui Yu

机构 * Yangzhou University(扬州大学) City University of Hong Kong(香港城市大学) Hefei University of Technology(合肥工业大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AI4Reading通过多智能体协作,利用大语言模型和语音合成技术,生成更简洁准确的有声书解读内容。

Comments ACL 2025 demo

详情

展开后加载摘要…

URL PDF HTML 收藏