arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-12 至 2026-01-12 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 15 篇

2511.02108 2026-01-12 cs.SE cs.AI 89%

Metamorphic Testing of Large Language Models for Natural Language Processing

大型语言模型在自然语言处理中的变形测试

Steven Cho, Stefano Ruberto, Valerio Terragni

机构 * University of Auckland(奥克兰大学)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出了一种针对大型语言模型的变形测试方法,通过收集和实验191个变形关系,评估了变形测试在自然语言处理任务中的有效性与局限性。

Journal ref Proc. 2025 IEEE Int. Conf. on Software Maintenance and Evolution (ICSME), pp. 174-186, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05542 2026-01-12 cs.SE cs.AI cs.LG 89%

Understanding LLM-Driven Test Oracle Generation

理解由大语言模型驱动的测试 oracle 生成

Adam Bodicoat, Gunel Jahangirova, Valerio Terragni

机构 * University of Auckland(奥克兰大学) King's College London(伦敦国王学院)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文研究了大语言模型在生成测试 oracle 以暴露软件故障中的有效性,探讨了提示策略和上下文输入对 oracle 质量的影响。

Comments Accepted for presentation at the 2nd ACM/IEEE International Conference on AI-powered Software (AIware 2025)

Journal ref Proc. 2nd ACM/IEEE International Conference on AI-powered Software (AIware 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05903 2026-01-12 cs.CL 85%

HAPS: Hierarchical LLM Routing with Joint Architecture and Parameter Search

HAPS: 基于联合架构和参数搜索的分层LLM路由

Zihang Tian, Rui Li, Jingsen Zhang, Xiaohe Bo, Wei Huo, Xu Chen

机构 * Renmin University of China(中国人民大学) Wireless Technology Lab, Huawei Technologies Co., Ltd.(华为技术有限公司无线技术实验室)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HAPS通过联合搜索模型架构和参数,提升大型语言模型在多样化任务中的路由性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05835 2026-01-12 cs.CL 85%

Left, Right, or Center? Evaluating LLM Framing in News Classification and Generation

左、右或中间?评估LLM在新闻分类和生成中的框架

Molly Kennedy, Ali Parker, Yihong Liu, Hinrich Schütze

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究评估了LLM在新闻分类和生成中的框架倾向,发现存在系统性的中间框架倾向,Grok 4表现最意识形态,Claude Sonnet 4.5和Llama 3.1在商业和开放权重模型中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16035 2026-01-12 cs.CL cs.AI 84%

Liars' Bench: Evaluating Lie Detectors for Language Models

说谎的检验台:评估语言模型的说谎检测器

Kieron Kretschmar, Walter Laurito, Sharan Maiya, Samuel Marks

机构 * Cadenza Labs(Cadenza实验室) FZI(弗劳恩霍夫研究所) University of Cambridge(剑桥大学)

专题命中 其他LLM :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LIARS' BENCH,通过多个数据集和模型生成72,863个谎言和诚实响应,评估三种谎言检测技术,揭示现有方法在识别特定类型谎言上的局限性。

Comments *Kieron Kretschmar and Walter Laurito contributed equally to this work. 10 pages, 2 figures; plus appendix. Code at https://github.com/Cadenza-Labs/liars-bench and datasets at https://huggingface.co/datasets/Cadenza-Labs/liars-bench Subjects: Computation and Language (cs.CL); Artificial Intelligence (cs.AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21434 2026-01-12 hep-ph cs.AI cs.LG hep-ex physics.data-an 81%

Foundation models for high-energy physics

高能物理中的基础模型

Anna Hallin

机构 * Institute for Experimental Physics, University of Hamburg(汉堡大学实验物理研究所)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文综述了高能物理中基础模型的应用现状,探讨了其在粒子物理数据中的潜在应用与研究进展。

Comments Submitted to SciPost Physics Proceedings (EuCAIFCon 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05579 2026-01-12 cs.DB cs.AI cs.CL cs.SE 79%

RISE: Rule-Driven SQL Dialect Translation via Query Reduction

RISE: 通过查询简化实现规则驱动的SQL方言翻译

Xudong Xie, Yuwei Zhang, Wensheng Dou, Yu Gao, Ziyu Cui, Jiansen Song, Rui Yang, Jun Wei

机构 * Institute of Software at CAS, China(中国科学院软件研究所)

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RISE通过查询简化技术,利用LLM实现高效准确的SQL方言翻译,显著提升翻译准确率。

Comments Accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05904 2026-01-12 cs.CY cs.AI 77%

Can AI mediation improve democratic deliberation?

人工智能调解能否提升民主讨论?

Michael Henry Tessler, Georgina Evans, Michiel A. Bakker, Iason Gabriel, Sophie Bridgers, Rishub Jain, Raphael Koster, Verena Rieser, Anca Dragan, Matthew Botvinick, Christopher Summerfield

机构 * Google DeepMind(谷歌DeepMind) Massachusetts Institute of Technology(麻省理工学院) Yale Law School(耶鲁法学院) Department of Experimental Psychology, University of Oxford(牛津大学实验心理学系)

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨人工智能如何通过增强参与、公平调解和有意义讨论来提升民主讨论的质量。

Journal ref Knight Institute for the First Amendment at Columbia University Symposium on "AI and Democratic Freedoms", April 10-11, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24803 2026-01-12 cs.CL cs.HC 77%

Guiding Generative Storytelling with Knowledge Graphs

通过知识图谱引导生成叙事

Zhijun Pan, Antonios Andronis, Eva Hayek, Oscar AP Wilkinson, Ilya Lasy, Annette Parry, Guy Gadney, Tim J. Smith, Mick Grierson

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过知识图谱辅助生成叙事,提升长篇叙述的质量和用户可控性,实验表明结构明确的叙述有明显改进,但反思性故事未见提升。

Comments Accepted for publication in the International Journal of Human-Computer Interaction. Published online 29 December 2025

Journal ref International Journal of Human-Computer Interaction (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05555 2026-01-12 cs.SE 75%

An Empirical Study of Policy-as-Code Adoption in Open-Source Software Projects

对开源软件项目中政策即代码采用的实证研究

Patrick Loic Foalem, Foutse Khomh, Leuson Da Silva, Ettore Merlo

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过分析399个开源项目,揭示了政策即代码工具在治理、配置控制和文档中的广泛应用,并提出了包含5类15子类的分类法,为未来研究提供实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01042 2026-01-12 cs.CV cs.CR cs.LG 70%

Transferability of Adversarial Attacks in Video-based MLLMs: A Cross-modal Image-to-Video Approach

视频基于多模态大语言模型中的对抗攻击可迁移性:一种跨模态图像到视频的方法

Linhao Huang, Xue Jiang, Zhiqiang Wang, Wentao Mo, Xi Xiao, Yong-Jie Yin, Bo Han, Feng Zheng

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种跨模态图像到视频的对抗攻击方法,用于研究视频多模态大语言模型的可迁移性,实验表明该方法在多个视频-文本多模态任务中表现出强对抗转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05384 2026-01-12 cs.AI cs.CL cs.CY 62%

Conformity and Social Impact on AI Agents

一致性与社会影响在人工智能代理中的作用

Alessandro Bellina, Giordano De Marzo, David Garcia

机构 * Centro Ricerche Enrico Fermi(恩里科·费米研究中心) Sony Computer Science Laboratories - Rome, Joint Initiative CREF-SONY(索尼计算机科学实验室-罗马,联合倡议CREF-SONY) University of Konstanz(康斯坦茨大学) Complexity Science Hub(复杂科学中心)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示人工智能代理在社会压力下易受操控,存在安全漏洞,需加强集体AI部署的安全保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03666 2026-01-12 cs.CL cs.AI cs.CV 62%

e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings

e5-omni: 显式跨模态对齐用于多模态嵌入

Haonan Chen, Sicheng Gao, Radu Timofte, Tetsuya Sakai, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) University of Würzburg(乌尔姆大学) Waseda University(早稻田大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 e5-omni通过显式对齐方法改进多模态嵌入,解决相似性尺度不一致、负样本效果下降和跨模态统计不匹配问题。

Comments https://huggingface.co/Haon-Chen/e5-omni-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05411 2026-01-12 cs.CL 57%

Glitter: Visualizing Lexical Surprisal for Readability in Administrative Texts

Glitter:行政文本可读性中的词汇意外性可视化

Jan Černý, Ivana Kvapilíková, Silvie Cinková

机构 * Charles University, Faculty of Mathematics and Physics(查理大学数学与物理系)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 Glitter通过多语言模型可视化文本信息熵,用于提升行政文本的可读性和清晰度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02172 2026-01-12 cs.SI 50%

RumorSphere: A Framework for Million-scale Agent-based Dynamic Simulation of Rumor Propagation

RumorSphere: 用于百万级基于代理的动态谣言传播模拟的框架

Yijun Liu, Wu Liu, Xiaoyan Gu, Hantao Yao, Weiping Wang, Jiebo Luo, Yongdong Zhang

专题命中 其他LLM :LLM(abstract)

AI总结 RumorSphere通过动态和分层的共振框架,实现百万级代理的谣言传播模拟,有效提升模拟精度并减少偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏