arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-25 至 2025-11-25 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 19 篇

2511.17666 2025-11-25 cs.CR cs.AI 89%

Evaluating Adversarial Vulnerabilities in Modern Large Language Models

评估现代大语言模型中的对抗漏洞

Tom Perel

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文评估了现代大语言模型在对抗攻击中的安全漏洞,通过比较Gemini 2.5 Flash和GPT-4的易受性,揭示了安全机制的差异及Transformer架构的潜在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17575 2025-11-25 cs.CL stat.ME stat.ML stat.OT 88%

Random Text, Zipf's Law, Critical Length,and Implications for Large Language Models

随机文本、齐夫定律、临界长度及对大语言模型的启示

Vladimir Berman

机构 * Aitiologia LLC(Aitiologia公司)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究通过简单模型推导出词长、词汇增长和齐夫定律之间的关系,揭示了随机文本中词频分布的结构基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23535 2025-11-25 cs.SE 88%

Comparative Analysis of the Code Generated by Popular Large Language Models (LLMs) for MISRA C++ Compliance

对流行大语言模型生成的代码在MISRA C++合规性方面的比较分析

Malik Muhammad Umer

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract)

AI总结 本文比较了多种大语言模型生成的C++代码在MISRA C++合规性上的表现,发现ChatGPT在合规性上表现最佳,而其他模型存在不同程度的违规问题。

Journal ref in IEEE Access, vol. 13, pp. 194815-194831, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18038 2025-11-25 cs.SE cs.AI cs.LG 86%

MASTEST: A LLM-Based Multi-Agent System For RESTful API Tests

MASTEST:基于LLM的多智能体系统用于RESTful API测试

Xiaoke Han, Hong Zhu

机构 * School of Engineering, Computing and Mathematics, Oxford Brookes University(工程、计算与数学学院,奥克斯伯里大学)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MASTEST利用LLM和编程智能体构建多智能体系统,实现RESTful API测试的全流程自动化,通过生成测试场景、脚本及分析响应,验证LLM在测试任务中的高效性与准确性。

Comments 14 Page of main text plus 4 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17671 2025-11-25 cs.CR cs.AI cs.CL 86%

MURMUR: Using cross-user chatter to break collaborative language agents in groups

利用跨用户交流打破协作语言代理组

Atharv Singh Patlan, Peiyao Sheng, S. Ashwin Hebbar, Prateek Mittal, Pramod Viswanath

机构 * Princeton University(普林斯顿大学) Sentient

专题命中 其他LLM :language agent(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MURMUR通过生成真实用户交互,揭示了跨用户污染攻击对多用户语言代理的威胁,并提出基于任务的聚类作为初步防御措施。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03463 2025-11-25 cs.SE cs.AI 85%

ALMAS: an Autonomous LLM-based Multi-Agent Software Engineering Framework

ALMAS: 一种基于自主LLM的多智能体软件工程框架

Vali Tawosi, Keshav Ramani, Salwa Alamir, Xiaomo Liu

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ALMAS是一种基于自主LLM的多智能体软件工程框架,旨在通过模块化集成与人类开发者协作,实现软件开发生命周期中的自动化任务。

Comments Accepted to MAS-GAIN Workshop at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18249 2025-11-25 cs.SE 85%

LLM Assisted Coding with Metamorphic Specification Mutation Agent

基于元形态规范变异代理的LLM编码

Mostafijur Rahman Akhond, Gias Uddin

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 CodeMetaAgent通过元形态关系驱动LLM代理,提升代码生成准确性与覆盖率,有效解决规范不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18194 2025-11-25 cs.CL 83%

Agent-as-a-Graph: Knowledge Graph-Based Tool and Agent Retrieval for LLM Multi-Agent Systems

Agent-as-a-Graph: 基于知识图谱的LLM多智能体系统中的工具与智能体检索

Faheem Nizar, Elias Lumer, Anmol Gulati, Pradeep Honaganahalli Basavaraju, Vamse Kumar Subbiah

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers(普华永道商业技术与创新办公室)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于知识图谱的智能体检索方法,通过构建智能体与工具的关系图谱,提升多智能体系统中工具和智能体的检索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15478 2025-11-25 cs.CL 83%

Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models

针对多模态语言模型的红队测试:评估不同提示模态和模型的有害性

Madison Van Doren, Casey Ford

专题命中 其他LLM :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究通过红队测试评估多模态语言模型在不同提示模态下的安全性,发现Pixtral 12B的有害响应率最高,而Claude Sonnet 3.5最安全,凸显了建立多模态安全基准的必要性。

Journal ref AAAI 2026 AIGOV Workshop and EurIPS 2025 Workshop on Unifying Perspectives on Learning Biases

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11667 2025-11-25 cs.LG cs.AI 79%

Beyond Superficial Forgetting: Thorough Unlearning through Knowledge Density Estimation and Block Re-insertion

超越表面遗忘:通过知识密度估计和块重新插入实现彻底遗忘

Feng Guo, Yuntao Wen, Shen Gao, Junshuo Zhang, Shuo Shang

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 KUnBR通过知识密度估计和块重新插入策略,有效解决大语言模型中有害知识的彻底移除问题,实现高效的遗忘与模型实用性平衡。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01215 2025-11-25 cs.CL cs.AI cs.PL cs.SE 79%

From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging

从代码到正确性:通过分层调试关闭代码生成的最后一公里

Yuling Shi, Songsong Wang, Chengcheng Wan, Min Wang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Davis(加州大学戴维斯分校) East China Normal University(华东师范大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MGDebugger,一种分层调试器,通过多粒度分析提升代码生成的准确性与修复效率。

Comments Accepted to ICSE 2026. Code and data available at https://github.com/YerbaPage/MGDebugger

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18416 2025-11-25 cs.LG 77%

Exploring Potential Prompt Injection Attacks in Federated Military LLMs and Their Mitigation

探索联邦军事大语言模型中的潜在提示注入攻击及其缓解方法

Youngjoon Lee, Taehyun Park, Yunho Lee, Jinu Gong, Joonhyuk Kang

机构 * Institute of Information & Communications Technology Planning & Evaluation (IITP)-ITRC (Information Technology Research Center)(信息与通信技术规划与评估机构(IITP)-ITRC(信息技术研究中心))

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了联邦军事大语言模型中潜在的提示注入攻击问题,提出人机协作框架结合技术和政策措施来缓解相关风险。

Comments Accepted to the 3rd International Workshop on Dataspaces and Digital Twins for Critical Entities and Smart Urban Communities - IEEE BigData 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19349 2025-11-25 cs.IR 75%

Revisiting Feedback Models for HyDE

重新审视HyDE中的反馈模型

Nour Jedidi, Jimmy Lin

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文重新审视HyDE中的传统反馈模型,发现利用Rocchio等算法可显著提升基于LLM的PRF方法的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00763 2025-11-25 cs.AI 70%

How Focused Are LLMs? A Quantitative Study via Repetitive Deterministic Prediction Tasks

LLM的聚焦性如何?通过重复确定性预测任务的定量研究

Wanda Hou, Leon Zhou, Hong-Ye Hu, Yubei Chen, Yi-Zhuang You, Xiao-Liang Qi

机构 * EdenCode Inc.(EdenCode公司) Stevenson School(斯蒂文森学校) Harvard University(哈佛大学) UC Davis(加州大学戴维斯分校) Path Integral Technology, Inc.(路径积分技术公司)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过重复确定性预测任务揭示LLM在长序列中的准确性下降现象,提出统计物理模型解释内部干扰与外部条件的竞争,建立误差积累机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18337 2025-11-25 eess.AS cs.AI cs.SD 70%

Warm Chat: Diffuse Emotion-aware Interactive Talking Head Avatar with Tree-Structured Guidance

Warm Chat: 一种具有树状引导的情感感知交互式对话头虚拟形象

Haijie Yang, Zhenyu Zhang, Hao Tang, Jianjun Qian, Jian Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Warm Chat提出一种基于树状结构引导的情感感知对话头生成框架,利用大语言模型生成时序一致且情感丰富的虚拟形象,提升双向交互的自然度与情感适应性。

Comments The submission is withdrawn at the request of the authors due to internal reasons within the research team

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18278 2025-11-25 cs.LG cs.CV 57%

From Tables to Signals: Revealing Spectral Adaptivity in TabPFN

从表格到信号:揭示TabPFN中的频谱适应性

Jianqiao Zheng, Cameron Gordon, Yiping Ji, Hemanth Saratchandran, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) University of Adelaide(阿德莱德大学)

专题命中 其他LLM :foundation model(abstract);分类 cs.LG

AI总结 TabPFN通过频谱适应性实现无需训练和超参数的图像去噪,揭示其在表格学习中的独特频谱特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06929 2025-11-25 cs.AI 57%

Making a prototype of Seoul historical sites chatbot using Langchain

利用Langchain制作首尔历史遗址聊天机器人原型

Jae Young Suh, Minsoo Kwak, Soo Yong Kim, Hyoungseo Cho

机构 * Hanyang(翰阳大学) Konkuk(konkuk大学) Seoul National(首尔国立大学) Myongji University(明gies大学)

专题命中 其他LLM :prompting(abstract);分类 cs.AI

AI总结 本文提出利用Langchain开发首尔历史遗址聊天机器人原型,旨在通过提供准确信息提升游客对当地文化遗产的认知。

Comments 4 pages, 4 figures, draft

Journal ref Journal of Electrical Electronics Engineering, 3(1), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18443 2025-11-25 cond-mat.mtrl-sci 50%

High accuracy Spin Hall Effect Induced Spin Accumulation detection in MOKE Measurements

高精度自旋霍尔效应诱导自旋积累检测在MOKE测量中

Emanuele Longo, Josep Fontcuberta, Paolo Vavassori

专题命中 其他LLM :prompting(abstract)

AI总结 本研究通过改进MOKE测量方法,实现了高精度检测自旋霍尔效应诱导的自旋积累,发现结果比以往数据小7倍,提示需重新审视实验方法和模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17588 2025-11-25 cs.OH cs.ET 50%

Synthesis of mass-spring networks from high-level code descriptions

从高级代码描述合成质量-弹簧网络

Parisa Omidvar, Marc Serra-Garcia

专题命中 其他LLM :language model(abstract)

AI总结 本文提出了一种基于代码的合成方法,通过机械描述语言和大语言模型设计具有智能功能的质量-弹簧系统,实现了迷宫穿越机器人和可编程锁的构建。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏