arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-26 至 2026-08-26 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 18 篇

2608.24271 2026-08-26 cs.SE 新提交 89%

Observability and Fault Injection for LLM-Based Multi-Agent Systems in Software Engineering

软件工程中基于大语言模型的多智能体系统的可观测性与故障注入

Zahra Seyedghorban, Egor Klimov, Arie van Deursen, Annibale Panichella, Burcu Kulahcioglu Ozkan

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对软件工程中基于LLM的多智能体系统难检查调试评估的问题,提出llmmas-otel工具,结合OpenTelemetry分布式追踪与故障注入,实现可复现的基线与故障执行对比,已在演示及真实系统上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23706 2026-08-26 cs.AI 新提交 89%

Do LLMs Understand Limit Order Book Dynamics?

大型语言模型(LLM)是否理解限价订单簿(LOB)动态?

Junxiao Chen, Paul Glasserman

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 其他LLM :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究测试基于LOB数据训练的LLM,发现其隐式世界模型未掌握LOB状态,导致预测有偏且存在虚假可预测性,为此将相关测试扩展至LOB的随机动态环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24857 2026-08-26 cs.CR cs.SE 新提交 88%

Prompt Structure Redistributes, Not Reduces: An Empirical Analysis of Security-Weaknesses in LLM-Generated Python Code

提示结构是重新分布而非减少:对大语言模型生成Python代码中安全漏洞的实证分析

Maitreyee Das Urmi, Jessica Pourleyli, Fabio Santos, Glaucia Melo

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究通过424个安全敏感Python任务,对比GPT-4o与LLaMA 3.1-8B在5种提示变体下的代码生成效果,发现结构化提示可提升合规性但会重新分布安全风险,无法替代稳健安全控制。

Comments Accepted at CASCON 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23941 2026-08-26 cs.AI 新提交 87%

More Rejective, Not More Discriminative: The Unit of Verification in Pre-Execution LLM Oversight

更多弃权(不执行),而非更强判别性:预执行大语言模型监督中的验证单元

Yuchen Han, Cheng Yan, Wuyang Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对预执行LLM监督的验证单元问题,提出双前缀框架,发现一或两个行动的短验证单元信息性最高,更长窗口会使监控器更倾向于弃权而非提升判别性。

Comments 37 pages, 20 figures, 32 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23023 2026-08-26 cs.CL 版本更新 87%

Most of the LLM Routing Gap Is Task Type

大语言模型路由差距主要源于任务类型

Janghoon Lee (Redrob)

机构 * Redrob(雷德罗布)

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究发现LLM路由的性能差距主要源于任务类型,提前为每种任务类型分配固定模型的静态策略,成本低于最佳单一模型,可优化大部分问题,而学习型路由器的优化目标问题数量少于运行间波动。

Comments 21 pages, 2 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24747 2026-08-26 cs.CL 新提交 86%

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents

SkillForge:为强化学习智能体演化可验证技能

Shidong Yang, Ziyu Ma, Tongwen Huang, Xucong Wang, Renda Li, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SkillForge是实现技能验证与优化的持续技能演化框架,通过明确技能使用优化RL决策,在ALFWorld等数据集上优于SkillRL,可训练更强的LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23651 2026-08-26 cs.SE cs.AI 新提交 84%

Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail

适得其反的反馈:为什么小型语言模型智能体重复它们刚刚看到的失败调用

Esmail Gumaan

专题命中 其他LLM :language model(title);small language model(title);分类 cs.AI

AI总结 该研究发现小型语言模型智能体的失败工具调用反馈会适得其反,调用表面形式是主要原因,替换失败描述或使其不可达可减少重复,明确指令或删除失败尝试无效。

Comments 25 pages, 6 figures, 13 tables. Code, data, probe items and rollout logs: this https URL (https://github.com/Esmail-ibraheem/feedback-that-backfires)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19551 2026-08-26 cs.HC 版本更新 80%

Delegating or Doing? Understanding User Behavior in Hybrid Human-Agent Interfaces

委托还是自行操作?理解混合人机界面中的用户行为

Gavin Dizon, Tyrone Justin Sta Maria, Jordan Aiko Deja, Yasuyuki Sumi

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究通过被试间实验对比三种交互模式,发现混合人机界面可降低交互成本,委托行为更多反映用户个体特征而非任务需求。

Comments 9 pages, In Proceedings of the 14th International Conference on Human-Agent Interaction at Osaka, Japan on November 16-19, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23953 2026-08-26 cs.SE cs.AI cs.CE 新提交 79%

The Empire, Long Divided, Must Unite: Architectural Convergence in Three LLM Agent Harnesses

长期分裂的帝国必须统一:三种大语言模型智能体框架的架构趋同

Dai Jiahong

专题命中 其他LLM :LLM(title);language model(abstract);分类 cs.AI

AI总结 通过对LangChain deepagents、Earendil pi、DeepSeek dsh三种编码智能体框架的多案例研究,发现它们虽初始理念迥异却趋同于含五个元素的架构,同时指出外部可验证性是未趋同的关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23634 2026-08-26 cs.CV cs.LG 新提交 79%

The Blending Ratio Is Not Where the Performance Is: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models

混合比例并非性能所在:诊断视觉-语言模型少样本适配中的原型混合

Liangzhi Li, Bowen Wang, Yiming Qian, Thorsten Neumann, Xia Xie, Guangshun Li

机构 * Qufu Normal University(曲阜师范大学) Climind The University of Osaka(大阪大学) Institute of Scientific and Industrial Research (SANKEN)(产业科学研究所(SANKEN)) Institute of High Performance Computing (IHPC), A*STAR(新加坡科技研究局高性能计算研究所(IHPC)) Standard Chartered Bank(渣打银行) Hainan University(海南大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 本文针对视觉-语言模型少样本适配的原型混合方法,发现其最优混合比例可仅通过支持集估计,且无验证的线性探针性能优于最优调参混合,性能上限由模型本身而非超参数决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24559 2026-08-26 cs.DL cs.AI 新提交 70%

COCI: Conference Organisers and Content Identifier

COCI:会议组织者与内容标识符

Angelo Salatino, Francesco Osborne, Alexis Vizcaino, Aliaksandr Birukou, Enrico Motta

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对灰色文献中征稿通知与学术知识图谱孤立的问题,提出基于AI的COCI框架,结合LLMs与语义映射技术提取CfP结构化元数据,整合至知识库,为非出版商学术活动分析奠定基础。

Comments Demo paper accepted at ISWC 2026. To be presented in October 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24222 2026-08-26 cs.CL 新提交 70%

Measuring Digital Labour Market Transitions with a Digital Semantic Score: An AI-Based Methodology Applied to the Dutch Labour Market

基于数字语义分数衡量数字劳动力市场转型:应用于荷兰劳动力市场的AI方法

Sadegh Shahmohammadi, Xavier Pinho, Mairi Bowdler, Suhendan Adiguzel-van Zoelen, Joost van Genabeek

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究开发AI方法,结合嵌入相似性搜索与大语言模型分类,提出数字语义分数,分析荷兰劳动力市场数字化的不均分布、职业转型路径及数字能力多维性,为相关政策提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23421 2026-08-26 cs.CL 版本更新 70%

A Comprehensive Analysis of Arabic Natural Language Processing Research: Trends, Topic Evolution, and Research Gaps -- A Bibliometric and Topic-Based Study

阿拉伯自然语言处理研究的综合分析:趋势、主题演变与研究缺口——一项基于文献计量和主题的研究

Mullosharaf K. Arabov

机构 * Kazan Federal University(喀山联邦大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究对7120篇阿拉伯NLP论文开展文献计量与主题分析,明确研究趋势、缺口及引文影响因素,为该领域发展提出针对性建议。

Comments 38 pages, 16 tables, 10 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23688 2026-08-26 astro-ph.SR astro-ph.IM 新提交 67%

Agentic Active Learning Meets Visual Embeddings: Finding Anomalies among 370 000 Variable Stars from ASAS-SN

智能体主动学习结合视觉嵌入:从ASAS-SN的370000颗变星中发现异常天体

Milan Pesta, Yuan-Sen Ting

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 该研究提出结合多模态大语言模型智能体的主动学习框架,从ASAS-SN的37万余颗变星中高效发现异常天体,仅用约3小时、约40美元成本便得到含24个新异常的星表,验证了该方法的可行性。

Comments 24 pages, 12 figures, 6 tables. Submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23623 2026-08-26 cs.SE cs.AI cs.LG 新提交 62%

When May an Agent Stop? Evidence-Carrying Termination for Tool-Using LLMs

智能体何时可以停止?带证据的工具使用大语言模型终止机制

Jason Liu

专题命中 其他LLM :LLM(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对工具使用大语言模型的终止问题,提出带证据的终止(ECT)机制,经实验验证其能显著减少不安全完成与过早无支持终止,满足非劣效性要求,可实现成功恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23570 2026-08-26 cs.CL 新提交 57%

Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning

驯服视觉忽视:用于多模态上下文学习中自适应注意力的变分信息瓶颈框架

Kaito Tanaka, Yuji Nishimura, Keisuke Matsuda, Aya Nakayama

机构 * SANNO University(山王大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 针对多模态上下文学习中视觉上下文时而被利用时而被忽视的问题,提出VIB-ICL框架,通过CMIG量化跨模态信息,推导理论界并经五组基准实验验证,实现准确率提升与演示样本减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13092 2026-08-26 cs.LG cs.AR 版本更新 57%

Breaking the Tuning Barrier: Zero-Hyperparameters Yield Multi-Corner Analysis Via Learned Priors

打破调优壁垒:通过先验学习实现零超参数的多角分析

Wei W. Xing, Kaiqi Huang, Jiazhan Liu, Hong Qiu, Shan Shen

机构 * School of Mathematical and Physical Science, University of Sheffield(谢菲尔德大学数学与物理科学学院) SZU–UoS Joint Centre for Innovation and Entrepreneurship, College of Mechatronics and Control Engineering, Shenzhen University(深大-乌兹别克斯坦联合创新与创业中心,机电控制工程学院,深圳大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 其他LLM :foundation model(abstract);分类 cs.LG

AI总结 针对电路多角分析中仿真成本高且现有方法需大量调参的问题,提出基于预训练基础模型的上下文学习方法,无需调优即可匹配最先进精度,将验证成本降低10倍以上。

Comments Published in DAC2026. Final Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24138 2026-08-26 cs.CV 新提交 50%

Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation

作为自演进UI转代码生成视觉修复上下文的评分标准

Tianyi Xiong, Zhengyuan Yang, Xiaofei Wang, Chung-Ching Lin, Ruichun Ma, Kevin Lin, Zhendong Wang, Linjie Li, Chenxi Liu, Ruibo Chen, Ramani Duraiswami, Heng Huang, Lijuan Wang

机构 * University of Maryland(马里兰大学) Microsoft(微软公司)

专题命中 其他LLM :language model(abstract)

AI总结 该研究针对视觉语言模型UI转代码自演进不稳定的问题,提出RubSE框架,利用评分标准作为视觉修复上下文,在多模型多基准上显著提升了生成性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏