arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 48 篇

2608.21584 2026-08-25 cs.AI cs.CE math.NA 新提交 92%

Data-Driven Dynamic Algorithm Dispatch with Large Language Models

基于大语言模型的数据驱动动态算法调度

Rushil Shah, Emmanuel Lujan, Rabab Alomairy, Alan Edelman

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究提出基于LLaMA 3等的LLM驱动方法,结合性能数据库生成线性代数动态算法调度启发式算法,经LU分解案例验证可复制专家策略,为算法发现及自适应线性代数软件开发提供新方向。

Comments 3 pages, 2 figures. Accepted at the 2025 IEEE High Performance Extreme Computing Conference (HPEC). Outstanding Short Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22889 2026-08-25 cs.CR 新提交 92%

Verification-Guided Specification Synthesis with Large Language Models for Intrusion Detection Rules

基于大语言模型的验证引导式入侵检测规则规约合成

Kohei Yamamoto, Marie Katsurai

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出验证引导式规约合成框架,结合LLM与CEGIS从HTTP请求轨迹生成Suricata规则,在281个真实CVE及良性流量实验中,检测率达81.5%且误报率为0.0%。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17860 2026-08-25 cs.CR 版本更新 91%

TitanCA: Lessons from Orchestrating LLM Agents to Discover 100+ CVEs

TitanCA:编排LLM代理发现100+个CVE的经验教训

Ting Zhang, Yikun Li, Chengran Yang, Ratnadira Widyasari, Yue Liu, Ngoc Tan Bui, Phuc Thanh Nguyen, Yan Naing Tun, Ivana Clairine Irsan, Huu Hung Nguyen, Huihui Huang, Jinfeng Jiang, Lwin Khin Shar, Eng Lieh Ouh, David Lo, Hong Jin Kang, Yide Yin, Wen Bin Leow

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文介绍TitanCA,一种通过编排多个LLM代理进行漏洞发现的流水线,已在开源软件中发现203个零日漏洞并产生118个CVE。

Comments Accepted by IEEE Security & Privacy Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11358 2026-08-25 cs.CL cs.AI cs.IR 版本更新 90%

LLM-Specific Utility for Retrieval-Augmented Generation

针对大语言模型的特定效用:检索增强生成的新视角

Hengran Zhang, Keping Bi, Jiafeng Guo, Jiaming Zhang, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM特定效用的概念,指出不同大语言模型对证据的需求不同,提出构建基准以研究这种效用,并推动生成器定制的证据选择方法改进RAG。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23102 2026-08-25 cs.CV cs.IR 新提交 90%

Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models

无需训练的伪融合:基于扩散模型和多模态大语言模型的组合图像检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出无需训练的PeFuse伪融合框架,结合扩散模型与多模态大语言模型,将组合图像检索转化为单模态检索任务,在零样本场景下实现了媲美当前最优方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23411 2026-08-25 cs.CL 新提交 90%

STONIC: A Layered Measurement Contract for LLM Value Profiling

STONIC:用于LLM价值画像的分层测量契约

Andrei Chetvergov, Stepan Ukolov, Timofei Sivoraksha, Alexander Evseev, Danil Sazanakov, Mikhail Solovev, Sergey Bolovtsov

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 STONIC在4家银行5144种情境及35种LLM配置上,验证了问卷评分等三类观测结果描述相同稳定偏好的假设,发现模型存在行为连续性但无统一价值身份,且隐藏状态编码决策更清晰。

Comments 32 pages, 6 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22644 2026-08-25 cs.NI cs.LG eess.SY 新提交 90%

Advanced LLM-Enhanced Intent-Based 5G Network Management using Dynamic Semantic Routes

基于动态语义路由的大语言模型增强型意图驱动5G网络管理

Thomas Benton Townsend, Dimitrios Michael Manias

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出采用带语义路由器的动态路由,结合LLM增强型意图驱动网络,实现5G+核心网络的意图识别与细节提取,实验显示静态和动态路由在细节提取及模式格式化上均表现良好。

Comments Accepted at IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21420 2026-08-25 cs.RO cs.HC 新提交 89%

Evaluating Human and LLM-Generated Thematic Analysis in HRI for Vulnerable Populations: A Comparative and Ethical Analysis

在面向弱势人群的人机交互(HRI)中评估人类与大语言模型(LLM)生成的主题分析:一项比较与伦理分析

Alva Markelius, Fethiye Irmak Dogan, Julie Bailey, Hatice Gunes

机构 * University of Cambridge(剑桥大学) Faculty of Education, University of Cambridge(剑桥大学教育学院)

专题命中 其他LLM :LLM(title,title_cn)

AI总结 本研究对比分析了人类与LLM在面向弱势人群的HRI研究中生成的主题分析,评估二者的一致性,探究LLM生成主题分析的伦理风险,为相关研究者提供启示。

Comments Accepted at 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), Kitakyushu, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22731 2026-08-25 cs.AI cs.HC cs.RO 新提交 89%

LLM-Based Selection of Incongruent Verbal and Nonverbal Behavior for Virtual Humans

基于大语言模型的虚拟人类言语与非言语不一致行为选择

Parisa Ghanad Torshizi, Stacy Marsella

机构 * Khoury College of Computer Science(计算机科学学院(科里学院)) Northeastern University(东北大学)

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对虚拟人类言语与非言语行为的不一致问题,提出分类法,探究LLM对情境适配的不匹配行为的选择能力,并通过人类受试者研究验证其效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02208 2026-08-25 cs.AI cs.CL cs.LG 版本更新 88%

Training Proactive and Personalized LLM Agents

训练主动且个性化的大语言模型智能体

Weiwei Sun, Xuhui Zhou, Weihua Du, Xingyao Wang, Sean Welleck, Graham Neubig, Maarten Sap, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学) OpenHands

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出训练协作型LLM智能体的新范式,形式化PPP三维度,构建UserVille环境与多目标强化学习框架,在SWE-Bench等任务上使智能体性能优于GPT-5等基线,验证了以用户为中心反馈的重要性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23023 2026-08-25 cs.CL 新提交 87%

Most of the LLM routing gap is task type

大语言模型路由差距主要源于任务类型

Janghoon Lee

机构 * Redrob(雷德罗布)

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究发现LLM路由的性能差距主要源于任务类型,提前为每种任务类型分配固定模型的静态策略,成本低于最佳单一模型,可优化大部分问题,而学习型路由器的优化目标问题数量少于运行间波动。

Comments 21 pages, 2 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05216 2026-08-25 cs.IR cs.AI cs.CL 版本更新 87%

Unleashing the Power of LLMs in Dense Retrieval with Query Likelihood Modeling

利用查询似然建模释放大型语言模型在密集检索中的能力

Hengran Zhang, Keping Bi, Jiafeng Guo, Xiaojie Sun, Shihao Liu, Daiting Shi, Dawei Yin, Xueqi Cheng

机构 * CAS Key Lab of Network Data Science and Technology, ICT, CAS(中国科学院网络数据科学与技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM在密集检索中全局信息建模不足的问题,提出含注意力块和文档损坏组件的LLM-QL模型,通过查询似然最大化辅助任务增强检索器主干,在MS MARCO和BEIR数据集上优于其他LLM-based检索器。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22127 2026-08-25 cs.LG cs.SI 新提交 86%

Who Should Teach? Confidence-Aware Dual-Teacher Learning for Few-Shot Node Classification on Text-Attributed Graphs

谁应该做指导?面向文本属性图小样本节点分类的置信感知双教师学习

Hojin Kim, Sujin Yoon, Sungsu Lim, Dongwon Lee, David Yoon Suk Kang

机构 * Chungbuk National University(忠北国立大学) Chungnam National University(忠南国立大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对文本属性图小样本节点分类中现有方法LLM信息利用不均、成本高的问题,提出置信感知双教师学习框架CoTeach,动态为节点选更可靠教师,提升性能并降低LLM成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21656 2026-08-25 cs.CL 新提交 86%

Mitigating Database Leakage in RAG Systems with Keyword-Grounded Fact Substitution

基于关键词锚定的事实替换缓解RAG系统中的数据库泄露

Ziliang Zhang, Yubo Zhu, Wei Tong, Jingyu Hua, Zijian Wang, Yuan Zhang, Sheng Zhong

机构 * Nanjing University(南京大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 针对RAG系统易受提示注入攻击导致数据库泄露的问题,提出KFS-RAG防御方法,通过关键词锚定的事实替换缓解泄露风险,同时保持响应准确性与相关性,为构建安全可信RAG系统提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22908 2026-08-25 cs.CL cs.AI 新提交 86%

Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text

口语语言模型在阅读文本时是否“听到”语音?弥合语音与文本之间的结构差距

Hyeonyu Kim, Hwayeon Kim, Youngwon Choi, Myeongkyun Cho, Huu-Kim Nguyen

机构 * Maum AI Inc.(Maum AI公司) KAIST(韩国科学技术院) Atmanity Inc.(Atmanity公司)

专题命中 其他LLM :language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对现有口语语言模型(SLMs)未充分解决语音与文本结构差异的问题,提出解耦长度不匹配与语义对齐的框架,经多基准实验验证其性能可与强基线媲美,凸显了明确解决语音文本结构差异的重要性。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18292 2026-08-25 cs.RO cs.CV 版本更新 86%

GuideFetch: A Task Coordination Framework for Concurrent Navigation and Object Retrieval in Assistive Robot Dogs

GuideFetch:用于辅助机器狗并发导航与物体检索的任务协调框架

Qian Yin, Ruiping Liu, Kunyu Peng, Jianxiang Man, Isik Baran Sandan, Junwei Zheng, Yufan Chen, Di Wen, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对异构辅助机器狗的导航与物体检索并发任务,提出GuideFetch协调框架,通过LLM规划与状态验证提升执行效率,并行执行可缩短41.3%平均总完成时间。

Comments Accepted to the 1st Workshop on Multimodal Digital Agents (MDA) at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21927 2026-08-25 cs.LG cs.AI 新提交 84%

Bi-EZP: LLM-Guided Bilevel Program Evolution for Ensemble Zero-Cost Proxy Discovery

Bi-EZP:基于大语言模型的双层程序进化集成零成本代理发现

Yutao Lai, Kezhao Lai, Hai-Lin Liu

机构 * School of Mathematics and Statistics, Guangdong University of Technology(广东工业大学数学与统计学院)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Bi-EZP双层框架,通过大语言模型与CMA-ES解耦聚合结构发现和参数校准,在NATS-Bench等数据集上验证了其构建集成零成本代理的有效性

Comments 14 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00566 2026-08-25 cs.LG cs.CL cs.CR 版本更新 84%

Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models

相同载荷,不同通道:测量使用工具的語言模型中的信任不对称性

Mohammed Sameer Syed, Rozhin Yasaei (University of Arizona)

机构 * University of Arizona(亚利桑那大学)

专题命中 其他LLM :language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究提出安全不对称分数(SAS),通过匹配恶意载荷仅改变传递上下文,系统测量了语言模型在不同通道(用户消息、工具元数据、工具输出)中对对抗性内容的脆弱性差异,发现代理原生模型在工具描述通道更脆弱,而通用模型相反,且机制研究表明安全相关表示在深层网络非线性编码。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22246 2026-08-25 cs.CL 新提交 83%

Nürnberg NLP @ GermEval Shared Task 2026: Harmful Content Detection in German Social Media through Error-Independent LLM Voters

纽伦堡自然语言处理团队(Nürnberg NLP)参与2026年GermEval共享任务:基于与错误无关的大语言模型投票器检测德语社交媒体有害内容

Philipp Steigerwald, Eric Rudolph, Jens Albrecht

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡乔治·西蒙·欧姆应用技术大学)

专题命中 其他LLM :LLM(title,abstract);分类 cs.CL

AI总结 该研究针对德语社交媒体有害内容检测的类别不平衡挑战,构建了含三个正交维度的九投票器集成系统,在2026年GermEval共享任务四个子任务中均获第一。

Comments Accepted at the GermEval 2026 Shared Task on Harmful Content Detection @ KONVENS 2026 (1st place on all four subtasks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23263 2026-08-25 cs.AI cs.CL cs.DL 新提交 82%

Automated Construction of FAIR Digital Object Knowledge Graphs from Flat Cultural Heritage Records

从平面文化遗产记录自动构建FAIR数字对象知识图谱

Zeyd Boukhers, Lingxiao Kong, Xenophon Zabulis, Georgios Toubekis

机构 * Fraunhofer Institute for Applied Information Technology FIT(弗劳恩霍夫应用信息技术研究所FIT) University Hospital of Cologne(科隆大学医院) University of Cologne(科隆大学) Foundation for Research and Technology(希腊研究与技术基金会)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出了基于大语言模型的管道,将平面欧洲数据模型记录转换为符合FDO规范的知识图谱,实现了高比例元数据链接与跨语言实体合并,提升了文化遗产数据的可机器操作性。

Comments Accepted for publication as a short paper at CIKM 2026 (The 35th ACM International Conference on Information and Knowledge Management)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22266 2026-08-25 cs.AI cs.CL 新提交 82%

Clarify User Expertise: Towards Proactive Conversational Agents Tailoring Responses to User Proficiency

明确用户专业能力:面向可根据用户熟练度调整响应的主动式对话智能体

Zhihong Cao, Chen Huang

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对现有对话智能体无法仅通过查询判断用户专业能力的缺陷,提出PASSING方法,通过LLM自博弈生成的询问策略主动明确用户专业能力,以调整响应提升用户理解,实验显示该方法具有优越性。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21747 2026-08-25 cs.SE cs.AI cs.CL 新提交 82%

Architecture as Capability Equalizer for Coding Agents

架构作为编码智能体的能力均衡器

Arquimedes Canedo

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究对比5种架构规范格式对6种LLM编码智能体的代码生成质量影响,发现结构化格式可作为能力均衡器,显著提升弱模型性能,对成本优化部署价值最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22708 2026-08-25 cs.AI 新提交 81%

CacheRouter: A Dual-Path Tool Routing Architecture with Cache-Preserving Main-Model Isolation for Long-Tail Tool Discovery

CacheRouter:一种用于长尾工具发现的保留缓存的主模型隔离双路径工具路由架构

Donghui Zha, Lingwei Xu, Linxiao Wu, Yixue Dong, Haochen Li

机构 * School of Mathematical Sciences, Beijing University of Posts and Telecommunications(北京邮电大学数学科学学院) School of Mathematics and Statistics, Chongqing University(重庆大学数学与统计学院) School of Science, Beijing Forestry University(北京林业大学理学院)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM工具使用中渐进式披露与提示词缓存的权衡,提出CacheRouter双路径路由架构,通过主模型隔离与工具路由通道设计提升缓存命中率,降低输入成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07356 2026-08-25 cs.CL 版本更新 81%

Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks

仅安全对齐权重不够:拒绝教师引导微调可在有害微调攻击下提升安全性与下游性能

Seokil Ham, Yubin Choi, Yujin Yang, Seungju Cho, Younghun Kim, Changick Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对有害微调攻击威胁,该研究提出拒绝教师引导微调框架,将安全FaaS微调范式从安全对齐权重微调转为基础权重在安全教师指导下的微调,可减少有害输出并提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22639 2026-08-25 cs.HC 新提交 80%

Poetic Heritage for Culturally Grounded Emotional Support: An Interaction Design Framework and Its Multimodal Agentic Instantiation

用于文化根基型情感支持的诗意遗产:一种交互设计框架及其多模态智能体实例化

Yangming Zhang, Zhiqian Li, Bin Wu, Qi Li, Jie Xu, Yunpeng Song, Liang Zhao

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 本研究提出一种将诗意传统转化为文化根基型情感支持交互媒介的设计框架,开发了基于LLM的多模态多智能体系统Poemithy,实验表明该系统可有效改善情绪等指标,多模态呈现能提升用户共鸣与参与度。

Comments 45 pages, 14 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22760 2026-08-25 cs.CV 新提交 78%

ByteAction: Byte-space Action Recognition Foundation Model

ByteAction:字节空间动作识别基础模型

Fangcheng Li, Zhen Yu, Kejun Wu, Qiong Liu, You Yang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

专题命中 其他LLM :foundation model(title,abstract)

AI总结 本文提出ByteAction这一字节空间动作识别基础模型,采用双视图字节级识别框架,结合比特流模式增强与损坏一致性训练,在多数据集上实现了优异的比特流损坏鲁棒性与动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22117 2026-08-25 cs.LG cs.CL 新提交 76%

TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling

TANGO:用于自然语言与形式语言建模的令牌聚合门控非线性算子

Joshua Nunley

机构 * Luddy School of Informatics, Computing, and Engineering(勒迪信息学、计算与工程学院) Indiana University Bloomington(印第安纳大学伯明顿分校)

专题命中 其他LLM :language model(title);分类 cs.CL、cs.LG

AI总结 该研究提出TANGO和WANGO两种模型,替换Transformer的自注意力与前馈子层,经对比实验,TANGO在多数据集上验证负对数似然最优,WANGO在线性复杂度架构中表现最佳且优于Recurrent Transformer++。

Comments 13 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23041 2026-08-25 cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 75%

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

AutoSaddler:基于智能体执行轨迹的持久化更新的自动工具优化

Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han, Pengfei Gao, Chanyoung Park, Yongqiang Yao, Rao Fu, Elsie Nallipogu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * KAIST(韩国科学技术院) Southern University of Science and Technology(南方科技大学) Microsoft(微软) POSTECH(浦项科技大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 AutoSaddler是基于智能体执行轨迹的自动工具优化框架,通过离线学习结合故障诊断等技术,在多个基准上提升智能体性能9.0-10.0个百分点,为构建更可靠的智能体系统提供了新方向。

Comments 44 pages, 15 figures. Project website and code: this https URL (https://aka.ms/AutoSaddler-website)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09146 2026-08-25 cs.SE 版本更新 75%

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

利用多模态大语言模型探索程序流程图在代码生成中的潜力

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。

Comments 21 pages, Accepted at the 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026), Regular Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10279 2026-08-25 cs.CR cs.AI cs.CL 版本更新 73%

Withholding the Completing Chunk: Exact Release-Boundary Equivalence for Production Streaming Guardrails

withhold the Completing Chunk: 面向流式大语言模型输出的确定性配对完成护栏

Christopher M. Frost

专题命中 其他LLM :LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 本研究提出流式LLM输出的确定性配对完成护栏,通过扫描前缀扣留配对完成块,实验验证其效果,表明它是小型固定策略的精确发布边界后盾。

Comments 9 pages, 2 figures, 4 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏