arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 834 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 33 篇

2606.00324 2026-06-02 cs.IR cs.AI 86%

LLMs Need Encoders for Semantic IDs Too

LLM 也需要语义 ID 的编码器

Xiangyi Chen, Zelun Wang, Xinyi Li, Yi-Ping Hsu, Jaewon Yang, Jiajing Xu

机构 * Pinterest United States(Pinterest美国公司)

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 提出 PrefixMem,一种基于前缀 n-gram 记忆表的轻量级语义 ID 编码器,为 LLM 提供结构化、前缀条件的表示,显著提升生成推荐中的语义 ID 准确率和检索召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00061 2026-06-02 q-fin.ST q-fin.TR 83%

Reflexivity as Prompt: Does Awareness of Self-Reinforcing Market Dynamics Improve LLMs as Financial Market Forecasters?

反身性作为提示:对自我强化市场动态的认知是否提高了LLM作为金融市场预测者的表现?

Eugene Park

专题命中 长上下文与记忆 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究在繁荣-萧条市场周期中,逐步引入索罗斯反身性理论时,前沿大语言模型作为金融预测者的行为变化,通过方向性预测准确率和夏普比率评估,发现反身性认知在不同模型和上下文窗口中产生不同的预测改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01782 2026-06-02 cs.IR 82%

Whole-Pool Setwise Reranking with Long-Context Language Models

基于长上下文语言模型的整池集合重排序

Hang Li, Chuting Yu, Teerapong Leelanupab, Bevan Koopman, Guido Zuccon

专题命中 长上下文与记忆 :language model(title);LLM(abstract,abstract_cn)

AI总结 提出整池集合重排序方法,利用长上下文语言模型一次性处理所有候选段落,并通过DualEnd方法从两端同时排序,减少模型调用次数,提升效率。

Comments 4 pages main content, 10 page Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26197 2026-06-02 cs.IR cs.LG 81%

Hierarchical Long-Term Semantic Memory for LinkedIn's Hiring Agent

面向LinkedIn招聘代理的分层长期语义记忆

Zhentao Xu, Shangjin Zhang, Emir Poyraz, Yvonne Li, Ye Jin, Xie Lu, Xiaoyang Gu, Karthik Ramgopal, Praveen Kumar Bodigutla, Xiaofeng Wang

机构 * LinkedIn Corporation(LinkedIn公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出分层长期语义记忆(HLTM)框架,通过构建模式对齐的记忆树,实现可扩展的语义知识摄入、隐私感知存储、低延迟检索和透明溯源,在LinkedIn招聘助手应用中使答案正确率提升超5%、检索F1提升超10%。

Comments Accepted to the Applied Data Science (ADS) track at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00415 2026-06-02 cs.AI cs.LG 81%

PolarMem: A Training-Free Polarized Latent Graph Memory for Verifiable Vision-Language Models

PolarMem: 一种无需训练的可验证视觉语言模型极化隐式图记忆

Zhisheng Chen, Tingyu Wu, Zijie Zhou, Zhengwei Xie, Jinhan Li, Ziyan Weng, Liang Lin, Jingwei Song, Zikai Xiao, Yingwei Zhang

机构 * ICT, CAS(中国科学院信息科技研究院) UCAS(中国科学院大学) CUPB(中国政法大学) USTC(中国科学技术大学) CityU-DG(城市大学-数据科学) HKU(香港大学) ZJU(浙江大学)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出PolarMem,一种无需训练的极化隐式图记忆框架,通过语义一致性验证和自适应分布划分将视觉语言模型感知信号转化为HAS、NOT_HAS和Uncertain记忆状态,并采用词典逻辑感知检索协议优先保证逻辑一致性,从而提升检索密集型任务性能并减少矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00866 2026-06-02 cs.OS 80%

Idleness is Relative: Exploiting Tool-Call Idle Windows for Offloading in Agentic Systems with MORI

空闲是相对的:利用工具调用空闲窗口在MORI代理系统中进行卸载

Tian Xia, Hanchen Li, Zhifei Li, Xiaokun Chen, Hao Kang, Yifan Qiao, Yi Xu, Ion Stoica

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 提出MORI系统,通过将代理程序按空闲程度连续排序并动态划分内存层级,解决了LLM代理工作负载中KV缓存卸载效率低下的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27224 2026-06-02 cs.SE cs.CR 80%

Finding Memory Leaks in C/C++ Programs via Neuro-Symbolic Augmented Static Analysis

通过神经符号增强静态分析发现C/C++程序中的内存泄漏

Huihui Huang, Jieke Shi, Bo Wang, Zhou Yang, David Lo

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 提出MemHint神经符号管道,结合LLM语义理解与Z3符号推理,扩展静态分析器对自定义内存管理函数的识别和路径敏感控制流建模,在8个真实项目中发现54个内存泄漏(53个确认/修复),每个漏洞成本约1.7美元。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00275 2026-06-02 cs.CV cs.AI 79%

Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models

超几何与证据优先专家用于大型视觉-语言模型

Zijie Zhou, Dandan Zhu, Hangxiangpan Wang, Heng Zhang, Huishen Jiao, Yi Zhao

机构 * China University of Petroleum (Beijing)(中国石油大学(北京)) Hainan Institute of China University of Petroleum (Beijing)(中国石油大学(北京)海南学院) South China Normal University(华南师范大学)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI

AI总结 针对大型视觉-语言模型中视觉与语言模态的不对称性,提出AsyMoE架构,通过超几何跨模态专家和证据优先语言专家分别建模层级关系与保持上下文基础,在减少参数的同时提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31086 2026-06-02 cs.CL cs.IR 77%

Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory

超越静态对话:对现实、异构和演化长期记忆的基准测试

Han Zhang, Zihao Tang, Xin Yu, Xiao Liu, Yeyun Gong, Haizhen Huang, Yan Lu, Weiwei Deng, Feng Sun, Qi Zhang, Hanfang Yang

机构 * Center for Applied Statistics, Renmin University of China(中国人民大学应用统计中心) School of Statistics, Renmin University of China(中国人民大学统计学院) Microsoft(微软公司)

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有大语言模型记忆基准中对话缺乏长期语义一致性、人物静态化以及忽视异构数据流的问题,提出RHELM基准,通过用户画像和LOOP模块生成具有动态时间演化和长期连贯性的现实对话,并整合异构外部源,评估模型在多源聚合和现实上下文推理方面的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01790 2026-06-02 cs.CV cs.AI 74%

STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models

STaR-KV: 面向GUI视觉语言模型的时空自适应KV缓存压缩重加权方法

Yuhang Han, Wenzheng Yang, Yujie Chen, Xiangqi Jin, Yaojie Zhang, Siteng Huang, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) HKUST (GZ)(香港科技大学(广州)) The University of Sydney(悉尼大学) UESTC(电子科技大学) ZJU(浙江大学)

专题命中 长上下文与记忆 :language model(title);分类 cs.AI

AI总结 提出STaR-KV,一种无需训练的KV缓存压缩框架,通过子空间感知评分、时间稳定性折扣和熵驱动温度三个维度自适应校准令牌重要性,在GUI任务中实现高精度和近40%的峰值GPU内存节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00724 2026-06-02 cs.CL cs.AI 73%

WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering

WaveFilter: 通过小波引导的KV缓存过滤增强扩散型大语言模型的长上下文能力

Jinnan Yang, Yan Wang, Zhen Bi, Kehao Wu, Xiaojie Li, Jungang Lou, Zechao Li, Jing Liu

机构 * Nanjing University of Science and Technology(南京理工大学) Alibaba Group(阿里巴巴集团) Huzhou Normal University(湖州师范学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对扩散型大语言模型在长上下文任务中计算开销大和推理延迟高的问题,提出一种无需训练的通用缓存框架WaveFilter,利用小波变换分解长序列以精确识别关键token,构建稀疏KV缓存,从而提升现有KV缓存方法在复杂长上下文任务中的性能。

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03203 2026-06-02 cs.CL cs.LG 73%

ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution

ForesightKV: 通过学习长期贡献优化推理模型的KV缓存驱逐

Zican Dong, Peiyu Liu, Junyi Li, Zhipeng Chen, Han Peng, Shuo Wang, Wayne Xin Zhao

机构 * Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出ForesightKV框架,通过监督学习和强化学习预测KV对在长文本生成中的重要性,在仅用一半缓存预算下优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02054 2026-06-02 cs.AI 70%

eMoT: evolving Memory-of-Thought via Symbolic Anchoring and Memory Corrosion

eMoT: 通过符号锚定和记忆腐蚀演化的思维记忆

Xiang Li, Jiwei Wei, Ke Liu, Yitong Qin, Jinyu Guo, Malu Zhang, Peng Wang, Yang Yang

机构 * Center for Future Media, University of Electronic Science and Technology of China(未来媒体中心,电子科技大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出eMoT框架,通过记忆腐蚀、符号锚定和一致性精炼三个模块,将推理轨迹视为动态演化记忆,以稳定多步推理并提升准确率与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01385 2026-06-02 cs.SE cs.AI 70%

Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory

桥接需求与架构:基于外部知识和分层记忆的多智能体编排

Ruiyin Li, Yiran Zhang, Xiyu Zhou, Yangxiao Cai, Peng Liang, Weisong Sun, Jifeng Xuan, Zhi Jin, Yang Liu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出MAAD框架,通过编排四个专业智能体(分析师、建模师、设计师、评估师),结合RAG注入架构标准与分层记忆机制,自动将需求规格转化为多视图架构蓝图并评估质量属性。

Comments 39 pages, 7 images, 5 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00963 2026-06-02 cs.CV cs.CL 70%

Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning

Reasmory: 3D重建作为VLMs空间推理的显式记忆

Jixuan He, Xueting Li, Chieh Hubert Lin, Ming-Hsuan Yang

机构 * Cornell Tech, Cornell University(康奈尔科技学院、康奈尔大学) NVIDIA(英伟达) illoca AI(illoca人工智能) The University of California, Merced(加州大学梅尔塞德斯分校)

专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 提出Reasmory框架,通过结构化程序执行重建的3D显式记忆,并引入轻量级领域特定语言约束VLM查询和操作,在空间推理任务上提升6-18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00610 2026-06-02 cs.IR cs.AI cs.MA 70%

MemGraphRAG: Memory-based Multi-Agent System for Graph Retrieval-Augmented Generation

MemGraphRAG:基于记忆的多智能体系统用于图检索增强生成

Chuanjie Wu, Zhishang Xiang, Yunbo Tang, Zerui Chen, Qinggang Zhang, Jinsong Su

机构 * Xiamen University(厦门大学) Jilin University(吉林大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MemGraphRAG框架,通过基于记忆的多智能体系统构建高质量知识图谱,并设计记忆感知的分层检索算法,在多个基准上超越现有模型。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29341 2026-06-02 cs.CV cs.CL 70%

WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

WorldMemArena: 通过动作-世界交互评估多模态智能体记忆

Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu, Yepeng Liu, Lin Long, Yichen Guo, Nuo Chen, Zhaotian Weng, Elena Kochkina, Simerjot Kaur, Charese Smiley, Xiaomo Liu, James Zou, Sheng Liu, Yuheng Bu, Songyou Peng, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) J.P. Morgan Chase(摩根大通) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出WorldMemArena基准,通过动作-世界交互循环的四阶段生命周期评估多模态智能体记忆,揭示现有方法在写入、维护、检索和使用中的失败点。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14460 2026-06-02 cs.CL 70%

Agent-R1: A Unified and Modular Framework for Agentic Reinforcement Learning

Agent-R1:一个统一且模块化的智能体强化学习框架

Mingyue Cheng, Shuo Yu, Daoyu Wang, Qingchuan Li, Xiaoyu Tao, Jie Ouyang, Yucong Luo, Yitong Zhou, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Agent-R1框架,通过步骤级轨迹表示和灵活上下文管理,解决智能体强化学习中轨迹表示不匹配问题,支持多种优化策略。

Comments This paper serves as the technical report of the Agent-R1 project

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01164 2026-06-02 cs.CV 67%

Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends

迈向交互式视频世界建模:前沿、挑战、基准与未来趋势

Jiuming Liu, Chaojun Ni, Mengmeng Liu, Chensheng Peng, Fangjinhua Wang, Sitian Shen, Marc Pollefeys, Masayoshi Tomizuka, Ayush Tewari, Per Ola Kristensson

机构 * Department of Engineering, University of Cambridge, U.K.(剑桥大学工程系) Peking University(北京大学) University of Twente(埃因霍温理工大学) Mechanical Systems Control Laboratory, University of California, Berkeley, USA(加州大学伯克利分校机械系统控制实验室) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文系统综述了交互式世界建模的研究趋势、技术挑战、评估基准,并提出了未来方向,重点在于动作条件可控性、长程交互与记忆以及实时响应性。

Comments Under review. The GitHub repository is publicly available at: https://github.com/liujiuming123/Awesome-Interactive-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00576 2026-06-02 cs.RO 67%

Dynamic Resilient Spatio-Semantic Memory with Hybrid Localization for Mobile Manipulation

面向移动操作的动态弹性时空语义记忆与混合定位

Zhijie Yan, Shufei Li, Ze Zhang, Xin Liu, Yuhang Zheng, Zuoxu Wang

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 提出DREAM框架,通过在线构建时空语义体素记忆、冗余感知记忆剪枝和混合定位,实现无预建地图的动态室内移动操作,将长时任务成功率提升至55%-70%。

Comments Code, CAD model, and real-robot demonstrations are available at https://bjhyzj.github.io/dream-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00485 2026-06-02 cs.CR 67%

Confused ChatGPT: Cross-App Context Poisoning via First-Party APIs

困惑的ChatGPT:通过第一方API的跨应用上下文投毒

Chao Wang, Somesh Jha, Zhiqiang Lin

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 本文发现ChatGPT Apps中由于共享聊天上下文缺乏隔离,恶意应用可通过第一方API注入持久性内容,导致跨应用上下文投毒攻击,并展示了两种攻击载荷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01563 2026-06-02 cs.LG 57%

MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference

MomentKV:消除长上下文推理中KV缓存驱逐的方向差距

Yu Li, Binxu Li, Tian Lan

机构 * George Washington University(乔治·华盛顿大学) Princeton University(普林斯顿大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 针对长上下文推理中KV缓存驱逐导致输出退化的问题,提出MomentKV方法,通过维护驱逐令牌集的矩统计量(计数、键均值、值均值和值-键协方差)来识别与累积摘要对齐的令牌,并在推理时提供驱逐注意力输出的一阶近似,实现选择性驱逐与精确校正的相互增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01528 2026-06-02 cs.AI 57%

Joint Agent Memory and Exploration Learning via Novelty Signals

通过新颖性信号实现联合智能体记忆与探索学习

Shizuo Tian, Xiaohong Weng, Rui Kong, Yuxuan Chen, Guohong Liu, Yuebing Song, Jiacheng Liu, Yuchen Li, Dawei Yin, Ting Cao, Yunxin Liu, Yuanchun Li

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司) Tongji University(同济大学) Peking University(北京大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 提出JAMEL框架,利用新颖性信号联合训练智能体记忆与探索策略,在开放环境中实现高效探索并泛化到未见环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01287 2026-06-02 cs.CV cs.AI 57%

Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

超越视觉记忆:潜在视觉推理的机制诊断

Garvin Guo, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Shuai Dong

机构 * Amap, Alibaba Group(阿里集团亚马通) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 通过分解潜在令牌为三个可测试组件,发现边界标记和格式而非潜在槽贡献了主要性能提升,揭示了潜在视觉推理的真正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10056 2026-06-02 cs.LG stat.ML 57%

WildCat: Near-Linear Attention in Theory and Practice

WildCat: 理论与实践中近乎线性的注意力机制

Tobias Schröder, Lester Mackey

机构 * University of Cambridge(剑桥大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 提出WildCat方法,通过随机枢轴Cholesky算法选择加权核心集,在近线性时间内以超多项式误差衰减近似精确注意力,并应用于图像生成、分类和语言模型KV缓存压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02436 2026-06-02 cs.CV 50%

Geometry-Aware Implicit Memory for Video World Models

几何感知隐式记忆用于视频世界模型

Zhengxuan Wei, Xu Guo, Xinghui Li, Xunzhi Xiang, Min Wei, Yiran Zhu, Qiulin Wang, Xintao Wang, Pengfei Wan, Xiangwang Hou, Qi Fan

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 提出GIM-World框架,通过轻量级Transformer编码器将可变长度历史压缩为固定大小的记忆令牌,并利用相机可查询的几何头在训练期间从冻结的基础模型中蒸馏3D场景结构,从而在长时程视频生成中保持几何和视觉一致性。

Comments Project page: https://gim-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 138 篇

2604.04937 2026-06-02 cs.AI cs.CL 93%

Pramana: Fine-Tuning Large Language Models for Epistemic Reasoning through Navya-Nyaya

Pramana: 通过 Navya-Nyaya 微调大型语言模型进行认知推理

Sharath Sathish

机构 * University of York(约克大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出 Pramana 方法,利用 2500 年历史的印度 Navya-Nyaya 逻辑框架微调 LLM,通过结构化六阶段推理解决认知差距,提升可溯源性。

Comments 52 pages + appendices, comprehensive treatment of Navya-Nyaya computational formalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01991 2026-06-02 cs.AI cs.CL cs.CY 92%

SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning

SafeMCP:基于环境接地前瞻推理的LLM智能体防御主动功率调节

Lichao Wang, Zhaoxing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang, Juntao Dai

机构 * Beijing Institute of Technology(北京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体因动作空间扩大而面临功率寻求风险,提出SafeMCP服务器端防御插件,通过内部世界模型进行前瞻推理,实现主动工具过滤和即时干预两级防御,在保持智能体效用的同时有效降低风险。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12795 2026-06-02 cs.SE 92%

When Large Language Models Meet UAV Projects: An Empirical Study from Developers' Perspective

当大型语言模型遇到无人机项目:来自开发者视角的实证研究

Yihua Chen, Xingle Que, Jiashuo Zhang, Jiachi Chen, Ting Cui, Guangshun Li, Ting Chen

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 通过分析997篇论文和1509个GitHub项目,并调查52位从业者,本研究分类了无人机项目中大型语言模型(LLM)的九种常见任务和四种工作流,揭示了研究与工业实践之间的差异,并指出了整合LLM的五大挑战因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01046 2026-06-02 cs.AI 92%

TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents

TravelEval:评估基于LLM的旅行规划代理的综合基准框架

Weiyi Chen, Shuaixiong Wang, Ziyun Gao, Kaichun Hu, Wangze Ni, Shimin Di, Chen Jason Zhang, Lei Chen

机构 * Zhejiang University(浙江大学) Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) HKUST (GZ) & HKUST Guangzhou(香港科技大学(广州)& 香港科技大学(广州))

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有基准过度关注约束合规、缺乏真实性和多维评估的问题,提出TravelEval,通过六维评估框架、真实数据沙盒和模拟全局评估方法,全面评估LLM在旅行规划中的表现。

Comments 31pages, 8 figures, accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏