Multi-Agent Systems Should be Treated as Principal-Agent Problems
多智能体系统应被视为委托-代理问题
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 本文提出将多智能体系统视为委托-代理问题,探讨信息不对称和目标不一致对系统行为的影响,并通过谋略现象分析其缓解策略。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
多智能体系统应被视为委托-代理问题
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 本文提出将多智能体系统视为委托-代理问题,探讨信息不对称和目标不一致对系统行为的影响,并通过谋略现象分析其缓解策略。
LINA: 基于连续令牌的线性自回归图像生成模型
机构 * The University of Hong Kong(香港大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 LINA是一种基于线性注意力的高效文本到图像生成模型,通过改进归一化和门控机制,在计算效率和生成质量上取得平衡。
Comments 20 pages, 9 figures
评估SAM2用于视频语义分割
机构 * School of EEE(电子工程系) ; Nanyang Technological University(南洋理工大学) ; Institute for Infocomm Research(信息通信研究所) ; A*STAR ; College of Computer Science(计算机科学学院) ; Nankai University(南开大学) ; State Key Laboratory of Public Big Data(公共大数据国家重点实验室) ; Guizhou University(贵州大学) ; Fudan Vision and Learning Lab(复旦大学视觉与学习实验室)
专题命中 长上下文与记忆 :foundation model(abstract)
AI总结 本文评估了SAM2在视频语义分割中的应用,通过两种方法提升分割性能,利用SAM2的精确边界预测增强整体效果。
Comments 17 pages, 3 figures and 7 tables
Journal ref Machine Intelligence Research (2025)
从原子到社区:结构化和演化的代理记忆用于用户行为建模
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 STEAM通过结构化和演化的代理记忆框架,提升用户行为建模的准确性与多样性。
VisGym: 多模态代理的多样化、可定制化、可扩展环境
专题命中 长上下文与记忆 :language model(abstract)
AI总结 VisGym通过多样化环境评估多模态代理在多步视觉决策中的表现,揭示模型在长上下文处理和视觉化任务中的局限性。
Comments Project page: https://visgym.github.io/
开发者与前瞻性AI的交互模式:一项为期五天的实地研究
专题命中 长上下文与记忆 :prompting(abstract)
AI总结 本研究通过五天实地观察,揭示开发者对前瞻性AI建议的接受模式,发现干预时机和上下文对使用效果有显著影响。
Comments 14 pages, 6 figures, accepted to IUI'26
长时间视频中的自监督动物识别
机构 * University of Bristol(布里斯托大学)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 本研究提出了一种高效的自监督方法,通过全局聚类任务实现长时间视频中动物个体的高精度识别,准确率超过97%,且内存消耗低,适用于资源受限环境。
Comments 11 pages, 1 figure
像素级视觉几何估计
机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Xiaomi EV(小米电动车)
专题命中 长上下文与记忆 :foundation model(abstract)
AI总结 本文提出像素级视觉几何模型,通过生成建模技术实现高质量无飞像素点云,提升单目和视频深度估计的性能和准确性。
Comments Code: https://github.com/gangweix/pixel-perfect-depth
为检索增强型大语言模型提供多任务嵌入器
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 LLM-Embedder通过引入排名感知奖励和分级蒸馏,统一多任务检索增强,提升大语言模型在多种下游任务中的性能。
通过主动内存调度实现全面的GPU多任务处理
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 MSched通过主动内存调度技术,提升GPU多任务处理效率,显著减少页面故障,优化内存使用。
重新思考基于SAM的视觉目标跟踪中的记忆设计
机构 * Department of Computer Science, Khalifa University(计算机科学系,卡利法大学)
专题命中 长上下文与记忆 :foundation model(abstract)
AI总结 本文提出了一种统一的混合记忆框架,通过分解记忆为短期外观记忆和长期干扰解决记忆,提升基于SAM的视觉目标跟踪在复杂场景下的鲁棒性。
Comments \textbf{This is a preprint. Some results are being finalized and may be updated in a future revision.}
JoyVoice: 长上下文条件生成用于拟人化多说话人对话合成
机构 * SpeechTeam(语音团队)
专题命中 长上下文与记忆 :foundation model(abstract)
AI总结 JoyVoice通过统一的E2E-Transformer-DiT架构实现多说话人长对话合成,取得多语言生成和零样本语音克隆的先进成果。
机器、人工智能与事物的过去//未来
专题命中 长上下文与记忆 :language model(abstract)
AI总结 本文通过重新激活1980年代东德打字机,探讨人工智能与历史技术的交互,挑战进步叙事,强调慢速与物质性在设计中的价值。
Comments State of Responsible Technology 2025 - Generative Things. pp 13-19. Stichting ThingsCon Amsterdam
DynamicGSG: 动态3D高斯场景图用于环境适应
机构 * School of Computer Science, Beijing Institute of Technology, China(计算机学院,北京理工大学)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 DynamicGSG通过动态高斯场景图实现环境适应,利用高斯溅射技术构建层次化场景图,提升环境理解和适应能力。
Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
动态上下文选择用于检索增强生成:缓解干扰项和位置偏差
专题命中 长上下文与记忆 :language model(abstract)
AI总结 本文提出动态上下文选择方法,通过优化检索文档数量和位置以提升RAG生成质量。
VideoMem: 通过自适应内存管理增强超长视频理解
机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 VideoMem通过自适应内存管理框架,有效提升超长视频理解任务的性能,采用PRPO算法和两个核心模块实现高效训练和长期记忆保留。
Repulsor:利用对比记忆库加速生成建模
机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(人工智能与数据科学学院,中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; HKU(香港大学) ; CUHK(香港大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学)
专题命中 长上下文与记忆 :foundation model(abstract)
AI总结 Repulsor通过对比记忆库机制,无需外部编码器,实现高效的生成建模,显著提升收敛速度和生成质量。
Comments 19 pages, 19 figures
MulCLIP: 一种多级对齐框架,用于增强细粒度长上下文CLIP
机构 * FPT Software AI Center(FPT软件人工智能中心) ; VinUniversity(文大学)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 MulCLIP通过多级对齐框架提升细粒度长上下文CLIP的性能,采用标记重建和子描述聚合策略增强语义连接与上下文提取。
MR-COSMO:一种用于查询驱动3D分割的视觉-文本记忆召回与直接跨模态对齐方法
专题命中 长上下文与记忆 :language model(abstract)
AI总结 MR-COSMO通过视觉-文本记忆召回与直接跨模态对齐方法,在查询驱动的3D分割中实现几何与语义特征的精确融合,提升点云分割性能。
Comments Accepted by AAAI 2026. Copyright (c) 2026, Association for the Advancement of Artificial Intelligence (www.aaai.org). All rights reserved
基于视觉语言模型的持续学习用于自动驾驶中的视觉问答
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 本文提出结合视觉语言模型与持续学习的方法,以提升自动驾驶中视觉问答系统的性能和可靠性。
C2SaferRust:利用神经符号技术将C项目转化为更安全的Rust
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 C2SaferRust结合规则系统和LLMs,将C代码转换为更安全的Rust,减少指针和unsafe代码,提升安全性与性能。
EgoLCD:基于长上下文扩散的自体视频生成
机构 * Peking University(北京大学) ; Sun Yat-sen University(中山大学) ; Zhejiang University(浙江大学) ; Chinese Academy of Sciences(中国科学院) ; Tsinghua University(清华大学)
专题命中 长上下文与记忆 :prompting(abstract)
AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。
基于语言的面向对象两阶段方法用于场景图预见
机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) ; Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁大学) ; Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(跨学科研究学院,香港科学与技术大学)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 本文提出基于语言的面向对象两阶段方法,通过时间一致性正则化预测对象集动态和关系轨迹,显著提升视频场景图预见性能。
可解释的深度卷积多类型异常检测
机构 * School of Electrical and Electronic Engineering(电子工程学院)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 本文提出 MultiTypeFCDD 框架,通过图像级别标签生成多通道热图,实现多类型异常检测,有效解决传统方法的计算和内存限制问题。
解决证据稀疏性:面向长文档理解的代理情境工程
专题命中 长上下文与记忆 :language model(abstract)
AI总结 SLEUTH通过多代理框架解决长文档理解中的证据稀疏问题,提升多模态文档处理性能。
SegSplat: 用于快速前馈3D重建与丰富开放词汇语义理解的框架
机构 * ETH Zürich(苏黎世联邦理工学院) ; Google(谷歌) ; Microsoft(微软)
专题命中 长上下文与记忆 :foundation model(abstract)
AI总结 SegSplat通过单次传递实现高效3D重建与开放集语义分割,无需每场景优化。
在空间和时间中搜索:统一的记忆-动作循环用于开放世界物体检索
机构 * Department of Computer Science, The University of Texas at Austin(计算机科学系,德克萨斯大学奥斯汀分校)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 STAR框架通过统一记忆查询和具身动作,提升开放世界中时空物体检索的效率与准确性。
Comments https://amrl.cs.utexas.edu/STAR/
机构 * Singapore Management University(新加坡管理大学) ; University of Rochester(罗切斯特大学) ; University College London(伦敦大学学院) ; National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Stanford University(斯坦福大学)
专题命中 长上下文与记忆 :language model(abstract)
Comments Technical Report. 24 figures, 37 pages. Website: https://univa.online/
专题命中 长上下文与记忆 :LLM(abstract)
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Voyager Research, Didi Chuxing ; The University of Hong Kong(香港大学)
专题命中 长上下文与记忆 :foundation model(abstract)