Decentralized Multi-Agent Systems with Shared Context
具有共享上下文的去中心化多智能体系统
机构 * Stanford University(斯坦福大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 提出DeLM框架,通过并行智能体、共享上下文和任务队列去中心化协调,解决集中式MAS的瓶颈,在软件工程和长上下文推理中提升性能并降低成本。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
具有共享上下文的去中心化多智能体系统
机构 * Stanford University(斯坦福大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 提出DeLM框架,通过并行智能体、共享上下文和任务队列去中心化协调,解决集中式MAS的瓶颈,在软件工程和长上下文推理中提升性能并降低成本。
无前向过程的扩散语言模型
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。
PRISM:世界模型中基于先验引导的想象采样
机构 * Northeastern University(东北大学) ; University of California, Berkeley(加州大学伯克利分校) ; Qiyuan Lab(启元实验室) ; University of Florida(佛罗里达大学)
专题命中 测试时计算 :planning(abstract);分类 cs.AI
AI总结 提出PRISM框架,通过从世界模型编码器提取状态条件高斯先验,并利用精度加权高斯乘积更新规划器的采样分布,在不增加架构复杂度的情况下显著提升基于模型的连续控制性能。
面向视觉-语言-动作驾驶模型的推理时注意力引导
机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。
Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention
Journal ref European Conference on Computer Vision 2026
基于基础模型的高效数据采样(FEEDS):用于泛癌、多示踪剂PET/CT数据集的标签高效训练策略
机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) ; Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心) ; Yale University(耶鲁大学)
专题命中 测试时计算 :planning(abstract)
AI总结 该研究提出FEEDS策略,利用视觉基础模型嵌入选择信息性和多样性未标注病例,在减少70%标注负担时达到全标注训练性能,解决了PET/CT病灶分割的标签稀缺问题。
Comments Code is publicly available on https://github.com/Image-and-Multimodal-Data-Analytics/FEEDS
超越全局编辑:用于LVLMs无训练幻觉缓解的实例级解耦子空间
机构 * Macquarie University(麦考瑞大学) ; York University(约克大学) ; Northern Illinois University(北伊利诺伊大学) ; University of Technology Sydney(悉尼科技大学) ; North South University(北南大学) ; Lancaster University(兰卡斯特大学) ; Australian National University(澳大利亚国立大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 针对LVLMs现有模型编辑技术采用单一全局子空间无法适配多样幻觉模式的问题,提出无训练的实例级解耦子空间框架,经多基准实验验证其鲁棒性、通用性与效率。
Comments BMVC 2026
你无需停留在循环中:用于机器人策略改进的智能体机器人循环
专题命中 测试时计算 :verifier(abstract)
AI总结 该研究将编码智能体的软件循环架构迁移至机器人策略改进领域,提出AgenticRobotics控制平面,解决机器人工具易失效问题,实现错误提升控制等性能提升。
Comments Agentic Robotics Preview Version
下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。
超越帧选择:用多模态大语言模型重新思考长视频理解
机构 * National Institute of Informatics(信息学研究所)
专题命中 测试时计算 :reasoning(abstract)
AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。
用于提升AI生成新闻摘要事实可靠性的跨平台认知验证
专题命中 测试时计算 :verifier(abstract)
AI总结 本研究提出多源证据共识验证(MECV)框架,通过多异构来源证据聚合与多LLM陪审团机制修正AI生成新闻摘要的幻觉,在SummEdits基准上提升了事实一致性,为可信AI与自动化新闻研究提供了新方法。
通过端到端评估应用层行动证据发现Project Veraison的TPM参考方案中存在的挑战随机数新鲜度缺口
专题命中 测试时计算 :verifier(abstract)
AI总结 本文发现Project Veraison的TPM参考方案存在挑战随机数新鲜度缺口,通过端到端测试验证修复方案,使重放Quote的评估结果变为否定,提升了RATS架构的安全性。
Comments 18 pages, 3 figures. Responsible disclosure: veraison/services#427, fixed in PR #432. Artifact and data: doi:10.5281/zenodo.20998730
AI智能体证据的硬件根证明:将IETF RATS与行动证据包组合
专题命中 测试时计算 :verifier(abstract)
AI总结 本研究提出将IETF RATS架构与行动证据包组合,实现AI智能体的硬件根证明,通过仿真TPM实验验证了该方案的可行性。
Comments 9 pages, 1 figure, 1 table. Technical note. Also deposited at Zenodo: doi:10.5281/zenodo.20818671
证据见证组合:针对闭集多模态答案的单预填充风险检测
专题命中 测试时计算 :verifier(abstract)
AI总结 该研究提出WEP方法,利用MLLM的白盒预填充路径,无需额外操作即可检测闭集视觉答案的推理风险,在3个MLLM和4个基准上提升了平均错误AP。
Comments 22 pages, 6 figures; includes supplementary material. Code: https://github.com/SouthWinter/WEP
Fabric 是集群驱动:面向 GPU-CXL Fabric 的跨层 eBPF 策略
专题命中 测试时计算 :verifier(abstract)
AI总结 该研究提出 fabric_ext 中间件编译器与运行时,通过语义移动图实现跨 GPU-CXL Fabric 多层的 eBPF 策略,以处理 LLM 预填充等场景下的跨岛数据流需求。
大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者
专题命中 测试时计算 :reasoning(abstract)
AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。
Kubernetes推理服务中的冷启动模型交付:基于OCI的分发及其完整性的实证研究
专题命中 测试时计算 :verifier(abstract)
AI总结 研究Kubernetes推理服务中模型冷启动交付问题,通过在KServe平台实现oci+native://和oci+fetch://两条新交付路径进行分析,对比不同交付路径在不同模型大小下的表现,提出服务时完整性设计并验证其对交付时间的影响。
Comments 8 pages, 2 figures, 3 tables. Submitted to IEEE Access. Benchmark harness and data: https://github.com/kliukovkin/oci-model-delivery-bench
ProfMalPlus:通过静态-动态分析协同实现代理协调检测恶意NPM包
专题命中 测试时计算 :reasoning(abstract)
AI总结 研究针对NPM包恶意代码检测问题,提出ProfMalPlus,结合对象敏感行为图与大语言模型推理,经多步骤提取安全切片并评估,对不确定情况增强证据后再评估,最终定位恶意代码,F1分数高且发现多个未知恶意包,性能优于现有检测器。
超越随机采样:用于半监督医学图像分割的分布感知对齐
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Department of Ultrasound, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院超声科)
专题命中 测试时计算 :planning(abstract)
AI总结 研究针对半监督医学图像分割中随机采样策略在低数据量时表征偏差的问题,提出基于分布对齐的高效框架,用分布感知样本选择策略和记忆引导复制粘贴模块,提升分割性能。
Comments 19 pages, 5 figures, accepted by ECCV 2026
CogRad:一种用于放射学报告生成的受认知启发的多智能体框架
机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) ; Intelligentx GmbH(智能X有限公司) ; Department of Core Informatics, Graduate School of Informatics, Osaka Metropolitan University(大阪城市大学信息科学研究生院核心信息学系)
专题命中 测试时计算 :verifier(abstract)
AI总结 提出受认知启发的多智能体框架CogRad,围绕放射科医生阅读过程的四个阶段构建报告生成,通过多智能体协作提升报告质量,在多个数据集上取得最佳成绩。
用于智能应用的工作流感知服务层
专题命中 测试时计算 :verifier(abstract)
AI总结 研究智能AI应用工作流,其介于现有两层之间。提出Dyserve工作流感知服务层填补空白,通过整数线性规划在异构后端池编译节点模型和验证器选择,还可在不同压力水平预求解并动态调整。
DataEvolver: 面向文本丰富图像生成的自我进化多智能体数据构建
机构 * Central South University(中南大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :verifier(abstract)
AI总结 提出DataEvolver,一种自我进化的多智能体框架,通过反馈驱动策略迭代优化数据构建,显著提升文本丰富图像生成质量。
远距离推测:边缘-云推测解码何时真正有效
专题命中 测试时计算 :verifier(abstract)
AI总结 本文通过闭式不等式分析分布式推测解码(DSD)在广域网边缘-云通信下的延迟收益,指出其仅在低RTT场景下优于共置SD,并发现多租户容量是DSD的主要优势。
VisCritic: 视觉状态比较作为GUI智能体的过程奖励
机构 * City University of Hong Kong(香港城市大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。
Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file
ChartWalker: 跨图表RAG任务的基准测试
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。
理论家工具箱:基于智能体的LLM辅助经济理论研究工具
专题命中 测试时计算 :verifier(abstract)
AI总结 提出一种验证优先的经济理论LLM辅助协议,通过三种可重用方法(单次检查、对抗性证明-验证对、多智能体项目)在等级膨胀的Gans-Kominers特征模型上设计Groves/Pigouvian激励机制的实例验证。
探索多模态大语言模型与两阶段微调在时尚图像检索中的应用
机构 * University of Science, VNU-HCM(胡志明市国家大学下属理科大学) ; Vietnam National University, Ho Chi Minh(胡志明市国家大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出融合多模态大语言模型(LLaVA)生成属性感知三元组,并采用两阶段微调策略增强对比学习,以解决时尚图像检索中标注数据稀缺和负采样简单的问题。
Comments SOICT 2025
门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard
专题命中 测试时计算 :verifier(abstract)
AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。
DeSRPA: 通过推理时干预的解耦语音角色扮演智能体
机构 * Nagoya University(名古屋大学) ; National Institute of Informatics(国立情报学研究所)
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出DeSRPA框架,通过推理时干预冻结骨干模型,利用双层控制向量机制解耦认知推理与副语言表达,在语音角色扮演中实现个性与情感一致性,超越端到端微调方法。
Comments Accepted to INTERSPEECH 2026
AI代理网络的可靠性:密度演化、停止集与架构优化
专题命中 测试时计算 :verifier(abstract)
AI总结 将多代理AI系统建模为稀疏图上的消息传递,扩展LDPC编码的密度演化理论,分析三种擦除失效模式,并证明密度演化定理以预测未解决子声明的渐近比例。
基于分歧的跨模型路由用于隐式视频问答
机构 * Independent Researcher(独立研究员)
专题命中 测试时计算 :reasoning(abstract)
AI总结 针对隐式视频问答中单模型精度瓶颈和自一致性策略失效问题,提出无标签无训练的分歧驱动跨模型路由方法,将分歧样本路由至第二模型,在ImplicitQA基准上提升平均准确率1.43%。