ComAgent: Multi-LLM based Agentic AI Empowered Intelligent Wireless Networks
ComAgent:基于多LLM的代理式AI赋能智能无线网络
机构 * IEEE
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 ComAgent通过多LLM代理式AI框架,实现复杂无线网络任务的自动化设计与优化,展现出超越单体LLM的性能优势。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
ComAgent:基于多LLM的代理式AI赋能智能无线网络
机构 * IEEE
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 ComAgent通过多LLM代理式AI框架,实现复杂无线网络任务的自动化设计与优化,展现出超越单体LLM的性能优势。
比较需要有效的测量:重新思考AI红队中的攻击成功率比较
机构 * Microsoft Research(微软研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 本文重新审视AI红队中攻击成功率的比较,指出其有效性问题并提出测量理论和统计学方法以评估比较的合理性。
Journal ref NeurIPS 2025
迈向基于MCP服务器生态系统的声明性代理层
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种声明性代理层,旨在解决基于MCP服务器生态系统中代理工作流的可靠性问题,通过明确的架构结构提升任务执行的可验证性和可重复性。
Comments 12 pages, 3 figures
SceneSplat++: 一个大规模数据集和全面的基准用于语言高斯点云
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Amsterdam(阿姆斯特丹大学) ; Johns Hopkins University(约翰·霍普金斯大学) ; University of Pisa(比萨大学) ; University of Trento(特伦托大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 SceneSplat++提出一个大规模数据集和基准,评估语言高斯点云方法,展示可推广方法在3D理解中的优势。
Comments 15 pages, codes, data and benchmark are released at https://scenesplatpp.gaussianworld.ai/
DANCE: 动态、可用、邻居门控的联邦文本属性图压缩
机构 * Department of Computer Science, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学系) ; The Hong Kong University of Science and Technology (GZ), Guangzhou, China(香港科技大学(广州))
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 DANCE通过动态、可用、邻居门控的图压缩方法,提升联邦文本属性图学习的准确性和可解释性。
DSGym: 一个全面的框架用于评估和训练数据科学代理
机构 * Stanford University(斯坦福大学) ; Together AI ; Duke University(杜克大学) ; Harvard University(哈佛大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 DSGym通过标准化框架提升数据科学代理的评估与训练,解决现有基准测试的碎片化和数据不足问题,提供可扩展的任务套件和数据合成管道。
对LLM人设设计的系统化:面向AI陪伴应用的四象限技术分类
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出四象限技术分类系统,系统化LLM人设设计,涵盖虚拟与具身、情感与功能增强,分析不同应用场景的技术挑战与核心问题。
Comments Accepted to Neurips 2025 workshop: LLM Persona Workshop
证明-使用:减轻深度研究代理中的工具调用黑客行为
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 证明-使用通过优化证据依赖关系,减轻深度研究代理中的工具调用黑客行为,并展现出适应性强的工具使用模式。
预测编码与信息瓶颈用于大语言模型中的幻觉检测
机构 * AI Offensive Security Researcher, OWASP(AI攻击防御安全研究员,OWASP)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本研究提出了一种结合预测编码和信息瓶颈的轻量级框架,用于高效检测大语言模型中的幻觉,实现了比传统方法更高的准确率和效率。
MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统
机构 * ABB Inc(ABB公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。
Comments 12 pages, 2 figures, Submitted to ACL
DevPrompt: 基于偏差的提示学习用于单正常样本图像异常检测
机构 * Department of Electrical and Computer Engineering, Concordia University(电气与计算机工程系,康科迪亚大学) ; Computer Research Institute of Montreal (CRIM)(蒙特利尔计算机研究 institute)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 DevPrompt通过结合视觉语言模型的语义能力和基于偏差的评分机制,提升单正常样本图像异常检测的性能和可解释性。
Comments 8 pages
战略合作者竞争的计算基础:形式化信任与声誉动态
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出一种双层信任模型,结合博弈论与动态信任演变,通过实验验证其在合作者竞争中的有效性。
Comments 57 pages, 20 figures. Second technical report in research program; should be read with foundational companion arXiv:2510.18802. Adapts and extends trustworthiness and reputation material from Pant (2021) doctoral dissertation, University of Toronto. Validation source code: https://github.com/vikpant/strategic-coopetition/tree/master/TR_validation/TR2_trust
从教材到谈bot:面向高等教育的希腊语基于检索增强生成的聊天机器人案例研究
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本研究开发了一个基于RAG框架的希腊语AI聊天机器人,用于高等教育中的教学支持,旨在提升教育实践和AI技术在语言教育中的应用。
Comments 11 pages, 5 figures, 6th Barcelona Conference on Education (BCE2025)
DroneVLA:基于VLA的空中操控
机构 * Skoltech(斯克里普金科技大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 DroneVLA通过结合VLA模型和定制无人机,实现基于自然语言指令的空中物体抓取与递送,展示了在定位和导航中的高精度表现。
Comments This paper has been accepted for publication at LBR of HRI 2026 conference
Disc3D:通过判别性对象指称自动校准高质量3D对话数据
机构 * PICO, ByteDance, Beijing(字节跳动北京研究院) ; Tsinghua University(清华大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 Disc3D通过自动化流程生成高质量3D对话数据,解决视角和对象指称模糊性问题,提升多模态大语言模型性能。
Comments 8 pages
GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) ; School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV
AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。
基于主动推断的世界建模用于自适应无人机蜂群轨迹设计
机构 * University of Genoa(热那亚大学) ; Carlos III University Madrid(马德里卡洛斯三世大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出基于主动推断的世界建模框架,用于自适应无人机蜂群轨迹设计,通过整合概率推理和自我学习实现动态环境下的适应性响应。
Comments This paper has been accepted for presentation at the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (IEEE ICASSP 2026) Workshop: 'Multi-Modal Signal Processing and AI for Communications and Sensing in 6G and Beyond (MuSiC-6GB)'
基于知识整合的表示学习用于在极端标签稀缺下的加密异常检测;关系领域逻辑整合与检索基础的上下文和路径级解释
机构 * AI and Business Analytics, Ewha Womans University, Seoul, Republic of Korea(爱媛女子大学人工智能与商务分析系) ; Department of Business Administration, Kumoh National Institute of Technology, Gumi, Republic of Korea(Kumoh国立技术大学商业管理系) ; Coretrustlink, Seoul, Republic of Korea(Coretrustlink)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 本文提出RDLI框架,通过整合领域逻辑与检索上下文,提升加密异常检测在极端标签稀缺下的准确性和可解释性。
Comments Gyuyeon Na, Minjung Park, Soyoun Kim contributed equally to this work
DCAC: 动态类感知缓存创建更强的分布外检测器
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 DCAC通过动态类感知缓存提升分布外检测性能,减少误报率
Comments 9 pages, 9 figures, Accepted by AAAI2026
MMDeepResearch-Bench: 一个多模态深度研究代理的基准
机构 * OSU(俄亥俄州立大学) ; Amazon(亚马逊公司) ; UMich(密歇根大学) ; UCL(伦敦大学学院) ; CUHK(香港中文大学) ; UCR(加州大学尔湾分校) ; CWRU(克里夫兰医学中心) ; HKU(香港大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 MMDeepResearch-Bench提出一个多模态深度研究代理的基准,强调报告式合成与引用证据的结合,揭示多模态完整性对深度研究代理的重要性。
通过层选择性MLLMs实现细粒度人体姿态编辑评估
机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出HPE-Bench基准和基于层选择性MLLMs的统一框架,用于细粒度评估人体姿态编辑的真实性和质量。
从电子健康记录和可穿戴数据中学习纵向健康表示
机构 * University of the Chinese Academy of Sciences, Columbia University(中国科学院大学,哥伦比亚大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 本文提出一种多模态基础模型,通过联合表示电子健康记录和可穿戴数据,提升纵向健康预测的准确性和鲁棒性。
SMc2f: 从粗到细的机器人自主性鲁棒场景挖掘
机构 * Department of Computer Science at Xi’an University of Technology(西安理工大学计算机科学系) ; department of Computer Science & Engineering at the University of California, Merced(加州大学默塞德分校计算机科学与工程系)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 SMc2f通过从粗到细的流程,利用视觉语言模型和文本-轨迹对比学习提升机器人场景挖掘的鲁棒性和效率。
FaceXBench: 评估多模态大语言模型在面部理解上的能力
机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) ; Department of Electrical and Computer Engineering, Johns Hopkins University(电气与计算机工程系,约翰霍普金斯大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV
AI总结 FaceXBench通过5000个多模态问题评估MLLMs在面部理解上的能力,揭示了现有模型在复杂任务中的不足。
Comments Accepted in IEEE T-BIOM. Project Page: https://kartik-3004.github.io/facexbench/
Video-Browser: 向具有代理能力的开放网页视频浏览迈进
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 Video-Browser通过金字塔感知技术,在开放式网络视频浏览中实现37.5%的相对提升,同时减少58.3%的token消耗。
SVII-3D:利用厘米级3D定位与稀疏街道影像的综合理解,推进道路基础设施库存建设
机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University, Wuhan 430079, China(信息工程测绘遥感国家重点实验室(LIESMARS),武汉大学) ; Research Institute Ltd, Chengdu 610000, China(四川省公路规划设计研究有限公司)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 SVII-3D通过厘米级3D定位与稀疏影像综合理解,提升道路基础设施库存的自动化创建与细粒度状态诊断能力。
可扩展且可靠的AI知识检索系统评估:RIKER和一致性模拟宇宙
机构 * Kamiwaza AI
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 RIKER通过生成文档而非提取地面真实,提供了一种可扩展且抗污染的AI知识检索系统评估方法,揭示了上下文长度、跨文档聚合和事实基础能力等关键问题。
Comments 26 pages, 17 tables, 1 figure
长时间视频中的自监督动物识别
机构 * University of Bristol(布里斯托大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出了一种高效的自监督方法,通过全局聚类任务实现长时间视频中动物个体的高精度识别,准确率超过97%,且内存消耗低,适用于资源受限环境。
Comments 11 pages, 1 figure
LiteEmbed: 适应CLIP的稀有类别
机构 * CVIT, Kohli Centre for Intelligent Systems, IIIT Hyderabad, India(印度海得拉巴IIIT大学计算机视觉研究所、Kohli智能系统中心) ; Adobe Research, Bengaluru, India(印度班加罗尔Adobe研究)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 LiteEmbed通过子空间优化和双目标方法,实现CLIP在稀有类别上的少样本个性化,提升分类和检索任务的性能。
Comments 14 pages, 12 figures
OpenVoxel: 一种无需训练的稀疏体素分组与标注算法用于开放词汇3D场景理解
机构 * NVIDIA ; National Taiwan University(国立台湾大学)
专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV
AI总结 OpenVoxel通过无需训练的多模态大语言模型实现稀疏体素的分组与标注,提升开放词汇3D场景理解的性能。
Comments project page: https://peterjohnsonhuang.github.io/openvoxel-pages/