BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs
BEDI:一种用于无人机上具身智能体评估的综合基准
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 BEDI提出了一种标准化的无人机具身智能体评估基准,通过动态任务范式和混合测试平台,全面评估UAV-EAs的六个核心技能,并揭示现有VLMs在具身任务中的局限性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
BEDI:一种用于无人机上具身智能体评估的综合基准
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 BEDI提出了一种标准化的无人机具身智能体评估基准,通过动态任务范式和混合测试平台,全面评估UAV-EAs的六个核心技能,并揭示现有VLMs在具身任务中的局限性。
PrivLLMSwarm: 用于安全物联网监控的隐私保护大语言模型驱动的无人机群
机构 * Department of Information and Communication Engineering, School of Computer and Communication Engineering, University of Science and Technology Beijing(信息与通信工程系,计算机与通信工程学院,北京科技大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 PrivLLMSwarm通过安全多方计算实现隐私保护的大语言模型驱动无人机群,实现高准确性和低延迟的加密推理,适用于隐私敏感的物联网应用。
代理评估中的随机性:通过组内相关系数量化不一致性
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出通过组内相关系数量化代理评估中的不一致性,以提高评估可靠性,建议在基准测试中报告ICC和查询内方差。
PersonaMem-v2:通过学习隐式用户人设和代理记忆实现个性化智能
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Washington(华盛顿大学) ; University of California Santa Barbara(加州大学圣巴巴拉分校) ; Meta ; University of Southern California(南加州大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Microsoft Corporation(微软公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 PersonaMem-v2通过学习隐式用户人设和代理记忆提升LLM个性化能力,实验显示强化微调使模型在隐式个性化任务中准确率达53%。
Comments Data is available at https://huggingface.co/datasets/bowen-upenn/PersonaMem-v2
AgenticCyber: 一种基于生成式AI的多智能体系统,用于多模态威胁检测与自适应响应在网络安全中
机构 * TNTech
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 AgenticCyber通过生成式AI驱动的多智能体系统,实现多模态威胁检测与自适应响应,提升网络安全性能和态势感知能力。
Comments 6 pages for IEEE conference
在Segment Anything模型家族中SAM2到SAM3之间的鸿沟:基于提示的专家知识为何在概念驱动的图像分割中失效
机构 * Cornell University(康奈尔大学) ; University of the Peloponnese(希腊皮洛斯大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文分析了SAM2到SAM3在分割模型中的断层,指出基于提示的分割方法在概念驱动分割中失效的原因,并探讨了SAM3的多模态架构与评估方法。
视频模型开始解决国际象棋、迷宫、数独、心理旋转和雷文矩阵任务
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 视频模型通过强化学习提升推理能力,在多项任务上达到60%的成功率。
Comments See $\href{https://grow-ai-like-a-child.com/video-reason/}{results}$ and $\href{https://github.com/hokindeng/VMEvalKit}{code}$
EncQA:在图表视觉编码上评估视觉-语言模型的基准测试
机构 * Stanford University(斯坦福大学) ; Apple(苹果公司)
专题命中 推理评测 :reasoning(abstract)
AI总结 EncQA通过系统覆盖图表理解的关键视觉编码和任务,揭示了不同编码和任务间VLMs性能的显著差异,强调了针对性策略的重要性。
过程奖励与结果奖励:哪种对代理RAG强化学习更有效
专题命中 推理评测 :reasoning(abstract)
AI总结 ReasonRAG通过过程级奖励提升代理RAG强化学习性能,以更高效训练和更少数据实现更优结果
OmniSafeBench-MM:多模态 jailbreak 攻击-防御评估的统一基准和工具箱
机构 * Nanyang Technological University, Singapore(南洋理工大学) ; BraneMatrix AI, China(BraneMatrix AI) ; Chongqing University, China(重庆大学) ; Xi’an Jiaotong University, China(西安交通大学) ; Northeastern University, China(东北大学) ; Sun Yat-sen University, China(中山大学) ; Alibaba, China(阿里巴巴) ; National University of Singapore, Singapore(新加坡国立大学) ; ByteDance, China(字节跳动)
专题命中 推理评测 :reasoning(abstract)
AI总结 OmniSafeBench-MM提供一个多模态jailbreak攻击-防御评估的统一基准和工具箱,整合13种攻击方法、15种防御策略及广泛数据集,通过三维评估协议深入分析安全与效用。
AI生成的驾驶视频是否准备好用于自动驾驶?一种诊断评估框架
机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校IFM实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种诊断评估框架,系统研究AI生成驾驶视频在自动驾驶训练和评估中的可靠性,通过分析失败模式和构建基准测试,验证了过滤AIGVs可提升性能并补充现实数据。
使用语言模型可解释性进行无监督解码编码推理
机构 * Goodfire AI ; Anthropic ; Cambridge-Boston Alignment Initiative(剑桥-波士顿对齐计划)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本研究通过微调模型进行加密推理并利用logit lens分析,验证了可解释性技术在解码隐藏推理过程中的有效性,提出了无监督解码方法以提升对AI系统监督能力。
Comments Modifying author contact information
CoT4Det:面向感知导向视觉-语言任务的链式思维框架
机构 * Baidu Inc.(百度公司)
专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract)
AI总结 CoT4Det通过将感知任务分解为分类、计数和定位三个步骤,提升视觉-语言模型在目标检测等任务中的性能,使mAP从19%提升至33%。
MedGR$^2$: 通过生成奖励学习突破医学推理的数据壁垒
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 MedGR$^2$通过生成奖励学习解决医学推理中的数据稀缺问题,实现高效训练和泛化,优于现有方法。
Comments 8 pages, 5 figures
Journal ref AAAI'2026 Main Technical Track
VulnLLM-R:基于代理架构的专用推理LLM用于漏洞检测
机构 * Department of Computer Science, University of California, Santa Barbara, CA, USA(加州大学圣芭芭拉分校计算机科学系) ; Department of Computer Science, University of Chicago, Chicago, IL, USA(芝加哥大学计算机科学系) ; Department of Electrical Engineering and Computer Sciences, University of California, Berkeley, CA, USA(加州大学伯克利分校电子工程与计算机科学系) ; Department of Computer Science, University of Illinois Urbana-Champaign, Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校计算机科学系)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 VulnLLM-R通过专用推理模型和代理架构,在漏洞检测中实现高效准确的AI驱动检测。
通过上下文归一化增强长上下文推理用于检索增强生成
机构 * City University of Hong Kong(香港城市大学) ; Baidu Inc.(百度公司)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 通过上下文归一化策略提升RAG在长上下文推理中的鲁棒性和稳定性
弥合相关性与推理:检索增强生成中的推理蒸馏
机构 * City University of Hong Kong(香港城市大学) ; University of Science and Technology of China(中国科学技术大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 RADIO通过推理提取和基于推理的对齐方法,弥合检索增强生成中重排器与生成器之间的相关性差距。
Comments Accepted to ACL 25 Findings
小型语言模型可以用于健康科学研究分类的细致推理:微生物肿瘤发生案例研究
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文研究小型语言模型在健康科学文献分类中的表现,发现其通过细致推理可达到大型语言模型的性能,但需结合有效提示策略以提高准确性。
Comments 43 pages, 7 figures
ThinkTrap: 通过无限思考对黑盒LLM服务发起拒绝服务攻击
机构 * Shanghai Jiao Tong University(上海交通大学) ; Donghua University(东华大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ThinkTrap是一种针对黑盒LLM服务的新型拒绝服务攻击方法,通过优化输入空间诱导无限生成,以最小token开销降低服务吞吐量甚至导致服务失败。
Comments This version includes the final camera-ready manuscript accepted by NDSS 2026
熵在视觉定位中的作用:分析与优化
机构 * Fudan University(复旦大学) ; Hikvision Research Institute(海康威视研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ECVGPO算法,通过熵控制优化视觉定位任务,提升探索与利用的平衡,实现多基准的性能提升。
思维链可监控性:AI安全的新且脆弱的机会
机构 * UK AI Security Institute(英国人工智能安全研究所) ; Apollo Research(阿波罗研究) ; METR ; University of Montreal(蒙特利尔大学) ; Mila ; Anthropic ; OpenAI(开放人工智能研究所) ; Google DeepMind(谷歌DeepMind) ; Truthful AI ; UC Berkeley(伯克利大学) ; Center for AI Safety(人工智能安全中心) ; AI Futures Project(人工智能未来项目) ; Amazon(亚马逊) ; Scale AI ; Magic ; Meta ; Redwood Research(红木研究)
专题命中 其他推理 :CoT(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了通过监控AI思维链来提升安全性的潜力,指出其脆弱性并呼吁进一步研究和投资。
通过生成增强检索和临床实践指南提升医学诊断
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出GARMLE-G框架,通过生成增强检索和临床指南整合,提升医学诊断的准确性和临床实用性。
Journal ref Journal of Biomedical and Health Informatics (JBHI) 2025
我如果能用我的语言说话会学得更好:理解通过微调大型语言模型与LLM生成响应的优越性能
机构 * University of Adelaide(阿德莱德大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了LLM生成响应在微调大型语言模型时的优越性能,发现LLM对自身生成响应的熟悉性是提升学习效果的关键因素。
Comments The paper has been accepted to EMNLP 2024 (Main Conference) there is a follow up paper: Efficiently Selecting Response Generation Strategies for Synthetic Data Construction by Self-Aligned Perplexity Note: This is a revised version of arXiv:2402.11192 (v1, submitted 17 Feb 2024)
LabOS:能够看见并与人类协作的AI-XR共科学家
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 LabOS是一种通过多模态感知和增强现实实现人机协作的AI系统,能实时协助科学家进行实验,推动实验室向智能协作环境发展。
大型语言模型在模拟调查用户响应中的分析
机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心) ; New York University(纽约大学)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL
AI总结 本文分析了大型语言模型在模拟调查用户响应中的表现,提出CLAIMSIM方法以提高响应多样性,但发现模型在处理不同人口特征时存在固有偏见和推理限制。
Comments Accepted to IJCNLP-AACL 2025 (Main Conference)
基于多跳问答的上下文段落效用建模
机构 * Adobe Research, India(Adobe研究印度)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种基于上下文依赖的轻量级方法,用于建模多跳问答中段落的效用,以提高重排和问答性能。
Comments Accepted at IJCNLP-AACL 2025
揭示在生成式人工智能支持下的临床实践中的学生探究模式:一种整合认知网络分析和序列模式挖掘的方法
机构 * Monash University(墨尔本大学) ; University College London(伦敦大学学院) ; Peking University(北京大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究通过整合认知网络分析和序列模式挖掘,揭示学生在GenAI支持下的临床实践中探究模式,发现高绩效者更注重临床相关信息识别,而低绩效者则停留在常规问题验证循环中。
基于大语言模型的量子代码编译
机构 * Department of Computer Science University of Colorado Colorado Springs (UCCS) United States
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究利用大语言模型实现灵活的量子代码转换,解决跨平台开发中的互操作性问题。
Comments IEEE International Conference on Quantum Computing and Engineering (QCE) 2025 - Extended Abstract
TEMPLE:通过渐进式预SFT对齐激励视频大语言模型的时序理解
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 TEMPLE通过渐进式预SFT对齐策略提升视频大语言模型的时序理解能力,利用直接偏好优化和课程学习增强模型对时间信息的感知。
Comments Accepted to AAAI 2026. Code available at https://github.com/lscpku/TEMPLE
利用视觉-语言模型作为社交智能代理在人机交互中的应用
机构 * Cornell University, Cornell Tech(康奈尔大学,康奈尔科技) ; Cornell University(康奈尔大学) ; Rutgers University(罗格斯大学) ; Cornell Tech, Jacobs Technion Cornell Institute(康奈尔科技,雅各布斯技术学院康奈尔研究所)
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出利用视觉-语言模型作为代理,通过轻量级感知检测器触发,实现机器人在人机交互中的社交响应能力。