Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation
将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。
标准可解释模型:一种基于拉格朗日力学的可解释机器学习通用理论,用于演绎设计可解释方法
机构 * IBM Research (CH)(IBM研究院(瑞士)) ; University of Oxford (UK)(牛津大学(英国)) ; University of Cambridge (UK)(剑桥大学(英国)) ; KU Leuven (BE)(鲁汶大学(比利时)) ; Institute of Physics of the Czech Academy of Sciences (CZ)(捷克科学院物理研究所(捷克))
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 提出标准可解释模型(SIM),基于拉格朗日力学从前提演绎出可解释性对称性和约束,通过最小化拉格朗日函数得到最优可解释模型,解决现有方法局限性并指导新方法设计。
利用大语言模型传达信用风险:基于标准数据与替代数据模型的解释评估
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本研究探究大语言模型能否作为解释层转化信用风险模型的事后解释,构建三类流程并采用三类LLM,发现证据表征是解释质量的关键制约,专业人士对证据标准要求更严格。
Comments 49 pages, 14 figures
MoRAX:面向地理空间基础模型的基于移动性的表示增强方法
机构 * The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 MoRAX是增强地理空间基础模型的轻量级框架,利用人类移动性数据补充区域功能结构,其教师模型在多国多城市的八项预测任务中优于基线,学生模型性能接近教师,可实现零样本部署与跨国家迁移。
多轮对话式AI:从文本到多模态交互——数据、模型、评估与开放挑战
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本研究综述多轮对话式AI的发展现状,梳理其在数据、模型等方面的进展,指出多模态交互能力提升但存在记忆等短板,并提出相关研究议程。
Comments Multi-turn Conversational AI; Multimodal Dialogue; AudioLLMs; Conversational Memory; Tool-Augmented Agents; Dialogue Evaluation
LENS:基于动态原始文档的潜在证据探索的上下文内搜索
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 针对动态原始文档的上下文内搜索问题,提出无索引框架LENS,通过迭代选择候选证据并更新置信度实现预算约束下的证据定位,在多组实验中其证据召回率和答案依据表现优于基线方法。
Search-G1:基于表征内在奖励的接地搜索智能体
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究提出Search-G1框架,通过两个经干预校准的读数构成的表征内在奖励,改善了搜索增强语言智能体的接地性与搜索成本的权衡,在多基准和模型规模上验证了其有效性。
TraceSQL:无参考文本到SQL验证的可追踪答案性估计
机构 * Oracle Corporation(甲骨文公司)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。
Comments 9 pages main paper with 6 pages supplementary material
Eval4Sim: 一种用于人设模拟的评估框架
机构 * University of Sheffield(谢菲尔德大学)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 Eval4Sim提出了一种评估框架,用于衡量模拟对话与人类对话模式的契合度,通过三个互补维度评估人设的忠实性、一致性和自然性。
Comments Accepted at CIKM 2026
哪个来源更胜一筹?视觉-语言模型中依赖关系的任务依赖性
机构 * University of South Florida(南佛罗里达大学)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 该研究探究视觉-语言模型的模态依赖,通过构建算术与图表冲突基准,发现其依赖关系随任务、证据结构等变化,不同模型在对应基准中呈现相反的模态依赖模式。
Comments 20 pages. Under review
NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)
专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。
代码作为表示:学术文档的可编译解析范式
机构 * Southeast University(东南大学) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
AI总结 针对学术PDF难以被机器处理的问题,提出CADP可编译解析范式,构建CADP-Bench基准并测试SOTA MLLMs,发现前沿模型仍难生成高保真可执行重构,该基准已开放供研究。
Comments Accepted by ACM MM 2026
具身导航器:指向、思考、记忆与对齐以实现高效导航
机构 * ZJU(浙江大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本研究提出具身导航框架TAMP-Nav,通过像素转3D动作、选择性推理记忆与GRPO两级对齐,在R2R-CE数据集上实现66.2% SR,仅需90k训练轨迹,达成高效具身导航的最优性能。
如果、那么、否则:诊断视觉-语言导航中的条件分支
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Collins Aerospace(柯林斯航空航天公司)
专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 针对视觉-语言导航智能体的条件分支诊断需求,提出基于场景图的基准CondVLN及轻量级神经符号分支选择模型,可暴露智能体的逻辑决策失败并提升性能2倍。
Comments 11 pages, 1 figure, 3 tables. Project page: https://condvln.github.io/
SEE:用于长视野GUI代理轨迹合成的结构感知探索与利用
机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) ; Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
AI总结 针对GUI代理轨迹合成中缺乏高覆盖率长视野轨迹的问题,提出SEE两阶段数据合成框架,通过高效探索和基于图的合成,产生可重复可解释数据,避免虚假循环,提升代理任务成功率和泛化能力,还将发布代码和数据集。
Comments Accepted (Oral) by ACM International Conference on Multimedia 2026 (ACM MM 2026)
面向动作感知无线边缘网络的边缘原生具身智能
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 该研究提出边缘原生具身智能(ENEI)框架,整合6G技术与具身智能,通过双向循环解决具身智能部署的资源与延迟问题,经案例验证可支撑自适应具身无线系统。
多模态大语言模型中的不确定性感知决策
机构 * Khalifa University of Science and Technology(哈利法科技大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);grounding(abstract)
AI总结 本调查围绕决策中心框架,综述多模态大语言模型(MLLMs)的不确定性感知决策相关研究,对比同类调查并指出源感知分解等开放问题,核心是不确定性需改善多模态证据下的系统行为。
用于模拟仪表读数的视觉-语言模型:专业化、迁移与可靠性的实证研究
机构 * University of Central Florida(中佛罗里达大学) ; Siemens Energy(西门子能源)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 本研究通过实证评估Qwen2.5-VL-7B-Instruct模型在模拟仪表读数任务中的表现,发现其经QLoRA微调后在三类数据集上误差较低,但存在迁移性能下降和高置信度错误问题,暂不适合直接部署为工厂监控流程。
Comments Submitted to Engineering Applications of Artificial Intelligence
Know3D: 通过视觉-语言模型的知识提示3D生成
机构 * Peking University(北京大学) ; Math Magic(数学魔术) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) ; Dalian University of Technology(大连理工大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。
Comments ECCV2026 page: https://xishuxishu.github.io/Know3D.github.io/
COMIC:面向多模态大语言模型的参考感知安全门控
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.AI
AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。
学习无需学习的内容:用于鲁棒视觉-语言模型的对抗性解耦提示调优
机构 * Southern University of Science and Technology(南方科技大学) ; City University of Hong Kong(香港城市大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 针对现有对抗性提示调优存在的鲁棒泛化过拟合问题,提出ADAPT框架,通过双提示机制解耦鲁棒与伪鲁棒特征,提升模型对未见类别对抗样本的鲁棒性。
CLAIR-Fin:用于跨模态金融问答中声明级验证与自适应辩论的对抗性多智能体框架
机构 * Ahsanullah University of Science and Technology(阿萨努拉科技大学) ; Jashore University of Science and Technology(杰索尔科技大学) ; American International University - Bangladesh(孟加拉国美国国际大学)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 本研究提出CLAIR-Fin九智能体框架,针对跨模态金融问答的声明级验证与自适应辩论,在BB-FinQA-X数据集上提升了模型忠实度,且弃权比例合理,优于相关基线方法。
CompCPZ:在语言引导的机器人操作中保留多模态意图
机构 * School of Computation, Information and Technology(计算、信息与技术学院) ; Technical University of Munich(慕尼黑工业大学)
专题命中 幻觉与鲁棒性 :grounding(abstract)
AI总结 CompCPZ是一种用于语言引导机器人操作的代数层,可恢复多模态析取表示,在ManiSkill3基准测试中性能优于多种基线,且能迁移至真实机器人实验,凸显组合语言接地需评估意图连通分量结构。
使用多模态语言模型对TikTok上的有害内容暴露情况进行审计:一项跨国、按年龄分层的研究
机构 * Politecnico di Milano(米兰理工大学)
专题命中 幻觉与鲁棒性 :MLLM(abstract)
AI总结 本研究使用多模态大语言模型Gemini 2.5 Flash,在法、意、瑞三国对TikTok开展跨国年龄分层审计,发现关键词搜索会大幅提升有害内容占比,意国各年龄组有害内容占比最高,平台安全过滤器低估了明确有害内容。
Comments 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026
眼见无需耗能,言语却要代价:揭示边缘视觉语言模型推理中的真正能量瓶颈
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Jinan University(暨南大学)
专题命中 VLM训练与架构 :VLM(title,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究边缘VLM推理的能量瓶颈,通过系统能量分析发现平均推理功率恒定,输出令牌耗时多是关键,图像复杂度因输出长度影响能量,揭示视觉令牌修剪局限,控制输出长度能大幅节能。
Comments Accepted to ACM MM 2026. This version includes the appendix
DesCLIP:通过通用属性描述实现基于视觉语言模型的鲁棒持续学习
机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出DesCLIP,通过通用属性描述引导视觉语言模型理解特定类别对象,建立视觉-通用属性-类别三元关联,提升持续学习效果。
Comments IEEE Transactions on Multimedia 2026
Journal ref IEEE Transactions on Multimedia, vol. 28, pp. 5021-5035, 2026
MemCatalyst:通过数据投毒增强视觉-语言模型的数据审计
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出MemCatalyst数据投毒工具,通过文本与图像投毒策略增强视觉-语言模型的成员推断审计性能,在黑盒设置下投毒样本可跨架构迁移,仅需少量投毒样本即可提升审计效果且不影响模型性能。
VLCP:用于机器人操纵的视觉语言控制策略闭环代码重规划
机构 * University of Monastir(莫纳斯提尔大学) ; St. Mildred’s-Lightbourn School(圣米尔德雷德-莱特本学校) ; Cornell University(康奈尔大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Silverstream AI(银流人工智能公司) ; Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.LG
AI总结 VLCP是一种无需训练的机器人操纵策略,通过在单回合内每K步由VLM重写控制代码闭合循环,在57项任务的评估中综合成功率达35.1%,较开环策略提升十倍。
大语言模型后训练中基于流形覆盖与稀疏特征覆盖的分层数据选择
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 本文提出MASS算法,将LLM后训练的数据选择建模为分层覆盖问题,在Vision Flan与LLaVA-CoT上仅用少量数据即可达到或超过全量训练效果,且优于现有基线方法。
Data-DPO:面向大语言模型后训练中目标模型数据选择的直接偏好优化
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.LG
AI总结 针对现有数据选择方法忽略数据与目标模型能力分布兼容性的问题,提出Data-DPO方法,结合目标模型偏好、外部质量评分与边际多样性筛选数据,在Vision-Flan和LLaVA-CoT上性能优于基线及全数据训练。