Agentic Coding Needs Proactivity, Not Just Autonomy
代理编码需要主动性,而非仅仅自主性
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文探讨了软件开发中代理编码的主动性与自主性区别,提出主动性分类和评估标准,旨在提升编码代理的洞察力和适应性。
Comments Position Paper
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
代理编码需要主动性,而非仅仅自主性
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文探讨了软件开发中代理编码的主动性与自主性区别,提出主动性分类和评估标准,旨在提升编码代理的洞察力和适应性。
Comments Position Paper
可及性代理框架:验证门控技能协调
机构 * HKUST(GZ)(香港理工大学(广州)) ; Knowin AI ; Harbin Engineering University(哈尔滨工程大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出一种闭环运行时系统,统一异构技能并利用证据存储和成本控制,通过路由器自适应选择技能,利用验证器通过自一致性、跨尺度稳定性等验证证据充分性,从而提升可及性定位的准确性和效率。
Comments 43 pages, 22 figures, 8 tables. Ongoing work
ScrapeGraphAI-100k:用于模式约束LLM生成的数据集
机构 * Slovak University of Technology(斯洛伐克技术大学) ; ScrapeGraphAI
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出ScrapeGraphAI-100k数据集,包含93695个模式约束提取事件,通过真实用户数据和结构化标注,用于评估LLM在模式约束下的生成能力。
TEA-Bench: 一种工具增强情感支持对话代理的系统性基准测试
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出TEA-Bench,首个评估工具增强情感支持对话代理的交互式基准,通过真实情感场景和工具环境评估情感支持质量和事实性。实验表明工具增强提升情感支持质量并减少幻觉,但效果依赖模型能力。
知识图谱:代理AI形式验证中的缺失链接
机构 * 1 Infineon Technologies Dresden AG \& Co. KG, Germany 2 Infineon Technologies Semiconductor India Private Limited, India
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出基于知识图谱的验证方法,通过结构化中间表示提取规范、RTL和工具反馈,提升形式验证中规范到RTL的关联性,并通过多代理工作流生成SVAs及三种修正循环。
Comments To appear at the IEEE International Conference on IC Design and Technology 2026 (ICICDT), June 22 - 24, 2026, Dresden, Germany
LCC-LLM:利用代码导向的大语言模型进行恶意软件归因
机构 * CyberSaR, King Abdullah University of Science and Technology(CyberSaR,国王阿卜杜勒·阿齐兹大学科学与技术学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出LCC-LLM,一种代码导向的恶意软件归因和多任务静态恶意软件分析框架,通过构建包含34000个PE样本的LCCD数据集,结合静态分析与多源安全知识,提升恶意软件归因的可靠性与实用性。
文本-图协同:一种双向验证与完成框架用于RAG
机构 * School of Automation, Southeast University(自动化学院,东南大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出TGS-RAG框架,通过双向机制融合文本与图结构,解决传统RAG中信息孤岛问题,提升多跳推理性能。
Comments 12 pages, 3 figures
When2Speak: 一个多党对话中大型语言模型的时间参与和发言时机的数据集
机构 * Pratt School of Engineering(普拉特工程学院) ; Duke University(杜克大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出When2Speak数据集,通过四阶段生成流程学习群体互动中的发言时机,通过强化学习优化模型,提升多党对话中的发言准确性与自然度。
Comments Currently under review. Dataset can be found: https://huggingface.co/datasets/duke-trust-lab/When2Speak
AgenticRAG:企业知识库中的代理检索
机构 * Microsoft Corporation(微软公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 AgenticRAG通过在现有企业检索基础设施上叠加轻量级代理框架,使语言模型能够自主迭代检索信息、导航文档并分析证据,提升了检索准确率和事实性。
Comments 14 pages, 5 figures
Shape2Animal: 从自然剪影生成创意动物
机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市科学技术大学) ; Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学) ; University of Dayton, Ohio, US(Dayton 大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本文提出Shape2Animal框架,通过将自然物体剪影转化为 plausible 动物形式,展现人类对模糊刺激的感知能力。利用 vision-language 模型和扩散模型生成视觉连贯的动物图像,适用于视觉叙事、教育内容等领域。
VoxAfford:多尺度体素-标记融合用于开放词汇3D affordance检测
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家级实验室,人工智能与机器人研究所,西安交通大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出VoxAfford,通过多尺度几何特征增强输出标记,提升3D affordance检测的定位精度,实验显示mIoU提升8%,并验证了零样本迁移能力。
PACE:无监督环境设计的参数变化
机构 * College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院) ; Test Center, National University of Defense Technology(国防科技大学测试中心) ; State Key Laboratory of Digital Intelligent Modeling(数字智能建模与仿真国家重点实验室) ; Fujian Key Laboratory of Urban Intelligent Sensing(福建城市智能感知重点实验室) ; Key Laboratory of Multimedia Trusted Perception(多媒体可信感知重点实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 PACE通过政策参数变化评估环境,提升强化学习泛化能力,实验显示在MiniGrid和Craftax上优于现有无监督环境设计方法。
探索临床因素在零样本分割VLMs中的提示对齐用于NSCLC肿瘤分割
机构 * Artificial Intelligence in Medicine Program, Mass General Brigham, Harvard Medical School, USA(麻省总医院布里奇沃特医学中心人工智能医学项目,哈佛医学院,美国)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 研究通过分析VoxTell在NSCLC肿瘤数据集上的提示对齐方向,发现解剖位置主导空间注意力,零样本分割VLMs在NSCLC肿瘤分割中表现优于其他模型。
动态语义地图中基于零样本信号时间逻辑的规划与离散分支选择
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Key Laboratory of System Control and Information Processing, the Ministry of Education of China(中国教育部系统控制与信息处理重点实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出一种零样本STL规划求解器,通过映射条件Transformer与轻量启发式结合,有效处理复杂离散子公式,利用传递强化学习确保时间一致性和逻辑连贯性,实验证明其在动态语义地图中具有优越的零样本泛化能力。
超越'差异':应对代理软件开发中的代理熵
机构 * Dipartimento Tecnologie Innovative, SUPSI(技术创新部,SUPSI) ; Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI) ; Management in Networked and Digital Societies (MINDS) Department, Kozminski University(网络化与数字化社会管理(MINDS)系,科津斯基大学) ; Institute of Biomedical Ethics and History of Medicine, University of Zurich(生物医学伦理与医学史研究所,苏黎世大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出一种过程导向的可解释框架,通过时间、工具调用和架构边界揭示代理决策过程,解决代理行为与架构意图的偏离问题,为代理监控提供意图层面的 telemetry。
Comments Camera-ready version of the position paper accepted to the Human-Centered Explainable AI (HCXAI) Workshop at CHI 2026
AI 房地产经纪人:迈向基于现实的说服性语言生成以实现自动化文案写作
机构 * Schmidt Sciences(施密特科学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种基于大语言模型的代理框架,用于房地产营销中的自动化文案写作中的基于现实的说服性语言生成。通过系统的人类受试者实验,证明了该方法在保持事实准确性的同时,生成的营销描述更受潜在购房者青睐。
FreeOcc: 无需训练的具身开放词汇占用预测
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; MBZUAI
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 FreeOcc通过四层流程实现无需3D标注的开放词汇占用预测,相比传统方法在EmbodiedOcc-ScanNet上提升IoU和mIoU超过2倍,并引入ReplicaOcc基准测试新环境性能。
Comments RSS 2026
AgentEconomist:一个端到端的代理系统,将经济直觉转化为可执行的计算实验
机构 * Zhongguancun Academy(中关村学院) ; University of Science and Technology of China(中国科学技术大学) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 AgentEconomist通过模块化多阶段架构,将经济直觉转化为可执行的计算实验,通过文献基础假设生成、实验设计和执行阶段,结合人类与AI协作,提升研究创新性与文献相关性。
通过双流Transformer实现双摄像头设置中互视与联合注意的自动检测
机构 * AGH University(AGH大学) ; Jagiellonian University(雅盖隆大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出双流Transformer架构,用于从同步双摄像头记录中自动检测互视与联合注意,通过冻结的注视感知骨干网络和自定义令牌融合机制,有效提升了多摄像头实验室环境下的检测性能。
SkillForge: 在云技术支持中锻造领域特定的自我进化代理技能
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 SkillForge通过闭环创建-评估-改进机制,解决云技术支持中领域特定技能缺乏和持续优化的问题,实验表明其能显著提升技能质量。
Comments Accepted at ACM SIGIR 2026 Industry Track. 18 pages, 5 figures, 3 tables
DenseStep2M: 一种可扩展且无需训练的密集指令视频标注流水线
机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出无需训练的DenseStep2M流水线,通过分割视频、过滤对齐不佳内容并利用先进多模态模型生成高质量步骤注释,构建了包含10万视频和200万步骤的大型数据集,支持长期视频理解。
RADIO-ViPE:面向动态环境的在线紧密耦合多模态融合用于开放词汇语义SLAM
机构 * Biomechatronics and Energy-Efficient Robotics (BE2R) Lab, ITMO University(生物机电学与高效能机器人实验室,ITMO大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 RADIO-ViPE通过在线多模态融合实现动态环境中开放词汇语义SLAM,无需校准RGB-D输入,结合视觉与语言嵌入提升地图一致性。
告诉模型该看哪里:通过视觉引导注意力缓解大语言模型的幻觉
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; Zhongguancun Academy(中关村学院) ; Southeast Academy of Information Technology, Beijing Institute of Technology(北京理工大学信息科技东南学院) ; Zhongguancun Laboratory(中关村实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出视觉引导注意力(VGA),通过构建精确的视觉基础并引导模型关注相关区域,缓解大语言模型在视觉任务中的幻觉问题,且无需额外训练。
Comments CVPR 2026
通过技能图实现可扩展的终端任务合成
机构 * Hunyuan Team, Tencent(文生图团队,腾讯)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出SkillSynth框架,通过场景介导的技能图生成多样化终端任务,提升训练效率和任务多样性。
风景视频中主观人像区域裁剪与时间标注平滑
机构 * IEEE(国际电气电子工程师学会)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出通过时间标注平滑技术实现风景视频中人像区域的有效裁剪,构建了LIVE-YT VC数据库,并展示了其在视频裁剪和视频定位模型中的应用。
Comments Under Review in IEEE Transactions on Image Processing. The code, models and dataset will be available at: https://github.com/steven413d/LIVE-YT-VideoCropping
CRAFT:在部分信息下的 grounded 多智能体协调
机构 * Department of Computer Science, Colorado State University(计算机科学系,科罗拉多州立大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 CRAFT 是评估大语言模型在严格部分信息下实用沟通能力的多智能体基准,通过自然语言构建共享3D结构。研究发现更强推理能力不必然带来更好协调,小模型常表现更优,表明多智能体协调仍是当前语言模型的挑战。
Comments Added revisions, corrected typos and additional analysis
RbtAct: 用于生成可操作性评审反馈的反驳作为监督
机构 * Yale University(耶鲁大学) ; New York University(纽约大学) ; TCS Research(TCS研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出RbtAct,通过利用反驳作为隐式监督,优化反馈生成器以提高可操作性。引入了视角条件段级评审反馈生成任务,并构建了RMR-75K数据集,实验表明在可操作性和具体性上优于基线模型。
Comments ACL 2026 Findings
基于大语言模型的代码生成中的缺陷任务描述:检测与分析
机构 * University of Luxembourg(卢森堡大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出SpecValidator,通过轻量级模型检测任务描述缺陷,结果显示其在检测准确性与鲁棒性上优于其他模型,揭示了任务描述结构对LLM性能的影响。
Kerimov-Alekberli模型:一个信息几何框架用于实时系统稳定性
机构 * Institute of Defense Technologies and Cybersecurity(国防技术与网络安全研究所) ; Azerbaijan Technical University(阿塞拜疆技术大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出Kerimov-Alekberli模型,通过将非平衡热力学与随机控制相结合,构建了一个信息几何框架,用于实时系统稳定性的研究。
ComplianceNLP:基于知识图谱的多框架监管缺口检测RAG系统
机构 * The University of Hong Kong(香港大学) ; Stellaris AI Limited(Stellaris AI有限公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 ComplianceNLP通过整合知识图谱增强的RAG系统,实现监管变化自动监控、义务提取及合规缺口识别,其在监管缺口检测上达到87.7 F1,优于GPT-4o+RAG,且在实际部署中显著提升分析师效率。
Comments Accepted at ACL 2026 Industry Track. 19 pages, 15 tables, 1 figure