Byam: Fixing Breaking Dependency Updates with Large Language Models
Byam:利用大型语言模型修复破坏性依赖更新
专题命中 推理评测 :reasoning(abstract)
AI总结 本文利用大型语言模型自动修复因依赖更新导致的客户端代码问题,通过BUMP数据集验证,o3-mini模型在修复构建和编译错误方面表现最佳。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
Byam:利用大型语言模型修复破坏性依赖更新
专题命中 推理评测 :reasoning(abstract)
AI总结 本文利用大型语言模型自动修复因依赖更新导致的客户端代码问题,通过BUMP数据集验证,o3-mini模型在修复构建和编译错误方面表现最佳。
一个用于指令驱动电影视频编译的基准和多智能体系统
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频事业部AI技术中心) ; Tsinghua University(清华大学) ; Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) ; State Key Lab of Multimedia Info. Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; Nat’l Eng. Research Ctr. of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)
专题命中 推理评测 :planning(abstract)
AI总结 本文提出CineBench基准和CineAgents系统,解决电影视频编译中的上下文崩溃和时间碎片化问题,通过脚本逆向工程和迭代叙事规划生成更连贯的编译结果。
在增强现实中评估视觉-语言模型在矛盾虚拟内容攻击下的基准测试
机构 * Duke University(杜克大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出ContrAR基准,评估视觉-语言模型在增强现实中的鲁棒性,通过312个真实AR视频验证,测试11种VLMs,发现现有模型在检测对抗性内容操纵方面仍有改进空间。
Comments CVPR 2026 Findings
为VLMs计数仍是一项苦差事
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文通过行为和机制分析研究VLMs的计数行为,提出COUNTINGTRICKS评估套件,揭示模型在不同布局和对抗提示下的漏洞,并验证Modality Attention Share方法能缓解计数失败问题。
Jamendo-MT-QA:多轨比较音乐问答基准测试
机构 * Yonsei University(延世大学) ; KRAFTON ; University of Oxford(牛津大学) ; George Mason University(乔治梅森大学) ; Sungkyul University(圣洁大学) ; MODULABS MAAP ; Onoma AI
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Jamendo-MT-QA基准测试,用于评估多轨比较音乐问答能力,基于Jamendo-QA数据集构建36519个比较问答项,采用LLM辅助生成和过滤问题,并通过自动指标和LLM-as-a-Judge评估模型性能。
Comments ACL 2026 Findings
流式视频指令微调
机构 * Hong Kong Baptist University(香港浸会大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。
Comments Accepted by CVPR2026
GeoMMBench 和 GeoMMAgent:迈向地质科学和遥感领域的专家级多模态智能
机构 * RIKEN AIP(日本理化学研究所革新智能研究中心) ; Wuhan University(武汉大学) ; Linköping University(林雪平大学) ; University of Tokyo(东京大学) ; Nanjing University of Information Science and Technology(南京信息工程大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出 GeoMMBench 和 GeoMMAgent,通过综合多模态问答基准和多智能体框架,解决地质科学和遥感领域知识广、传感器异构、任务碎片化等挑战,提升专家级空间解释能力。
Comments CVPR 2026 Highlight paper
面向综合自动化路面状况评估的视觉-语言基础模型
机构 * North Dakota State University(北达科他州立大学) ; University of Memphis(孟菲斯大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出PaveInstruct数据集和PaveGPT模型,通过领域特定指令微调提升视觉-语言模型在路面状况评估中的性能,实现20%以上的提升,并满足ASTM D6433标准。
GALA: 多模态图对齐用于自动化程序修复中的缺陷定位
专题命中 推理评测 :reasoning(abstract)
AI总结 GALA通过多模态图对齐方法,解决GUI截图场景下自动化程序修复的缺陷定位问题,通过结构化推理提升视觉与代码的映射精度。
Comments Code available at: https://github.com/lzyyyyy666/GALA
大语言模型能否解码二进制代码?对大型语言模型在伪代码解码中的系统分析
专题命中 推理评测 :reasoning(abstract)
AI总结 本文系统评估了大语言模型在二进制解码中的有效性,提出BinDeObfBench基准测试,发现解码性能更依赖推理能力和领域知识,任务特定的监督微调优于广泛领域预训练。
基于传感器的人类活动识别的基石模型:一种综述与展望
专题命中 推理评测 :reasoning(abstract)
AI总结 本文综述了基于传感器的人类活动识别中的基石模型,分析了九种技术轴上的设计模式与权衡,并探讨了数据整理、多模态对齐、个性化、隐私和负责任部署等开放挑战。
ProCap:面向空间增强现实的投影感知描述生成
机构 * Southwest University(西南大学) ; Westlake University(西湖大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 ProCap通过分离物理场景与投影内容,解决空间增强现实中的语义歧义问题,提出RGBP数据集和双描述评估协议,提升SAR的智能交互能力。
Comments 16 pages, 7 figures
LLMs是否准备好用于计算机科学教育?通过专业认证考试进行跨领域、跨语言和认知层面的评估
专题命中 推理评测 :reasoning(abstract)
AI总结 本文通过专业认证考试数据评估了四个LLM在跨语言、认知层次和领域知识上的表现,发现GPT-5在英文考试中表现最佳,Qwen-Plus在中文环境中更优,DeepSeek-R1在跨语言表现最平衡,但Llama-3.3在高阶推理和鲁棒性上存在明显不足。
Comments 40 pages including Appendix
EditFlow:通过开发者流程重建实现代码编辑推荐系统的基准测试与优化
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出EditFlow,通过重建开发者编辑流程,解决代码编辑推荐系统在数据收集、基准测试和统一优化中的关键挑战,提升开发者生产力。
Comments This paper has been accepted to the Proceedings of the ACM on Programming Languages (OOPSLA 2026). (Proc. ACM Program. Lang., Vol. 10, OOPSLA1)
MedGRPO:异构医学视频理解的多任务强化学习
机构 * Northeastern University(东北大学) ; United Imaging Intelligence(联影智能)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出MedGRPO框架,通过跨数据集奖励归一化和医学LLM评判器提升医学视频理解的训练效果,建立基础基准和训练方法。
Comments Accepted at CVPR 2026
利用图像编辑基础模型实现数据高效的CT金属伪影减少
机构 * Codeway AI Research(Codeway AI 研究院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出利用视觉语言扩散基础模型进行金属伪影减少,通过参数高效低秩适应技术,仅需16-128对训练样本即可实现高效伪影抑制,并证明领域适应对减少幻觉至关重要。
Comments Accepted to CVPRW 2026 Med-Reasoner
AICA-Bench:全面评估VLMs在情感图像内容分析中的能力
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出AICA-Bench基准,通过情感理解、推理和生成三个任务评估VLMs在情感图像分析中的能力,发现其在强度校准和描述深度方面存在不足,并提出GAT提示方法提升性能。
Comments Accepted by Findings of ACL 2026
GLANCE:一种用于音乐引导非线性视频编辑的全局-局部协调多智能体框架
机构 * Fudan University(复旦大学) ; Stanford University(斯坦福大学) ; University of Rochester(罗切斯特大学) ; Meta AI
专题命中 推理评测 :planning(abstract)
AI总结 GLANCE提出一种全局-局部协调多智能体框架,通过双环架构实现视频编辑任务的长期规划与分段处理,引入新的协调机制和评估框架,实验表明其在视频生成质量上优于现有方法。
Comments 14 pages, 4 figures, under review
重新思考模型效率:基于大模型的多智能体推断
专题命中 推理评测 :reasoning(abstract)
AI总结 本文通过分析不同视觉-语言模型的延迟,发现大模型通过减少输出token数量可提升效率,并提出多智能体推断框架以复用小模型的推理token,从而接近大模型性能。
通过编译器-LLM协作实现代理代码优化
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出编译器-LLM协作方法,结合传统编译优化与LLM生成,提升代码性能,实验显示比现有方法快1.25倍。
ComPass:基于对比学习的程序修复中自动补丁正确性评估
专题命中 推理评测 :reasoning(abstract)
AI总结 ComPass利用对比学习和数据增强解决程序修复中补丁过拟合问题,通过代码转换规则生成语义保持的代码片段,提升补丁正确性评估的准确性。
Comments 31 pages, 3 figures
DebugHarness: 模拟人类动态调试以实现自主程序修复
专题命中 推理评测 :reasoning(abstract)
AI总结 DebugHarness通过模拟人类动态调试过程,利用LLM实现复杂漏洞的自动修复,其动态调试方法在SEC-bench数据集上实现了90%的修复率,比现有方法提升30%以上。
Comments 15 pages, 6 figures
MSAO:基于边缘-云协作的自适应模态稀疏性感知卸载框架用于高效多模态大语言模型推理
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出MSAO框架,通过边缘-云协作和模态稀疏性分析,降低多模态大语言模型推理的延迟和资源消耗,提升吞吐量。
Comments 10 pages, 9 figures
PolyReal:一个用于现实世界聚合物科学工作流程的基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Northwestern Polytechnical University(西北工业大学) ; Tongji University(同济大学) ; The University of Hong Kong(香港大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。
SelRoute:基于查询类型的长期对话记忆检索路由
专题命中 推理评测 :reasoning(abstract)
AI总结 SelRoute通过根据查询类型选择专用检索管道提升长期对话记忆检索效果,实验显示其在多个基准测试中表现优异,但存在推理密集型检索任务的失败模式。
Comments 12 pages, 12 tables, 3 appendices
Vibe Coding XR: 通过XR Blocks和Gemini加速AI+XR原型设计
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出XR Blocks框架和Vibe Coding XR工作流,利用LLM将高阶提示转化为功能混合现实应用,通过模拟现实环境减少设备测试摩擦,提供60个原型数据集和自动化评估流程。
HERBench:视频问答中多证据整合的基准
机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本-古里安大学 INSIGHT 实验室) ; Ben-Gurion University of the Negev(本-古里安大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 HERBench通过要求至少三个非重叠视频片段线索,推动视频问答中多证据整合的研究,评估13种最新视频大语言模型,发现其准确率仅31-42%,揭示检索与融合两大瓶颈。
Comments Accepted to CVPR 2026
AI辅助的硬件安全验证:综述与AI加速器案例研究
专题命中 推理评测 :reasoning(abstract)
AI总结 本文综述了AI辅助硬件安全验证的最新进展,通过NVDLA案例研究展示AI在自动化验证流程中的应用,强调AI输出需基于仿真证据和形式验证确保可信安全。
Comments This paper will be presented at IEEE VLSI Test Symposium (VTS) 2026
VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限
机构 * PKU(北京大学) ; WHU(武汉大学) ; CASIA(中国科学院自动化研究所) ; BJTU(北京交通大学) ; CUHK(香港中文大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。
大语言模型中的误解获取动态
专题命中 推理评测 :reasoning(abstract)
AI总结 研究大语言模型在模拟学生和导师时的误解获取动态,发现学生模型易泛化误解导致解题准确性下降,而导师模型能联合学习多个误解且保持正确性,关键在于推理步骤的监督。