arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2607.17112 2026-07-21 cs.CE 新提交 67%

Learning Dispute Structure for Settlement Prediction in Financial ADR: A Multi-Task and Cross-Institutional Approach

学习金融 ADR 中和解预测的争议结构:一种多任务和跨机构方法

Koutarou Tamura

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对金融 ADR 案例,提出统一数据集和建模框架,引入功能标记方案表示争议结构,构建多任务模型联合进行争议分类与和解预测,实验显示该方法能提升预测性能,发现争议结构在 ADR 领域部分共享。

Comments 4th International Conference on Computational and Data Sciences in Economics and Finance (CDEF 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16742 2026-07-21 cs.CV 新提交 67%

Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model

人工智能生成的以人为中心的视频的多维质量评估:数据集与模型

Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院) Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对AI生成的以人为中心的视频质量评估问题,提出扩展数据集HVEval+并构建MoE-Rater模型,该模型采用专家混合及三阶段训练策略,能统一多种任务,在相关数据集上性能优越,推动了视频质量评估及T2V模型优化。

Comments Accepted for publication in IEEE TCSVT, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16193 2026-07-20 cs.CV 新提交 67%

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

认识自我,理解世界:用于基于多模态大语言模型的无人机时空推理的双认知基准测试

Like Liu, Zhengzheng Xu, Haitao He, Hongzhe Li, Shuchang Zhang, Dian Shao

机构 * Northwestern Polytechnical University(西北工业大学) China University of Petroleum(中国石油大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对多模态大语言模型在无人机场景双认知能力评估不足的问题,提出UAV-DualCog基准测试,涵盖图像和视频任务,通过自动化管道构建数据,评估发现现有模型存在瓶颈,该基准测试有价值。

Comments 11 pages, 4 figures, 7 tables. Project website: https://uav-dualcog.lozumi.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15752 2026-07-20 cs.CV 新提交 67%

Personalized Image Aesthetic Assessment via Preference-rich Sample Mining and Cohort Merging

通过偏好丰富样本挖掘和群组合并进行个性化图像美学评估

Zhichao Yang, Tianjiao Gu, Zhixianhe Zhang, Xiangfei Sheng, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究个性化图像美学评估问题,提出基于多模态大语言模型的PRAC方法,通过偏好丰富样本挖掘和美学共鸣群组合并建模个体美学偏好,经实验验证该方法优于现有技术。

Comments The paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15615 2026-07-20 cs.CV 新提交 67%

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习

Zhengbo Zhou, Jiren Li, Dooman Arefan, Margarita Zuley, Shandong Wu

专题命中 评测与基准 :language model(abstract);pretraining(abstract)

AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14754 2026-07-17 cs.CR 新提交 67%

FlowGuard: From Signals to Evidence for MCP Security Detection

FlowGuard:从信号到MCP安全检测的证据

Baichao An, Pei Chen, Geng Hong, Yueyue Chen, Mengying Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究针对现有MCP安全扫描器不足,提出FlowGuard系统,结合语义风险分类等方法,通过运行时证据验证执行风险、检测语义风险,在基准测试和实际评估中取得良好效果,能有效评估MCP交互中的多种风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交 67%

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14479 2026-07-17 cs.CY 新提交 67%

BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation

BioTIER:用于针对性生物风险缓解的拒绝基准

Eleanor M. Marshall, Pedro Medeiros, Peter Peneder, Nelly Mak, Jacob Kaffey, Faith Rovenolt, Mac Walker, Seth Donoughe, Jasper Götting

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型生物滥用问题,引入BioTIER基准,将生物内容分三个风险集,含542个专家策划提示及元数据,可隔离控制灾难性风险信息,确保生物科学知识获取,助力针对性生物风险缓解。

Comments 52 pages, 9 main figures, 9 supplementary figures, 1 main table, 9 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 67%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13179 2026-07-16 cs.HC cs.SE 新提交 67%

SoftBoard: A Multi-Agent Tool for the Creation and Evaluation of Low-Fidelity Prototypes

SoftBoard:用于创建和评估低保真原型的多智能体工具

Gabriel R. S. Scapim, Gislaine C. L. Leal, Guilherme C. Guerino

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对软件初创公司环境下数字产品用户体验问题,介绍SoftBoard工具,它集成原型编辑器、团队项目组织和基于大语言模型的多智能体系统,可支持需求获取、自动生成原型及评估界面质量,助力构建符合用户需求的MVP。

Comments Paper accepted for publication at CBSoft 2026 (SBES-Tools)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13104 2026-07-16 cs.AI cs.CL cs.LG 新提交 67%

Self-Improvements in Modern Agentic Systems: A Survey

现代智能系统中的自我改进:一项综述

Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R. B. Xiong, Qingfeng Lan, Wenyi Wang, Li Nanbo, Yibo Yang, Mingchen Zhuge, Jürgen Schmidhuber

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Alberta(阿尔伯塔大学) The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 综述现代自我改进智能体从研究走向部署,目标是经验驱动的可控进化。提出系统级框架,将智能体视为基础模型与操作支架的耦合配置,自我改进形式化为更新算子,还组织回顾了相关工作、应用、评估等内容并展望未来。

Comments 97 pages, 12 figures. Project page: https://selfimproving-agent.github.io/ Repository: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12911 2026-07-15 cs.CV 新提交 67%

Open-KNEAD: Knowledge-grounded Nutrition Estimation via Agentic Decomposition

Open-KNEAD:通过智能分解实现基于知识的营养估计

Bruce Coburn, Jingbo Yue, Jinge Ma, Siddeshwar Raghavan, Gautham Vinod, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究探讨多模态大语言模型用于膳食评估时检索增强基础方法是否仍有价值。提出无需训练、可本地部署的Open-KNEAD框架,通过营养感知检索关联食物项与FNDDS代码,提高份量估计,还能恢复非美国烹饪风格估计偏差,优势显著并开源相关框架与知识库。

Comments 10 pages main paper, 5 pages supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12541 2026-07-15 cs.SE 新提交 67%

Taming the Drift: Context-aware Repair of Dockerfile Drift during Software Evolution

驯服漂移:软件演化过程中Dockerfile漂移的上下文感知修复

Chengjie Wang, Jingzheng Wu, Xiang Ling, Tianyue Luo, Chen Zhao

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究针对软件演化中Dockerfile漂移致CI/CD构建失败的问题,提出上下文感知框架Cadre,通过构建CDG并结合两步工作流程来修复,在$D^3$基准上修复率高,相比基线优势明显,还避免提示溢出故障,提升了上下文感知基础设施即代码维护能力。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12497 2026-07-15 cs.CV 新提交 67%

TerraLogic: A Benchmark for Hierarchical Geospatial Reasoning in Earth Observation

TerraLogic:地球观测中分层地理空间推理的基准

Yuhang Yan, Linchao Mou, Bokang Yang, Qingyu Li

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。

Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10790 2026-07-14 eess.AS 新提交 67%

Data Augmentation for L2 English Speaking Assessment using TTS

使用文本转语音技术进行第二语言英语口语评估的数据增强

Stefano Bannò, Penny Karanasou, Mengjie Qian, Kate M. Knill, Mark J. F. Gales

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对第二语言英语口语评估数据稀缺问题,利用文本转语音技术,通过分析说话者-文本关系,提出先将书面回答语音化,再转为语音,并研究配对策略的数据增强框架,经评估可提升评分性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11044 2026-07-14 cs.MM 新提交 67%

RetroHolmes: When Semantic Plausibility Fails Retrospective Physical Process Reasoning

RetroHolmes:当语义合理性失效时的回顾性物理过程推理

Ruoxuan Zhang, Qiyun Zheng, Siyu Wu, Ling Zou, Hongxia Xie, Zhiyu Zhou, Jian-Yu Jiang-Lin, Zihan Li, Zhengguang Wang, Bin Wen, Ling Lo, Jianlong Fu, Meibao Yao, Juncheng Hu, Wen-Huang Cheng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对视觉语言模型物理推理评估不足问题,引入回顾性物理过程推理范式,提出RetroHolmes基准,通过它分析模型,发现失败模式,还展示综合分析实例,验证其诊断价值,凸显物理基础中间表示对物理推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08152 2026-07-10 cs.CL cs.AI cs.HC cs.LG 新提交 67%

LEXIC: Lightweight Eye-tracking eXtension via Injected Complexity

LEXIC:通过注入复杂度实现轻量级眼动追踪扩展

Sumin Lee, Kyeonghun Kim, Subeen Lee, Jiwon Yang, Tien Nguyen, Ken Ying-Kai Liao, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) NVIDIA(英伟达)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究从眼动预测阅读理解中仅注视模型的提升,基于LEXIC-Base提出两种机制注入难度信号,在一站式阅读理解任务中实验,两种机制使未见文本AUROC增益,LEXIC-Concat提升未见读者表现,LEXIC-Res存在架构边界问题。

Comments Accepted to APCCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07907 2026-07-10 cs.LG cs.AI cs.CL cs.CR cs.MM 新提交 67%

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准的综述

Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 综述跨视觉、语言、音频和视频的多模态遗忘,基于相关进展等提供统一视角,通过分类法系统比较模型架构和模态,阐明权衡,强调开放问题与实际考虑,支持未来研究与部署,并发布存储库。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06149 2026-07-09 cs.HC 新提交 67%

BlossomPsy: A User-Centric AI System for Adaptive and Engaging MBTI Personality Assessments

BlossomPsy:一个用于自适应且引人入胜的MBTI人格评估的以用户为中心的人工智能系统

Bingjia Huang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有MBTI评估工具的不足,BlossomPsy引入多轮对话与基于照片的问题,结合深度学习等算法,动态适应并提升用户参与度,实验证明其预测稳定,用户满意度高,在保持一致性的同时改进了MBTI评估。

Comments 23 pages,20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05994 2026-07-08 cs.CV 新提交 67%

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

SparseCtrl-HOI:用于人机交互视频生成的稀疏时间控制

Shenbo Xie, Mingrui Cai, Xu Yang, Yifei Liu, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对人机交互视频生成中建模物理动力学及时空协调复杂、现有方法依赖密集指导成本高且影响多样性的问题,提出SparseCtrl-HOI框架,用关键帧结合新机制和模块控制,构建数据集,降低标注开销,提升直播电商视频质量。

Comments ECCV 2026, Project Page: https://mpi-lab.github.io/SparseCtrl-HOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04331 2026-07-07 cs.RO cs.CV 新提交 67%

Agent-driven Long-tail Simulation for Autonomous Driving

用于自动驾驶的智能体驱动长尾模拟

Junru Gu, Lijin Yang, Jianing Huang, Shu Liu, Zhongzhan Huang, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) Bosch Research(博世研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04255 2026-07-07 eess.SY cs.SY 新提交 67%

Towards Effcient Low Altitude Sensing: A Dual Heterogeneous Graph Learning Method for UAV Task Allocation

迈向高效低空传感:一种用于无人机任务分配的双异构图学习方法

Guangyu Lei, Tianhao Liang, Bingyan Xie, Tingting Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对传统无人机任务分配方法难捕捉任务依赖与通信关系的问题,提出基于双异构图学习的方法,构建任务图与通信图,将分配问题转为结构匹配问题,用图注意力网络和交叉注意力机制优化匹配,提升任务完成率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03751 2026-07-07 cs.RO 新提交 67%

Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

三思而后行:将树搜索提炼为冻结视觉语言动作模型的动作评估

Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang

机构 * Nanjing University(南京大学) Australian National University(澳大利亚国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nvidia(英伟达)

专题命中 评测与基准 :pretraining(abstract);post-training(abstract)

AI总结 研究发现视觉语言动作(VLA)模型泛化能力差的关键瓶颈在于动作评估。提出SVA框架,通过蒙特卡洛树搜索探索输出分布,将知识提炼到轻量级Q值模型,提升任务成功率,且保持泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02908 2026-07-07 cs.CV 新提交 67%

Holo-Captioning: Toward the Text Equivalent of 3D Scenes

全息字幕:迈向3D场景的文本等效物

Kun-Yu Lin, Chengke Bu, Zhenguo Li, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Frontier Robotics(前沿机器人)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究提出全息字幕任务,先将其定义为生成结构化文本描述,开发字幕引擎及大规模基准,在此基础上提出HoloScribe模型,还给出评估指标和测试集,该模型性能超现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02674 2026-07-07 cs.CV 新提交 67%

EmoteGPT: 3D Human Facial Expressions from Natural Language Descriptions

EmoteGPT:从自然语言描述生成3D人类面部表情

Haoran Wang, Mohit Mendiratta, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息学园区) CISPA Helmholtz Center for Information Security(亥姆霍兹信息安全中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究如何从文本精确控制3D面部表情,将其转化为3D可变形模型解缠参数空间中的回归问题。引入Txt2Emote数据集,提出EmoteGPT框架,经大规模数据增强训练,在表情识别等方面超越现有方法。

Comments Project page: https://genintel.github.io/EmoteGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02294 2026-07-03 cs.SE 新提交 67%

Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions

编码代理在猜测:测量欠指定DevOps指令中的动作边界违规

Zimo Ji, Zekai Zhang, Congying Xu, Zongjie Li, Yudong Gao, Shuai Wang, Shing-Chi Cheung

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出UnderSpecBench基准,通过69个任务族和2208个提示变体,评估编码代理在欠指定DevOps指令下的动作边界违规,发现55.8-67.8%的运行至少违反一个边界,表明完成度评估高估了安全自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02083 2026-07-03 cs.CV 新提交 67%

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

DeepGaze3.5-VL: 通过自回归标记预测建模扫描路径

Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

机构 * IMPRS-IS

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 将扫描路径预测建模为离散序列任务,利用视觉语言模型的预训练表示,通过简单提示实现个性化偏置和任务特定目标,在MIT1003上信息增益达2.18比特,比DeepGaze III提升46%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01667 2026-07-03 cs.CV 新提交 67%

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

增强视听视频字幕的时间与跨模态对齐

Chen Zhao, Jiajun Ma, Qilong Huang, Tiehan Fan, Hongyu Li, Zhuoliang Kang, Xiaoming Wei, Jian Yang, Ying Tai

机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01597 2026-07-03 cs.SE 新提交 67%

A Single Patch Is Not Enough: Deterministic Fusion of Repair Candidates

单个补丁不够:修复候选的确定性融合

Boyang Yang, Xiangliang Hu, Luyao Ren, Yanjun Chen, Bach Le, Tegawendé F. Bissyandé, Haoye Tian

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对代码修复中候选补丁池的“pass@k到pass@1”差距,提出PatchFusion方法,通过确定性原子证据融合选择并构造最终补丁,无需测试结果,在三个基准上优于现有选择器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01460 2026-07-03 cs.CY cs.SI 新提交 67%

Social-Annotate: Self-Healing Browser Extension to Annotate and Collect Social Media Data

Social-Annotate: 用于标注和收集社交媒体数据的自愈浏览器扩展

Ali Najafi, Ismail Uluturk, Onur Varol

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出Social-Annotate浏览器扩展,通过注入可定制表单实现在线平台直接数据收集,并集成大语言模型驱动的自愈代理以应对界面变化,支持12个平台,降低数据收集和维护成本。

Comments 13 pages, 3 figures, 1 SI-table, 2 SI-figures

详情

展开后加载摘要…

URL PDF HTML 收藏