arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2607.00551 2026-07-03 econ.GN q-fin.EC 新提交 67%

Talking Politics with Artificial Intelligence

与人工智能谈论政治

Ziwen Zu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 基于430万条人机对话数据,发现政治内容占3.9%,用户主要寻求信息而非表达观点;2024年美国大选结果公布后,美国用户的情感表达和意识形态极端性增加,表明AI对话是政治中介而非公共广场。

Comments 58 pages, 15 figures, 21 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22645 2026-07-03 cs.IR cs.CY 新提交 67%

All Relations Lead to Rome: Automated Knowledge Graph Creation and Question Generation

所有关系通向罗马:自动化知识图谱构建与问题生成

Matthijs Jansen op de Haar, Tobias Stähle, Lorenzo Gatti

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出ARLtR框架,联合构建知识图谱、嵌入和基于事实的问答对,实现符号图与稠密检索的统一表示,并以罗马帝国历史数据集验证。

Comments 10 pages, 5 figures, version one

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01063 2026-07-02 cs.SE 新提交 67%

AutoRestTest at the SBFT 2026 Tool Competition

AutoRestTest 在 SBFT 2026 工具竞赛中

Tyler Stennett, Myeongsoo Kim, Saurabh Sinha, Alessandro Orso

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出结合语义属性依赖图、多智能体强化学习和大型语言模型的AutoRestTest方法,在SBFT 2026 REST联赛中11个API上三项评估均获第一。

Comments 2 pages, 1 figure. Published in the 19th Search-Based and Fuzz Testing Workshop (SBFT '26), co-located with ICSE 2026

Journal ref Proceedings of the 19th Search-Based and Fuzz Testing Workshop (SBFT '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00816 2026-07-02 cs.CV 新提交 67%

Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

通过层次化实体探索实现高分辨率视觉感知

Ziyu Ma, Shidong Yang, Yuxiang Ji, Yiming Hu, Tongwen Huang, Yong Wang, Jianfei Cai, Xiangxiang Chu

机构 * AMAP, Alibaba Group, China(阿里巴巴集团高德地图,中国) Monash University, Australia(莫纳什大学,澳大利亚)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出无训练、模型无关的层次化实体探索框架HEE,通过动态查询引导、双评分机制和置信度回溯,解决高分辨率图像中细粒度细节丢失问题,在多个基准上超越现有方法。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00711 2026-07-02 cs.SE 新提交 67%

ClarifyCodeBench: Evaluating LLMs on Clarifying Ambiguous Requirements for Code Generation

ClarifyCodeBench: 评估大语言模型在代码生成中澄清模糊需求的能力

Zheng Fang, Dongming Jin, Yihong dong, Yongmin Li, Kechi Zhang, Zhi Jin, Ge Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出ClarifyCodeBench基准,通过人工标注的模糊需求、澄清问题和指标,评估LLMs主动澄清需求的能力,发现代码生成能力与需求澄清能力脱钩,且多模糊场景下性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00606 2026-07-02 cs.CV 新提交 67%

Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap

检索图像作为视觉思维:面向开放与封闭差距的无训练多模态上下文学习

Bingchen Huang, Zhiling Wang, Yifu Chen, Yuanchao Du

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出无训练框架ReVisIT,通过检索图像-标签对作为视觉思维单元,结合结构化类定义、多模态检索和交替注入示例,在多个基准上显著提升性能,弥合开放与封闭任务差距。

Comments 12 pages, 6 figures. Includes appendix. Introduces the MAAC-Bench benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00125 2026-07-02 cs.CV 新提交 67%

Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners

分解、比较与决策:多模态大语言模型是隐式少样本学习者

Yunhan Wang, Eshika Khandelwal, Edson Araujo, Walid Bousselham, Nina Shvetsova, Hilde Kuehne

机构 * Tuebingen AI Center, University of Tuebingen(图宾根大学图宾根人工智能中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出DeCoDe方法,通过将少样本分类分解为成对图像比较,利用现有多模态大语言模型(MLLM)的logit作为相似度分数,无需额外训练即可实现强少样本分类,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31706 2026-07-01 cs.SE 新提交 67%

AdaTrans: Automated C to Rust Transformation via Error-Adaptive Repair

AdaTrans: 通过错误自适应修复实现C到Rust的自动转换

Xiaofan Liu, Zecan Li, Zhuang Zhao, Ziqi Shuai, Yanming Yang, Qi Xin, Jifeng Xuan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出AdaTrans框架,通过策略驱动检索增强生成、错误分层转换策略和多阶段验证流水线,解决C到Rust自动转换中所有权和借用语义违反问题,在104个算法问题上实现95.51%编译通过率和81.09%解决率,不安全文件率仅1.19%。

Comments 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31665 2026-07-01 cs.MA 新提交 67%

ForecastAgentSearch: Towards a Multi-Expert Agent Search System for Geopolitical Event Forecasting

ForecastAgentSearch:面向地缘政治事件预测的多专家智能体搜索系统

Miaomiao Cai, He Chang, Yunshan Ma, See-kiong Ng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出ForecastAgentSearch框架,将地缘政治事件预测建模为多专家智能体搜索问题,通过检索、排序和协调专业智能体生成预测,并讨论关键设计挑战与评估方案。

Journal ref SIGIR 2026 AgentSearch Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31169 2026-07-01 cs.CV 新提交 67%

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

超越单字符:评估多模态大语言模型在句子级甲骨文理解中的表现

Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出S-OBI基准,通过字形替换与组合合成清晰标准的句子级甲骨文实例,设计语义匹配、语义槽提取和上下文推理任务,评估多模态大语言模型在句子级甲骨文理解中的表现,发现当前模型仍依赖字符级识别。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31424 2026-07-01 hep-th 新提交 67%

Critical Lin-Lunin-Maldacena geometries

临界Lin-Lunin-Maldacena几何

Prokopii Anempodistov, Vladimir Kazakov, Lev Senchukov

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究Lin-Lunin-Maldacena几何中液滴形成尖点时的临界行为,发现超引力对偶具有ISO(1,3)×SO(5)对称形式并出现裸奇点,粒子被奇点线捕获,轨迹在仿射时间内到达但观测时间发散。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28049 2026-06-29 cs.CV 新提交 67%

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

AirGroundBench: 异构多视角具身协作下多模态大模型的空间智能探测

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) QiYuanLab(启元实验室) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出AirGroundBench基准,通过异构无人机-无人车协作的多视角任务(10类、约6.2万道视觉问答和115个导航任务),系统评估多模态大模型在空间感知、跨视角对齐、空间变换推理和具身决策中的几何一致性,发现模型在跨视角对齐和变换推理上存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27999 2026-06-29 cs.CV 新提交 67%

HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

HumanMoveVQA:视频多模态大语言模型能否推理视频中的人类运动?

Pulkit Gera, Faegheh Sardari, Asmar Nadeem, Valentina Bono, Padraig Boulton, Adrian Hilton, Armin Mustafa

机构 * CVSSP, University of Surrey, Guildford, UK(萨里大学视觉、语音与信号处理中心,英国吉尔福德) Tesco, UK(乐购,英国)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出HumanMoveVQA基准,通过世界坐标系下的3D运动轨迹生成问答对,评估视频MLLM在全局轨迹和方向推理上的能力,发现现有模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27828 2026-06-29 cs.CV 新提交 67%

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Video-MME-Logical: 面向视频时序逻辑推理的受控诊断基准

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu

机构 * HKUST(香港科技大学) Colab, Beihang University(北京航空航天大学合作实验室) CUHK(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 为隔离评估多模态大模型在视频中的时序逻辑推理能力,提出包含五种时序逻辑操作和25个细粒度任务类别的受控基准,通过控制时间跨度和推理复杂度进行难度可控评估,并支持中间状态诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26176 2026-06-29 cs.AR 新提交 67%

Toward Mitigating Process-Induced Performance Degradation in 3.5D Heterogeneous Packages via Pre-Silicon Firmware Co-Optimization

通过预硅固件协同优化减轻3.5D异构封装中工艺引起的性能退化

Chi Fei Chung

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出一种物理感知的预测性固件调度层XRM-SSD V24/V7.0,通过热-电协同仿真和负载密度驱动的热提示,实现3.5D封装中电压轨预置,显著降低热漂移和泄漏电流,释放20-30%计算能力并减少65-68% EDA保护带。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27376 2026-06-26 cs.CV 新提交 67%

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成

Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 评测与基准 :post-training(abstract);prompting(abstract)

AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27264 2026-06-26 cs.CV 新提交 67%

CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

CORTEX:用于可信3D胸部CT多模态大语言模型的结构化推理基准

Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed, Muzammal Naseer, Salman Khan, Christoph Lippert

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Hasso Plattner Institute(哈索·普拉特纳研究所) Khalifa University(哈利法大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出CORTEX基准,通过四阶段诊断推理轨迹和阶段级评估协议,为3D胸部CT多模态大语言模型提供结构化监督与验证,包含76,177个验证推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27146 2026-06-26 cs.RO 新提交 67%

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节

Jiayu Yang, Tao Yang, Weijun Li, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Xiamen University(厦门大学) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26602 2026-06-26 cs.CV 新提交 67%

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

DiCoBench: 通过差异性和共性视觉线索进行多图像细粒度感知的基准测试

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出DiCoBench,一个包含765个样本的高分辨率多图像基准,通过差异性和共性视觉线索评估多模态大模型的细粒度感知能力,发现顶尖模型与人类准确率(98.3%)差距显著。

Comments Accepted by ECCV 2026. Project page with code: https://github.com/PKU-ICST-MIPL/DICO_Bench_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26533 2026-06-26 cs.RO 新提交 67%

OSC2Runner: OpenSCENARIO 2.x Compliant High-Fidelity AV Simulation in CARLA

OSC2Runner: 在CARLA中实现符合OpenSCENARIO 2.x的高保真自动驾驶仿真

Thoshitha Gamage, Lasanthi Gamage

机构 * Southern Illinois University Edwardsville(南伊利诺伊大学爱德华兹维尔分校) Webster University(韦伯斯特大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出OSC2Runner框架,通过多遍转译器架构将OpenSCENARIO v2.x DSL原生映射到CARLA,实现确定性行为树执行,解决现有仿真中的时空漂移和延迟问题。

Comments Accepted at 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26524 2026-06-26 cs.CR 新提交 67%

VIGIL: Runtime Enforcement of Behavioral Specifications in AI Agent Skills

VIGIL:AI代理技能中行为规范的运行时执行

Ying Li, Yanju Chen, Hongbo Wen, Bosi Zhang, Hanzhi Liu, Peiran Wang, Yu Feng, Yuan Tian

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出VIGIL框架,通过符号策略语言将自然语言规范转化为SMT约束,实现代理系统跨技能行为策略的运行时监控,检测违规召回率>95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25837 2026-06-25 cs.DL 新提交 67%

Towards an Interactive Evidence-RAG Peer-Review Workspace for the Journal of Digital History

面向《数字历史期刊》的交互式证据RAG同行评审工作空间

Elisabeth Guerard, Mehrdad Almasi, Marion Salaun, Frederic Clavert, Mirjam Pfeiffer

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出一个交互式证据RAG工作空间,用于《数字历史期刊》的AI辅助同行评审编辑评估,通过链接评论、证据、检索痕迹和可重复性检查提高模型建议的可检查性,初步评估显示严格准确率70.0%,有用输出率90.0%。

Comments Preliminary version of a full paper. 9 pages, 1 figure, 5 tables. Associated with an accepted presentation at AI through History, History through AI, C2DH, University of Luxembourg, 15-16 June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25763 2026-06-25 cs.CV 新提交 67%

ShutterMuse: Capture-Time Photography Guidance with MLLMs

ShutterMuse: 基于多模态大语言模型的拍摄时刻摄影指导

Jiayu Li, Yixiao Fang, Tianyu Hu, Wei Cheng, Ping Huang, Zheheng Fan, Gang Yu, Xingjun Ma

机构 * Fudan University(复旦大学) StepFun

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出CaptureGuide-Bench基准测试,评估MLLM在摄影师构图与主体姿态推荐方面的能力,并构建ShutterMuse统一模型,通过监督与强化微调实现最佳综合性能。

Comments Project Page:https://lijayutnt.github.io/ShutterMuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25634 2026-06-25 cs.CV 新提交 67%

SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解

Tianchen Guo, Chen Liu, Ling Chen, Xin Yu

机构 * The University of Queensland(昆士兰大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) University of Technology Sydney(悉尼科技大学) Follow Me AI Pty LTD(Follow Me AI有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。

Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25334 2026-06-25 cs.MA 新提交 67%

Bridging the Post-discharge Gap: A Traceable Multi-agent Framework for Safe and Continuous Care

弥合出院后鸿沟:用于安全持续护理的可追溯多智能体框架

Runwei Guan, Yi Zhou, Heyi Lin, Jinjing Zhu, Mingyuan Hou, Yang Yang, Fang Yuan, Xiaohong Lin, Shaofeng Liang, Xuming Hu, Tao Li, Tianbin Zhao, Yutao Yue, Zhiyuan Wang, Hui Xiong

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出Healink框架,通过记忆增强的多智能体架构和约束检索生成,实现基于处方的可追溯出院后随访,在回顾性和盲评中优于医生基线。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25279 2026-06-25 cs.CV 新提交 67%

MRI2Rep: Autoregressive Structured Report Generation for 3D Liver MRI

MRI2Rep:3D肝脏MRI的自回归结构化报告生成

Xinran Li, Junlin Yang, Annabella Shewarega, Zongwei Zhou, Julius Chapiro, James S. Duncan, Lawrence H. Staib

机构 * Department of Biomedical Engineering(生物医学工程系) Department of Radiology & Biomedical Imaging(放射学与生物医学影像系) Department of Electrical Engineering(电气工程系) Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins Medicine(约翰霍普金斯医学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出MRI2Rep自回归框架,通过报告到标签规范化模块将自由文本转换为结构化诊断序列,实现3D肝脏MRI的端到端结构化报告生成,在真实数据集上优于基线方法。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25084 2026-06-25 cs.CV 新提交 67%

Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications

我们到了吗?探索多模态大语言模型在辅助人工智能应用中的能力

Shayon Dasgupta, Avijit Dasgupta, C. V. Jawahar

机构 * IIT BHU India(印度理工学院瓦拉纳西校区) CVIT, IIIT Hyderabad India(印度海得拉巴国际信息技术学院计算机视觉与信息技术中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过真实世界任务评估多模态大语言模型在辅助AI中的表现,开发NetraLink系统收集基准数据,揭示其优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24883 2026-06-24 cs.CV 新提交 67%

BenchX: Benchmarking AI Models for Cancer Detection and Localization with Demographic and Protocol Biases

BenchX: 基于人口统计和协议偏差的癌症检测与定位AI模型基准测试

Qi Chen, Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Ibrahim Ethem Hamamci, Sezgin Er, Ashwin Kumar, Yiwen Ye, Yuhan Wang, Yuyin Zhou, Akshay S. Chaudhari, Curtis Langlotz, Kang Wang, Yang Yang, Alan L. Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰霍普金斯大学) German Cancer Research Center(德国癌症研究中心) University Hospital Basel(巴塞尔大学医院) University of Zurich(苏黎世大学) ETH AI Center(苏黎世联邦理工学院AI中心) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Stanford University(斯坦福大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Nanyang Technological University(南洋理工大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, San Francisco(加州大学旧金山分校) Johns Hopkins Medicine(约翰霍普金斯医学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出BenchX基准,通过85,355次CT扫描系统评估12个肿瘤检测AI模型在肿瘤大小、位置、患者亚组和成像协议上的表现,揭示模型在罕见亚组中性能不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24446 2026-06-24 cs.SE 新提交 67%

Agentic Generation of AST Transformation Rules for Fixing Breaking Updates

用于修复破坏性更新的AST转换规则的智能体生成

Frank Reyes, Benoit Baudry, Martin Monperrus

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出BigBag框架,通过智能体生成可复用的API级AST转换规则,修复依赖更新导致的编译错误,在BUMP基准上实现78.6%的修复率和跨项目33.3%的修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24058 2026-06-24 cs.CV 新提交 67%

VisChronos: Revolutionizing Image Captioning Through Real-Life Events

VisChronos: 通过真实事件革新图像描述生成

Phuc-Tan Nguyen, Hieu Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出VisChronos框架,利用大语言模型和密集描述模型从单张图像识别并描述真实事件,构建EventCap数据集,提升描述生成的上下文相关性和事件聚焦能力。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏