arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-06 至 2026-08-06 共收录 345 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 85 篇

2604.17529 2026-08-06 cs.SE 版本更新 80%

Automated Logging Is Language-Sensitive: A Multilingual Benchmark and Empirical Study of LLMs

单语言证据不足以支持自动化日志记录:一个多语言基准和基于LLM的实证研究

Renyi Zhong, Yichen Li, Yulun Wu, Jinxi Kuang, Yintong Huo, Michael R. Lyu

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过多语言基准MultiLogBench研究自动化日志记录的跨语言有效性,发现框架锚点匹配是最敏感的组件,模型排名在顶级稳定,但需多语言验证以确保鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14137 2026-08-06 cs.CL cs.AI cs.LG 版本更新 80%

From Feelings to Metrics: Understanding and Formalizing How Users Vibe-Test LLMs

从感受至指标:理解并形式化用户如何通过 vibes 测试 LLMs

Itay Itzhak, Eliya Habba, Gabriel Stanovsky, Yonatan Belinkov

机构 * Technion – Israel Institute of Technology(技术离子-以色列理工学院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究用户通过非正式经验评估LLM的方式,并形式化该过程以支持系统分析,通过个性化测试和用户感知标准改进模型评估。

Comments Published at COLM 2026. 50 pages, 20 figures. Code and data at https://technion-cs-nlp.github.io/vibe-testing-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04975 2026-08-06 cs.SE cs.AI 新提交 79%

SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models

SciCode-Verified:基准缺陷如何低估了语言模型的科学编码能力

Sihan Hu, Lyuhan Huang, Youjin Deng, Kun Chen

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 该研究发现SciCode基准存在大量缺陷,导致语言模型科学编码能力被低估,修正后重新评估显示模型准确率大幅提升,瓶颈在于评估工具而非模型能力。

Comments 47 pages, 2 figures, 6 tables. Project repository: https://github.com/flyingwagner/scicode-verified

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04792 2026-08-06 cs.LG 新提交 79%

Above-ground Biomass Estimation with Geospatial Foundation Models

基于地理空间基础模型的地上生物量估算

Ghjulia Sialellia, Linus Scheibenreif, Jan Dirk Wegner, Konrad Schindler

机构 * ETHZ(苏黎世联邦理工学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文构建地理空间基础模型用于全球地上生物量估算的综合基准,发现预计算嵌入产品表现优异,基于AlphaEarth Foundations嵌入训练的模型性能优于当前最优的监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13138 2026-08-06 cs.SE cs.CR cs.LG 版本更新 79%

A Comprehensive Evaluation of Code Language Models for Security Patch Detection

以代码为中心的漏洞修复提交检测:一个统一的基准和实证研究

Nils Loose, Joseph Bienhüls, Kristoffer Hempel, Felix Mächtle, Thomas Eisenbarth

机构 * University of Lübeck(吕贝克大学) University of Lübeck Institute for IT Security(吕贝克大学信息安全部)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文通过统一框架评估了基于代码语言模型的漏洞修复提交检测,发现仅依赖代码变更无法让模型获得可转移的安全相关代码理解,且在去除提交信息后,增加内过程语义上下文也无法使模型关注代码变更,性能受数据分布和时间分割影响显著。

Comments Accepted at ASE26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05015 2026-08-06 econ.TH cs.AI cs.LG 新提交 79%

Revealed Rationality: Label-Free Evaluation and Regularization from Representation Theorems

显示理性:基于表示定理的无标签评估与正则化

Isaiah Andrews

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文利用决策理论表示定理的“当且仅当”结构,提出对LLM等AI系统的无标签评估与正则化方法,通过三个实例生成零值连续惩罚项,补充其他训练信号。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05086 2026-08-06 cs.AI cs.CL 新提交 79%

Item Response Theory for AI Safety

面向AI安全的项目反应理论

Joshua Fonseca Rivera, Neil Shah, David Demitri Africa, Konstantinos Voudouris

机构 * Independent(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究将项目反应理论(IRT)应用于192个语言模型的8个安全基准,识别出三个关键因素,证明IRT可降低评估成本并审计模型,建议前沿实验室采用。

Comments 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21692 2026-08-06 cs.CL cs.AI 版本更新 79%

Revisiting Generalization Across Difficulty Levels: It's Not So Easy

重新审视不同难度层级间的泛化:这并不容易

Yeganeh Kordi, Nihal V. Nayak, Max Zuo, Ilana Nguyen, Stephen H. Bach

机构 * Brown University(布朗大学) Harvard University(哈佛大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLMs在不同任务难度间泛化的能力,发现训练数据的难度对泛化效果影响有限,强调在训练和评估中需涵盖多种难度以避免风险。

Comments Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04910 2026-08-06 cs.HC 新提交 78%

AutoCue: Multimodal LLM-Assisted Externalization of Implicit Inputs as Instructional Visual Cues in Screencast Tutorials

AutoCue:多模态大语言模型辅助将隐式输入外部化为录屏教程中的教学视觉提示

Shengyang Luo, Shengyao Luo, Xiaolei Guo, Fengze Zhang, James Liang, Yingjie Victor Chen

专题命中 评测与基准 :LLM(title,abstract)

AI总结 AutoCue是多模态大语言模型辅助的教程增强流水线,可将录屏教程中隐式输入外部化为视觉提示,在Autodesk Maya上的评估显示其能缩短任务时间、减少交互中断并提升学习者体验

Comments Accepted to Graphics Interface 2026 (GI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04106 2026-08-06 cs.CV eess.IV 新提交 78%

LoRetta: A Foundation Model and Extensive Dataset for Global-Scale Remote Sensing Dense Image Matching

LoRetta:面向全球尺度遥感密集图像匹配的基础模型与大规模数据集

Siwei Yu, Han Guo, Zhenwei Shi, Zhengxia Zou

机构 * Beihang University(北京航空航天大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对全球尺度遥感密集图像匹配的挑战,本文提出结合可匹配性感知仿射定位与引导式密集配准的基础模型LoRetta,并构建含原生可匹配性标签的LEVIR-GM基准,实验表明其性能优于现有模型且迁移性良好。

Comments 17 pages, 12 figures, 6 tables. Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence. Project page: https://siweiyu.com/work/loretta/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04042 2026-08-06 cs.RO 新提交 78%

Kitchen Robotic Manipulation utilizing Foundation Models

基于基础模型的厨房机器人操作

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

机构 * Kumoh National Institute of Technology(金乌国立技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。

Comments Intelligent Service Robotics (ISR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04682 2026-08-06 cs.SE cs.AI 新提交 77%

Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports

Active-SWE:针对无问题报告的主动漏洞修复任务的编码智能体基准测试

Haobin Li, Ping Deng, Weizhong Qian, Liang Jiang, Zhenyu Huang, Mouxing Yang, Xi Peng

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Active-SWE是首个针对无问题报告的主动多漏洞修复任务的编码智能体基准,实验显示现有顶尖编码智能体在该任务上性能有限。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00794 2026-08-06 cs.AI 版本更新 77%

Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation

无效度的测量:智能体AI评估中的复合可靠性问题

William Caban

机构 * Red Hat, Inc.(红帽公司) Alma Mater Europaea University(欧洲母校大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究指出智能体AI评估存在复合可靠性问题,任务生成、LLM模拟、评分者间信度三个层面的失效相乘降低效度,提出八项心理测量学改进建议以提升评估可信度。

Comments 34 pages (review/double-spaced format), 2 figures, 5 tables. Submitted to Knowledge-Based Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20690 2026-08-06 cs.CL 版本更新 77%

Learning to Detect UI Principle Violations via Reinforcement Learning

通过强化学习学习检测用户界面原则违规

Nishi Mehta, Swathi Alse, Himani Kumawat, Yue Yu, Pratik Jayarao

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05026 2026-08-06 cs.HC cs.AI 新提交 74%

ArtAnno: Annotating Implicit Semantics in Artworks through LLM Agent-Driven Bidirectional Human-AI Augmentation

ArtAnno:通过大语言模型智能体驱动的双向人机增强对艺术品的隐式语义进行标注

Xiaoyan Gu, Yifang Wang, Wenqing Zheng, Haozhong Liu, Yixia Zheng, Peiyi Jiang, Wenjie Ning, Wei Zhang, Wei Chen

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究针对艺术品隐式语义标注效率低的问题,提出双向人机增强框架并实现ArtAnno系统,经评估可提升标注效率、实现知识积累并减少标注员的信息处理工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04885 2026-08-06 cs.CV cs.CL 新提交 74%

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性

Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili

机构 * University of Tehran(德黑兰大学) Tehran University of Medical Sciences(德黑兰医科大学) Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 本研究通过脑部MRI数据集评估四类视觉-语言模型在视觉、文本扰动下的诊断鲁棒性,发现其存在预测翻转、文本选择偏差、诊断过度承诺等问题,指出需采用稳定性指标评估其临床应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04374 2026-08-06 cs.CL cs.AI 新提交 73%

FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation

FinReportBench:衡量与提升机构级财务报告生成能力

Yinghao Tang, Tan Zhenwei, Yiyao Wang, Wanli Gu, Xiaolu Zhang, Jun Zhou, Wei Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinReportBench基准,发现大型语言模型生成机构级财务报告的瓶颈在于报告身份认同与机构完整性,通过基准引导的技能蒸馏可显著提升模型相关指标。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04077 2026-08-06 cs.AI cs.CL 新提交 73%

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

FinProBench:基于专业交付物衍生的角色基准评估金融AI智能体

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究推出FinProBench金融AI智能体基准及RGRC角色基准构建流程,实验显示RGRC在角色专业化角色评估上优于仅提示方法,角色级复用基准可大幅减少工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02046 2026-08-06 cs.CL cs.AI 版本更新 73%

CompanionBench: A Theory-Anchored, Real-World-Grounded Benchmark for AI Emotional Companionship

CompanionBench:一个基于理论、扎根于真实世界的AI情感陪伴基准

Yao Liu, Guangjia Chai, Yuming Huang, Jihao Huang, Lei Wang, Junchen Wan

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究推出基于理论与真实数据的交互式双语AI情感陪伴基准CompanionBench,评估28个智能体发现其能力差异,指出角色扮演智能体表现差、核心能力存弱点,将发布500对中英平行数据及评估代码。

Comments 33 pages, 6 figures, 19 tables, 13 appendices. Bilingual (Chinese/English) interactive benchmark; 28 evaluated agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04525 2026-08-06 cs.CL cs.LG q-bio.GN 版本更新 73%

GENEB: Why Genomic Models Are Hard to Compare

GENEB:为什么基因组模型难以比较

Daria Ledneva, Mikhail Nuridinov, Denis Kuznetsov

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 针对基因组基础模型评估碎片化的问题,提出GENEB基准,通过统一探测协议在100项任务上比较40个模型,揭示模型排名不稳定、规模收益有限等关键发现。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27882 2026-08-06 cs.CL cs.AI 版本更新 73%

VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild

VibeSearchBench:野外长期主动搜索的基准测试

Xiaohongshu Inc

机构 * Xiaohongshu Dots Studio & Unipat AI(小红书 dots 飞 studios 与 Unipat AI)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对现有搜索基准中查询过于明确、单轮交互和固定模式评估导致用户体验与评估结果差距的问题,提出VibeSearch范式并构建VibeSearchBench基准,通过渐进式用户模拟和图匹配评估框架测试前沿模型,发现所有模型在长期上下文推理、主动意图激发和结构化知识构建方面仍存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04260 2026-08-06 cs.CL 新提交 70%

Towards End-to-End Multilingual Metaphor Processing: Integrating Detection, Translation, and Evaluation

面向端到端多语言隐喻处理:整合检测、翻译与评估

Jiahui Liang, Lifeng Han

机构 * Leiden University(莱顿大学) Leiden University Medical Centre(莱顿大学医学中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究拟开发端到端多语言隐喻处理框架,整合隐喻检测、面向隐喻的翻译评估及联合建模,结合语言学理论与大语言模型,以提升多语言NLP系统处理比喻语言的能力。

Comments Scientific report on PhD thesis plans and milestones achieved (current progress)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04205 2026-08-06 cs.AI 新提交 70%

MatrAIx: Simulating the World with 8.3 Billion Persona Agents

MatrAIx:用83亿个 persona 智能体模拟世界

Xiaomin Li, Yuexing Hao, Jianheng Hou, Jintao Huang, Qianfeng Wen, Shirley Huang, Yifan Liu, Xiaoyi Liu, Yilan Fan, Yijun Wang, Koutian Wu, Ruoqi Gao, Muhammad Ahmed Mohsin, Jing Tang, Brihi Joshi, Heming Liu, Zheyuan Deng, Zonglin Di, Sankalp Jajee, Jiuyao Lu, Zhiwei Zhang, Saksham Kapoor, Ishan Gupta, Yunhan Zhao, Chanwoo Park, Yucheng Lu, Bing Hu, Weihang Xiao, Aravind Mohan, Hanwen Xing, Runyu Zhang, Mihir Kulshreshtha, Yuanda Xu, Qianyu Zhu, Dianzhuo Wang, Yuxin Xiao, Bowen Jiang, Yongye Su, Wenhao Chai, Zuxin Liu, Lawrence Yunliang Chen, Xuandong Zhao, Ethan Ye, Shivam Patel, Jason Xie, Alex Martin Richmond, Weixiang Ding, Emre Okcular, Diya Mathew, Ziheng Wang, Rana M. Shahroz Khan, Zhejian Peng, Fang Wu, Fan Nie, Xinyang Han, Yubin Kim, Jiawei Zhang, Zhenting Qi, Huangyuan Su, Xu Pan, Abinitha Gourabathina, Hyewon Jeong, Hemanth Neelgund Ramesh, Kumail Alhamoud, Kimia Hamidieh, Zidi Xiong, Samuel Schmidgall, Pengrui Han, Yepeng Huang, Yongheng Wang, Bowen Yang, Alex Gu, Yuchu Wang, Akshay Paruchuri, Brenna Li, Hejie Cui, Jiayuan Ding, Chaosheng Dong, Jiahao Wang, Yixuan He, Chi Wang, Pamela Bhattacharya, Tianyi Peng, Paul Pu Liang, Mitchell Gordon, Yilun Du, Marinka Zitnik, James Zou, Prasanna Tambe, Philip Torr, Emily Fox, Asu Ozdaglar, Dawn Song

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 MatrAIx是含83亿 persona 智能体的模拟用户评估基础设施,含Persona 8B、MatrAIx Playground及1010个多领域任务,经验证可高效评估AI系统与数字产品。

Comments Project website: https://matraix.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02150 2026-08-06 cs.CV cs.AI 版本更新 70%

PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs

PhyCheck:面向视频大语言模型的物理规律理解细粒度证据驱动数据集

Zhongjie Ba, Shengwang Xu, Peng Cheng, Jinyang Zou, Ting Yu, Zhibo Wang, Zhan Qin

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙江大学杭州国际科技创新中心) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PhyCheck数据集,通过粗粒度、细粒度及诊断子集提升视频大语言模型的物理规律理解,实验证实其训练效果,同时指出当前模型难以整合因果条件的问题。

Comments 15pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04523 2026-08-06 cs.CR cs.SE 新提交 67%

Checked-In Secret Detection: Strings Are All You Need

签到式密钥检测:字符串即你所需

Zhengdong Huang, Kevin Li, Jinqiu Yang, Yepang Liu, Lili Wei

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对源代码硬编码密钥检测的现有方法局限,提出基于StringGroup的上下文提取算法及Secretron工具,在SecretBench数据集上F1值达98.74%,可高效检测未知密钥。

Journal ref The ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04482 2026-08-06 cs.IR 新提交 67%

Skills Know Their Neighbors: Cluster-Contrastive Capability Pages for Skill Retrieval

技能了解其邻居:用于技能检索的聚类对比能力页面

Zifei Wang, Wei Wen, Qiang Ji, Ruizhi Qiao

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型智能体技能检索中仅改进检索器无法消除的文档导致的误差,提出聚类对比的能力页面,在SRA-Bench等数据集上显著提升了召回率与任务成功率。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29025 2026-08-06 cs.CV 版本更新 67%

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

用于一致多参考图像编辑的评估-验证奖励

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba(高德,阿里巴巴) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04469 2026-08-06 cs.CR cs.MA 版本更新 67%

Cross-Layer Semantic Flow Reconstruction for Attack Detection in Agentic Systems

超越输入防护:为执行感知攻击检测重建跨代理语义流

Qizhi Cai, Yangyang Wei, Zhipeng Chen, Shouling Ji, Zhenyuan Li

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 SysName通过重建跨代理语义流,实现执行感知的攻击检测,有效识别多种复合攻击向量,提升多代理系统安全性。

Comments 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18528 2026-08-06 cs.SE 版本更新 67%

AutoLogger: A Multi-Agent Framework for the End-to-End Automated Logging

通过多智能体框架实现端到端自动日志记录

Renyi Zhong, Yintong Huo, Wenwei Gu, Yichen Li, Michael R. Lyu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出Autologger框架,通过多智能体系统实现端到端自动日志记录,提升日志生成质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04964 2026-08-06 cs.AI cs.LG 新提交 62%

WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

WorldCycle:用于长时序视频世界模型的自验证强化学习

Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对交互式视频世界模型的误差累积问题,提出自验证RL框架WorldCycle,利用可逆动作循环实现无标注监督,在CycleBench基准上大幅降低状态返回漂移并提升复合动作准确率。

Comments https://nevsnev.github.io/Worldcycle/

详情

展开后加载摘要…

URL PDF HTML 收藏