arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11785 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2606.16420 2026-06-16 cs.CR 新提交 67%

Transferable Self-Evolving Playbooks for Agentic Security Auditing

可迁移的自演化剧本用于智能体安全审计

Ziyue Wang, Cheuk Wang Maurice Ng, Chenchen Yu, Strick Sheng, Kaihua Qin, Liyi Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出EvoHunt框架,通过审计、评估和修订三个智能体循环演化空剧本,自动生成安全审计程序知识,开源演化可超越商业产品,且演化后的剧本可迁移至弱智能体提升其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16255 2026-06-16 cs.CV 新提交 67%

UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

UniDDT: 使用解耦扩散变换器统一多模态理解与生成

Shuai Wang, Liang Li, Yang Chen, Ruopeng Gao, Yao Teng, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Seed(字节跳动Seed) University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出UniDDT模型,通过噪声ViT编码器统一视觉语义表示,并采用解耦扩散解码器分离扩散与文本解码,平衡多模态理解与生成任务,在多个基准上取得优异性能。

Comments This work was completed in \textbf{November 2025}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16198 2026-06-16 cs.CV 新提交 67%

GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction

GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测

Ruoxuan Yang, Tieyuan Chen, Xiaofeng Huang, Haibing Yin, Jun Wang, Xiping Chen, Jun Yin, Xuesong Gao, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15320 2026-06-16 cs.CV 新提交 67%

Conditional Multi-Event Temporal Grounding in Long-Form Video

长视频中的条件多事件时间定位

Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez, Lincoln Spencer, Guangyu Sun, Tianxingjian Ding, Andong Deng, Yi Li, Shuangjun Liu, Yuan Li, Dashan Gao, Ning Bi, Taotao Jing, Shuai Zhang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Qualcomm AI Research(高通人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15139 2026-06-16 cs.GT cs.RO 新提交 67%

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent

自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准

Ashutosh Kumar

机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14616 2026-06-15 cs.SE 新提交 67%

GitHub Template Repositories: Served Domains, Maintenance, and Practitioner Guidelines

GitHub 模板仓库:服务领域、维护与从业者指南

Leuson Da Silva, Altaf Allah Abbassi, Imen Trabelsi, Paulo Borba, Foutse Khomh

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 通过对五种主流编程语言的 GitHub 模板仓库进行大规模实证研究,分析了模板的服务领域、维护特征及质量问题,并提出了设计和管理模板的实用指南。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14025 2026-06-15 cs.CV 新提交 67%

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

GarmentSketch:大规模草图到时尚基准

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。

Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13477 2026-06-12 cs.LG cs.AI cs.CL 新提交 67%

SupraBench: A Benchmark for Supramolecular Chemistry

SupraBench: 超分子化学基准

Tianyi Ma, Yijun Ma, Zehong Wang, Weixiang Sun, Ziming Li, Connor R. Schmidt, Chuxu Zhang, Matthew J. Webber, Yanfang Ye

机构 * University of Notre Dame(圣母大学) University of Connecticut(康涅狄格大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 为评估大语言模型在超分子化学推理中的能力,与领域专家合作发布了首个超分子基准SupraBench,包含四个基本任务和一个辅助视觉任务,并提供了16M令牌的语料库SupraPMC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12469 2026-06-12 cs.CR 新提交 67%

Influence Factors on RAG Poisoning

RAG投毒的影响因素

Pedro Pereira, Eva Maia, Isabel Praça, Adrien Bécue

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 通过432种配置的全因子实验,研究数据集、检索器类型、检索深度、数据库组成、分块策略和生成模型对RAG系统投毒鲁棒性的影响,发现检索器架构、数据集和检索深度是主要因素,且投毒脆弱性源于多组件交互。

Comments 10 pages, 3 figures, 2 Tables, conference KES-2026 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12125 2026-06-11 cs.CV 新提交 67%

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解

Biao Tang, Xu Chen, Shuxiang Gou, Jingyi Yuan, Yuhan Zhang, Chenqiang Gao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。

Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10051 2026-06-10 cs.CY cs.HC 新提交 67%

The Empirically Grounded Adaptive Virtual Patient for Psychotherapy Training: Disclosure That Responds to Therapist Micro-Skills

基于经验的自适应虚拟患者用于心理治疗培训:对治疗师微技能做出反应的披露

Angela Chen, Siwei Jin, Catherine Bao, Canwen Wang, Robert E. Kraut, Tongshuang Wu, Haiyi Zhu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出自适应虚拟患者(AVP),基于近2000小时真实治疗转录的结构方程模型,动态调整披露水平以响应治疗师共情和探索技能,在80次会话评估中优于纯提示基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08568 2026-06-09 cs.CY 新提交 67%

Regulating the AI Tutor: Intentions, Help-Seeking, and Self-Regulated Learning in Adolescent GenAI Use

调控AI导师:青少年使用生成式AI时的意图、求助行为与自我调节学习

Rania Abdelghani, Peter Kaiser, Kou Murayama

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究通过98名九年级学生的对话数据,分析青少年使用生成式AI学习时的自我调节学习和求助行为,发现学生主要进行工具性请求而缺乏监控评估,且后测成绩显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07962 2026-06-09 cs.CV 新提交 67%

ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

ChronoPhyBench:多模态大语言模型真正理解世界还是仅仅利用语言先验?

Bin Zhu, Yanhao Jia, Kexin Zhao, Jie Wang, Munan Ning, Hao Li, Yuwei Niu, Tanqing Sun, Huangchong Yan, Mingjun Pan, Xinyi Wu, Qishen Yin, Yunyang Ge, Shuai Zhao, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre Intelligence Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出ChronoPhyBench基准,通过视频上下文和文本描述强制模型进行物理状态推理,揭示当前开源模型物理推理能力仍处初级阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07451 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交 67%

TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐

Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯) Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TEVI框架,利用稀疏自编码器解耦图像嵌入,并通过文本条件掩码模块选择性重构嵌入,以改善CLIP等视觉-语言模型的图像-文本对齐,在多个检索基准上取得提升。

Comments 20 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07434 2026-06-08 cs.GT 新提交 67%

Evidence Markets

证据市场

Safwan Hossain, Gabriel Andrade, Chengqi Zang, Yiling Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出证据市场,通过动态调整流动性的对数市场评分规则,激励提交证据和信念,支持内生解决,证明有界损失、证据按市场不确定性奖励,并实现ε-DSIC策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07363 2026-06-08 cs.CR cs.SE 新提交 67%

On the Shoulders of Giants: Empowering Automated Smart Contract Auditing via the GiAnt Corpus

站在巨人的肩膀上:通过GiAnt语料库赋能自动化智能合约审计

Xiaoting Zhang, Zhipeng Gao, Yiran Lv, Xing Hu, Feifei Niu, Xin Xia

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出自动化框架GiANT,从真实审计报告中提取漏洞信息构建高质量数据集GiAnt Corpus,包含7711个漏洞发现,验证了其在漏洞检测等任务中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07175 2026-06-08 cs.CV 新提交 67%

Seeing Without Exposing: Adaptive Privacy Control for Open-World, Context-Hungry MLLMs

看见而不暴露:面向开放世界、上下文饥渴型MLLM的自适应隐私控制

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui Li, Shiqi Wang, Sam Kwong

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究学院) Lingnan University(岭南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多模态大语言模型在开放世界中面临不可预测敏感信息泄露的隐私挑战,提出无训练方法APD,将隐私元素漂移至语义等价替代物并锚定上下文线索,结合新基准AdaptShield实现隐私保护与上下文保留的平衡提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07171 2026-06-08 cs.CV 新提交 67%

When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing

当恢复至关重要时:MLLM编辑中替代隐私的盲点

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui LI, Shiqi Wang, Sam Kwong

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究院) Lingnan University(岭南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多模态大模型编辑中的隐私风险,提出首个面向恢复的替代隐私保护编辑基准SPPE,涵盖36个细粒度隐私类别和65个编辑指令,并设计可编辑性评估与替代到源编辑恢复两个任务及对应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07024 2026-06-08 cs.CV 新提交 67%

GuideCAD: A Lightweight Multimodal Framework for 3D CAD Model Generation via Prefix Embedding

GuideCAD: 基于前缀嵌入的轻量级多模态3D CAD模型生成框架

Minseong Kim, Jinyeong Park, Sungho Park, Jibum Kim

机构 * Convergence Research Center for Insect Vectors(昆虫传播载体汇聚研究中心) Incheon National University(仁川国立大学) Center for Brain-Machine Interface(脑机接口中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出GuideCAD框架,利用少量可训练参数通过映射网络将图像嵌入转为前缀嵌入,结合预训练大语言模型和Transformer解码器生成3D CAD模型,参数减少约4倍且训练效率提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06662 2026-06-08 cs.SE 新提交 67%

AutoPipelineAI: Context-Aware CI/CD Pipeline Generation from Natural Language

AutoPipelineAI: 基于自然语言的上下文感知CI/CD流水线生成

Youssef Mohamed Aboelfotoh, Mohamed Ahmed Hemdan, Mohammad El-Ramly, Khlood Hassan, Mahmoud Saleh Saad, Ahmed Mohamed Tolba, Seif Gamal Abdelmonem

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出AutoPipelineAI系统,利用大语言模型从自然语言描述生成CI/CD流水线配置,集成仓库感知分析、自动验证和反馈机制,降低DevOps配置复杂度。

Comments 7 pages, 1 figure, 6 tables, 16 references, IMSA Conference 11-12 July 2026, International Conference on Intelligent Methods, Systems, and Applications 2026 #70415,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19140 2026-08-20 cs.AI cs.CY cs.LG cs.SE 新提交 62%

Grouping the Stochastic Machine: Precision, Not Capability, as the Frontier Metric for AI Systems

分组随机机:将精度而非能力作为AI系统的前沿度量标准

George Andrikopoulos

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将精度而非能力作为AI系统的前沿度量,指出当前基准测试未测量精度,定义了分组度量方法,其测量结果可指导决策,且该方法需通过实际工作测量验证规范价值。

Comments 6 pages, 3 figures. Companion to "Tuning the Stochastic Machine", submitted concurrently

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18096 2026-08-20 cs.CL cs.LG 新提交 62%

MAVEN: A Macro-Societal Value Evaluation Framework of Multimodal Content with Compact Aligned Evaluators

MAVEN:基于紧凑对齐评估器的多模态内容宏观社会价值评估框架

Zijuan Zhao, Zheren Fu, Hou Xia, Licheng Zhang, Yi Liu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 针对多模态内容宏观社会价值评估难题,提出MAVEN分层框架,构建相关基准与指标,优化评估器,实验表明其2B评估器表现接近前沿闭源VLMs,提供了可扩展评估路径。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15459 2026-08-18 cs.LG cs.AI 新提交 62%

Not All Attention Is Equal: A Quantitative Survey of the EEI Trade-off

并非所有注意力都平等:EEI权衡的定量综述

Aditya Singh

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本综述围绕注意力机制的效率-表达性-可解释性权衡,定量对比21种方法,梳理其多领域发展脉络,分析研究缺口并指明未来方向,支持粗粒度层级对比。

Comments 53 pages, 8 figures, 16 tables. Code and analysis artifacts: https://github.com/Nixon-H/not-all-attention-is-equal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15032 2026-08-18 cs.CL cs.AI cs.CV 新提交 62%

Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

Handoff-H1:一种用于从建筑蓝图中提取材料工程量的协同视觉智能体系统

Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla

机构 * Handoff AI Research(汉德夫人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Handoff-H1视觉智能体系统,结合专用计算机视觉模型、工具智能体与建筑知识库,在建筑蓝图工程量提取基准上,性能优于前沿模型和人类专业估算师。

Comments 15 pages, 7 figures. Evaluation harness available on https://github.com/handoffai/residential-takeoff-benchmark/. Request data via e-mail to research@handoff.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09393 2026-08-11 cs.CL cs.AI cs.IR 新提交 62%

Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law

法律检索增强生成(RAG)中的时间错位:面向法国税法的版本化语料库基准

Rose Cymbler, Daniel Guez, Laurent Fabre

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对法律RAG的时间错位问题,构建法国税法版本化语料库基准FiscalQA Pro,发现现有模型时间推理能力差,端到端多版本检索器性能优异,还发布了相关数据集与代码。

Comments 13 pages, 1 figure, 4 tables. Accepted at the ICML 2026 Workshop on AI for Law (AI4Law), Seoul. Code and data: https://github.com/rosecymbler/fiscal-fr-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09209 2026-08-11 cs.CL cs.LG 新提交 62%

UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers

UNMASK:发现并因果验证文本分类器中的虚假捷径

Chidaksh Ravuru, Shashank Srivastava

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出UNMASK自动化流程,可发现并因果验证文本分类器的虚假相关性,在MNLI、CivilComments-WILDS等数据集上提升模型性能,还可推广至奖励模型偏好数据。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07435 2026-08-10 cs.CV cs.AI cs.CL 新提交 62%

SABRE: Scalable and Automated Benchmarking of VLMs under Stress

SABRE:压力场景下视觉语言模型(VLM)的可扩展自动化基准测试

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术学院) Stony Brook University(石溪大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 SABRE是可扩展自动化VLM压力测试框架,可生成多维度测试样本,经实验验证其能有效评估VLMs对视觉证据与世界先验的依赖程度,支持多种压力测试场景。

Comments 22 pages, 10 figures. Code and resources will be available at https://zesearch.github.io/vlm-SABRE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07341 2026-08-10 cs.CL cs.AI 新提交 62%

Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination

零差距并非恢复:分层逐题概率评估与基准污染的逐步缓解

Ruijie Hou, Yueyang Jiao, Zhao Wang, Yingming Li

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对基准测试数据泄露导致的模型评估偏差问题,提出SA-PPG指标与RailCap方法,揭示现有缓解策略的恢复效果被高估,RailCap可实现更低的污染程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06975 2026-08-10 cs.CL cs.AI 新提交 62%

PHASE-Tree: Modeling Character-State Evolution in Long-Horizon Role-Playing Dialogue

PHASE-Tree:建模长回合角色扮演对话中的角色状态演化

Bo Tang, Jianan Yang, Junyi Zhu, Yiquan Wu, Rui Zhao, Zhengyu Yang, Yang Zhang, Feiyu Xiong, Zhiyu Li, Jiajun Shen

机构 * MemTensor (Shanghai) Technology(MemTensor(上海)科技) KU Leuven(鲁汶大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Sinar Mas Paper (China) Investment Co., Ltd(金光纸业(中国)投资有限公司) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 针对长回合角色扮演对话的角色状态演化问题,提出多时间尺度角色状态树模型PHASE-Tree,构建基准LongEvoRoleBench并验证其在角色生成任务上的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05954 2026-08-07 cs.AI cs.CV cs.LG 新提交 62%

Training a Conditioned Video Game Agent on a VLM Annotated Dataset

基于VLM标注数据集训练条件化电子游戏智能体

Katrin Schmid, Iuri Frosio

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对电子游戏强化学习中奖励获取、加权及稀疏性等问题,提出用VLM标注数据集,结合离线RL训练条件化智能体,并分析实验中的困难与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏