AI Premium
AI溢价
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 基于380万亿token的AI消费数据,构建AI因子并发现高AI贝塔公司获得更高后续收益,AI溢价显著且异质,主要源于密集型、前沿导向的AI消费。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
AI溢价
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 基于380万亿token的AI消费数据,构建AI因子并发现高AI贝塔公司获得更高后续收益,AI溢价显著且异质,主要源于密集型、前沿导向的AI消费。
Dress-ED:基于指令的虚拟试穿和试脱编辑
机构 * University of Modena(摩德纳大学) ; University of Trento(特伦托大学) ; University of Pisa(比萨大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。
Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/
IRG-MotionLLM:用于文本到运动生成的交织运动生成、评估和细化
机构 * Sun Yat-sen University(中山大学) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; Shenzhen Loop Area Institute(深圳河套学院) ; Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究揭示运动评估和细化任务可促进知识流动,提出通过迭代文本-运动对话将运动生成与评估、细化紧密结合的新范式,介绍IRG-MotionLLM及训练方案,构建数据引擎,实验证明其性能。
Comments Accepted by ECCV 2026
VKnowU:评估多模态语言模型中的视觉知识理解
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; City University of Hong Kong(香港城市大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。
Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU
PAST-TIDE:用于立场检测的基于主题不变归一化的原型锚定语句微调
机构 * Department of Computer Science and Engineering, Khulna University of Engineering & Technology(库尔纳工程技术大学计算机科学与工程系) ; Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) ; Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学机器学习系)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG
AI总结 PAST-TIDE是用于立场检测的系统,通过语句微调,将立场重新定义为完形填空式掩码语言建模,并用原型对比学习及主题条件层归一化补充,在低资源设置中表现有竞争力。
Comments Published in The Fifteenth Language Resources and Evaluation Conference (LREC 2026)
自动:通用人工智能编译器
机构 * RightNow AI(即时人工智能)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究提出通用人工智能编译器Auto,通过记录智能体行为,提取确定性部分转化为程序或专家,生成带保障的认知二进制文件。在基准测试中表现良好,还量化了失败模式,强调校准和参考保真度对正确性的决定作用。
Comments 10 pages, 4 figures, 3 tables, 1 algorithm. Code: https://github.com/RightNow-AI/auto
通过构造实现可读:注意力机制与端到端变换器
机构 * Professor School of Computer Science and Engineering University of Washington(计算机科学与工程教授 美国华盛顿大学)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG
AI总结 研究将变换器前馈层可读化的思想应用于注意力机制,提出最小化机制及布尔变体,通过选择性压力使值通道成为可读探测器,在多注意力设计中提升了可读性,还训练了端到端可读语言模型。
面向开放网络检索增强语言模型的风险约束新鲜度感知语义缓存
机构 * Jeju National University(济州国立大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究针对开放网络证据时变新鲜度,提出三层语义缓存FreshCache,将缓存重用视为风险约束时间推理问题,给出评估方法并引入基准测试,实验表明其在节省搜索API及降低陈旧错误率方面效果良好。
知道何时停止:预测文本到SQL执行一致性收敛
机构 * GIGASPACES
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG
AI总结 研究预测文本到SQL结果执行一致性收敛的停止时机,训练轻量级1-D模型观察一致性轨迹来决定是否继续运行,在多数据集上验证方法能自适应停止点,还展示了训练增强及噪声注入下的效果。
Comments 11 pages, 3 figures
当聚合对齐产生误导时:无需逐状态专家操作的审核策略修复
机构 * Blossom AI(绽放人工智能公司) ; Blossom AI Labs(绽放人工智能实验室)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究在酒店定价模拟器中,智能策略编辑器仅接收区域级诊断反馈时的策略修复问题,用多重启大语言模型编辑器进行修复,其不仅提升收益还减小情节构成距离,结果表明应按诊断反馈是否成可靠闭环结果评估策略修复。
使用Incognita评估基于社会分布式任务环境中行动的生成智能体
机构 * RedMind Research(RedMind研究)
专题命中 评测与基准 :language agent(abstract);分类 cs.CL、cs.AI
AI总结 研究结合现有基准和社会模拟环境要求的评估设置,定义社会分布式任务环境,介绍Incognita框架,以之评估三个生成智能体模型,发现其在奖励和行为上有进展但可靠性仍低。
PromptPET:隐私-效用优化的提示混淆
机构 * University of California, Irvine(加州大学 Irvine 分校) ; Washington University in St. Louis(圣路易斯华盛顿大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 旨在通过用户端机制保护用户隐私,该机制转换用户提示中的敏感信息,在保护隐私和保留效用间权衡。考虑评估比较四种混淆动作,提出基于大语言模型的PROMPTPET,优于现有方法。
用基础图像生成模型诊断鸟瞰目标检测器
机构 * Carnegie Mellon University(卡内基梅隆大学) ; DEVCOM Army Research Laboratory(陆军研究实验室(DEVCOM)) ; Florida State University(佛罗里达州立大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究用文本引导生成、属性控制编辑和自动属性验证构建可控合成测试平台,对预训练检测器进行细粒度评估,以预测实际性能差距并指导高效数据收集。
在物理基础环境中自专业化的视觉语言跨导芯片校准
机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)
专题命中 评测与基准 :language agent(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言智能体能否在无权重更新下校准超导跨导芯片。通过设计物理模拟环境、视觉语言智能体及无梯度在线自适应方法,在预算压力下提升芯片保真度,诊断硬件故障。
迷失在末尾:多模态检索增强问答中的首因偏差
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; The Ohio State University(俄亥俄州立大学)
专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI
AI总结 研究多模态知识型视觉问答中检索上下文的位置依赖,发现不同于纯文本的U形效应,出现首因偏差(开头优于末尾),并通过消融实验定位原因为指令调优阅读器的提示槽0。
Comments 15 pages, 9 figures
用于健身动作形式评估的领域知识驱动自监督表示
机构 * University of British Columbia(不列颠哥伦比亚大学) ; FlexAI Inc.(FlexAI公司)
专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究健身动作形式评估问题,提出基于领域知识的自监督方法,利用动作谐波运动及多因素差异学习强大表示,创建新数据集,实验表明自监督表示优于现有方法且可用于其他领域。
Comments ECCV 2022
MARLIN:从串联质谱中进行从头分子结构解析,无需真实分子式
专题命中 评测与基准 :language model(abstract);分类 cs.LG
AI总结 研究针对无分子式的串联质谱,提出MARLIN方法,通过自监督编码器和语言模型生成候选结构,用质量壳约束等确保准确性,在无真实分子式情况下表现出色,能可靠解析结构。
服从、发散、崩溃:对错误指令的盲目服从驱使代码语言模型陷入无法恢复的代码语义崩溃
机构 * IIIT Delhi(印度德里国家理工学院) ; IIT Kanpur(印度坎浦尔理工学院) ; Microsoft Research India(微软印度研究院)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 研究代码语言模型在指令错误时的表现,通过四个实验评估其在单步和迭代修复设置中对错误指令的应对,发现模型会盲目服从错误指令致代码语义崩溃,引入幽灵错误且无法恢复。
HCSU:用于细粒度历史书法风格理解的数据集和基准测试
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; The Key Laboratory of Embedded System and Service Computing, Ministry of Education(教育部嵌入式系统与服务计算重点实验室)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 针对大视觉语言模型在书法风格细粒度理解的挑战,引入HCSU数据集,含多朝代书法家字符图像,解耦模态混合问题,提供分层审美描述及评估协议,揭示当前架构局限以推动视觉推理发展。
Comments Accepted at ECCV 2026. 17 pages, 5 figures, 5 tables
用于跨数据集基于脑电图的情绪识别的掩码生成对比表示学习
专题命中 评测与基准 :pretraining(abstract);分类 cs.LG
AI总结 提出掩码生成对比表示学习框架MGCRL用于跨数据集脑电图情绪识别,基于区域感知时空编码器,整合生成与对比学习,通过关键设计实现跨数据集泛化的细粒度和全局判别表示。
“我不知道”过滤器:提高函数调用中智能体的可靠性
机构 * University of California, Davis, Department of Computer Science(加州大学戴维斯分校计算机科学系) ; Okareo, Inc.(Okareo公司) ; University of California, Davis, Department of Mathematics(加州大学戴维斯分校数学系)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 研究语言模型在函数调用基准测试中性能提升但因训练评估指标致幻觉问题。提出考虑错误函数调用负面结果的评估指标及可量化不确定性、去除有害函数调用的轻量级可训练过滤器,助力智能体知道何时说“我不知道”以提升可靠性。
扩散分类器如何做出决策?以偏差为中心的评估
机构 * K. N. Toosi University of Technology(伊朗科技大学) ; Amirkabir University of Technology(伊朗阿米尔卡比尔理工大学) ; The University of Tokyo(东京大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 研究扩散分类器如何决策,通过ASOB-Bench从属性绑定、大小顺序偏差和背景依赖三维度评估,发现其偏差特征与视觉语言模型不同,为构建更稳健模型提供指导。
双视图:防止个人人工智能代理中的间接提示注入
机构 * Seoul National University(首尔国立大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 研究个人人工智能代理面临的间接提示注入攻击问题,提出双视图方法,通过扩展不可信数据跟踪到用户环境,部署为插件,有效阻止攻击并保持实用性。
ClinOCR-Bench:用于光学字符识别模型评估的综合临床扫描文档数据集
机构 * McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校麦威廉斯生物医学信息学学院) ; Enterprise Development & Integration, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心企业开发与集成)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 针对从扫描医疗文档提取文本信息的挑战,通过发布ClinOCR-Bench数据集,用多样文档类型、覆盖扫描伪像等特性,评估基准OCR性能,为临床OCR模型评估提供公开资源。
用于代码修复的锚定自博弈
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 研究代码修复能力,提出生成器-修复器自博弈,通过强化学习训练单个模型生成并修复错误,引入BugSourceBench测试泛化性,发现问题后提出锚定自博弈,提高修复率。
Comments 43rd International Conference on Machine Learning (ICML 2026)
科学论文中自动分类修辞部分的大规模数据集
机构 * Graduate School of Education, Stanford University(斯坦福大学教育研究生院) ; Center for Social Data Science (SODAS), University of Copenhagen(哥本哈根大学社会科学数据科学中心) ; Networks, Data, and Society (NERDS), IT University of Copenhagen(哥本哈根IT大学网络、数据与社会中心) ; Pioneer Centre for Artificial Intelligence (P1), Denmark(丹麦先锋人工智能中心) ; Complexity Science Hub, Austria(奥地利复杂科学中心)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 该研究利用基于规则的分类算法,对语义学者开放研究语料库中的数百万篇科学论文进行质量筛选和标注,构建了一个数据集,可助力大规模科学话语和写作模式的计算研究。
Comments Data descriptor; includes supplementary information (1 PDF). 15 pages, 4 figures, 5 tables
通过运行时跟踪分析检测安全关键固件中的架构漂移
机构 * University of Naples Federico II(那不勒斯费德里科二世大学) ; Micron Technology, Inc(美光技术公司) ; DIETI
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 研究在长寿命安全关键固件中检测架构漂移问题,核心方法是收集硬件辅助执行跟踪,经抽象比较找出差异,还基于大语言模型生成报告,贡献是经评估该方法有效。
Comments accepted at 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)
MORE:一个多语言文档解析基准和评估
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 研究针对多语言文档解析,现有基准侧重高资源语言。为此引入MORE基准,其具规模大、结构复杂、数据真实的特点,用它评估模型,为长尾语言建性能基线并验证基准有效性。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 22 pages, 11 figures. Code and dataset available at https://github.com/zimoqingfeng/MORE
数据集偏移下用于可参考糖尿病视网膜病变筛查的RETFound不确定性感知最后一层自适应
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 用RETFound对糖尿病视网膜病变筛查的不确定性感知最后一层自适应进行以安全为中心的实证评估,比较多种方法,在APTOS上不确定性感知操作点改善了敏感性等,在DDR上结果有差异,强调安全评估的价值。
Comments 12 pages, 8 tables, 6 figures. Code available at https://github.com/kmardhani/uncertainty-aware-retfound
PiSAs:多用户智能体系统中情境完整性的基准测试
专题命中 评测与基准 :LLM(abstract)
AI总结 研究多用户智能体系统新隐私风险,引入PiSAs基准,用双重情境完整性注释评估无意泄露,可跨组件和接口测量跨用户数据泄露,发现模型判断影响结果,强调隐私保护策略需求。