Towards Faithful Simulation of Human Shopping Behavior
面向人类购物行为的忠实模拟
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文针对现有用户购物行为模拟器的记忆与优化挑战,提出分层记忆的RecVerse智能体,结合轨迹级RL优化,发布USB数据集,在模拟性能上显著优于现有基线。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
面向人类购物行为的忠实模拟
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文针对现有用户购物行为模拟器的记忆与优化挑战,提出分层记忆的RecVerse智能体,结合轨迹级RL优化,发布USB数据集,在模拟性能上显著优于现有基线。
从引用意图到知识贡献:对被引论文实际贡献的分类
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究提出知识贡献分类体系KCT及双路径融合模型,实现被引论文知识贡献分类,其准确率达85.5%,且在研究评估、学术传播预测中表现优于传统引用意图分类。
评估上下文协议(ECP):一种用于AI智能体评估的便携式契约
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对当前AI智能体评估范式的局限性,提出厂商中立的ECP协议,实现跨框架的统一评估,已开发适配主流智能体框架的开源参考实现,相关验证为未来工作。
Comments 14 pages, 4 tables, 4 figures, Code available at https://github.com/evaluation-context-protocol
用智能体机器人技术重新审视“Push-T”机器人操作任务
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。
JANUS:面向无序材料的多模态基础神经采样器
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。
JW-SSD:用于细粒度太阳黑子分类的多模态基准数据集
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究提出用于太阳黑子细粒度磁型分类的多模态基准数据集JW-SSD,经质量控制后含36553对图像,可用于训练多种模型,包括取得高准确率的JW-SunSpot。
Comments 15 pages, 3 figures
UniVerse:针对文化包容性低资源音乐理解的基准测试与增强
机构 * Sogang University(西江大学) ; KAIST(韩国科学技术院) ; NYU Shanghai(上海纽约大学) ; JIUTIAN Research, China Mobile(中国移动九天研究院) ; The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) ; China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) ; Central Conservatory of Music(中央音乐学院)
专题命中 评测与基准 :language model(abstract,abstract_cn)
AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。
Comments 21 pages, 7 figures, 8 tables
面向通用深度伪造检测的环境不变子空间学习
机构 * Tianjin University of Technology(天津理工大学) ; Shandong Artificial Intelligence Institute(山东人工智能研究院) ; Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))
专题命中 评测与基准 :foundation model(abstract,abstract_cn)
AI总结 该研究针对深度伪造检测中跨分布泛化瓶颈,提出EISL框架,通过低秩投影解耦特征并设计环境干预模块,在多设置实验中提升了对未见伪造类型和环境变化的鲁棒性。
Comments 12 pages, 4 figures, 11 tables
MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; William & Mary(威廉玛丽学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。
ORCA:基于可观测性的微服务故障程序修复
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。
KHiM-Mamba:通过隐藏状态调制将病理知识注入Mamba以用于 whole slide image(WSI)分析
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本研究提出KHiM-Mamba架构,通过将病理知识注入Mamba的选择性状态空间机制,解决纯视觉驱动的WSI分析问题,在4类任务的11个公共基准上取得最优性能。
AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法
机构 * School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院) ; School of Education, Hunan Agricultural University(湖南农业大学教育学院) ; School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文提出基于CLIP的AnchorScore,可低成本预先对类别按MLLM标注难度排名,在课堂行为、动作识别等数据上与MLLM准确率相关性高,可用于混合路由、提示消歧等场景。
Comments 37 pages, 7 figures, 12 tables
AI模型生命周期的用户侧:来自Keep4o运动的证据
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本研究以Keep4o运动为案例,通过分析X平台6万余条帖子,发现AI模型技术更迭未必是用户侧的有效替换,用户体验应纳入AI模型生命周期管理。
Comments 32 pages, 5 figures, 6 tables
AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。
Comments Accepted to ASE '26
从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。
Comments Under Review
MEDR:基于多信号事件建模与动态重评分的查询无关帧选择
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。
Comments 9 pages, 2 figures, 3 tables
STINER:从X平台自动提取战略网络威胁情报
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究针对社交媒体CTI提取难题,提出STINER分类体系与语料库,经测试DarkBERT等领域适配编码器表现最优,还利用STINER-DarkBERT完成了2025年上半年欧洲威胁态势分析。
Comments Accepted at RAID 2026 (29th International Symposium on Research in Attacks, Intrusions and Defenses)
破坏模型以测试评判器:面向领域类图语义评估器的变异测试方法
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究针对领域类图语义评估器,提出一种变异测试方法,通过注入语义缺陷生成变体并评估评判器检测缺陷的能力,其结果与人工评估基本一致,可作为语义评判器分析的可扩展替代方案。
Comments Paper accepted at the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026)
LegacyWorld:面向遗留工作流的GUI智能体的原子性感知评估
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究开发LegacyUse框架以自动化遗留工作流,构建含28个Windows GUI工作流的基准,采用原子性评估6款计算机使用智能体,发现不同操作特征并提出相关首要要求。
Comments Accepted for publication in the Industry Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy
注定要反复标注:ImageNet的故事
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文针对ImageNet-1k数据集的标签噪声问题,构建ReImageNet数据集,采用人机协作反复优化的标注流程,使模型准确率显著提升,相关资源已公开。
Comments 25 pages, 16 figures, 8 tables. Project page: https://vrg.fel.cvut.cz/reimagenet
超越简化:用于阅读障碍友好型教育文本中保真视觉可访问性的DFT-GEN
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本研究针对阅读障碍人群的教育文本,提出DFT-GEN框架,通过专属可访问性层兼顾信息保真与视觉可访问性,在双语考试条目上取得显著效果。
Comments Preprint. Code available at https://github.com/MorrisYUJQ/DFT-GEN
Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。
Comments 9 pages, 6 figures, work in progress
视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估
机构 * University of Aberdeen(阿伯丁大学) ; International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) ; University of Technology Nuremberg(纽伦堡工业大学) ; University of Southern California(南加利福尼亚大学)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。
Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com
GateTruth:通过变异测试审计RTL设计基准的严谨性
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。
基于排名感知奖励最大化的查询嵌入测试时优化
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本研究提出TTT-Embed框架,将排名奖励提炼为轻量学习向量,无需访问模型权重即可优化,在多嵌入模型和MTEB任务上显著提升测试时检索效果,且具备良好泛化性,解决了灾难性遗忘问题。
StrAD:面向长视频音频描述生成的流式方法与基准
机构 * Fraunhofer IAIS(弗劳恩霍夫智能分析与信息系统研究所) ; University of Bonn(波恩大学) ; University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用科学大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) ; Center for Robotics, University of Bonn(波恩大学机器人中心)
专题命中 评测与基准 :language model(abstract);prompting(abstract)
AI总结 针对长视频音频描述生成的需求,研究提出首个流式方法StrAD,构建了涵盖多类型全长视频的基准,其微调模型在相关任务上达到先进性能,为扩大无障碍覆盖提供支持。
《Pharos Night:皇冠追逐》:一款基于多智能体系统的原生AI卡组构建与战术竞技场游戏设计
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究设计了基于多智能体系统的原生AI卡组构建与战术竞技场游戏《Pharos Night:皇冠追逐》,利用大语言模型实现核心功能,小规模试玩显示其能提供有策略性的游戏体验,也暴露出相关挑战,展现了多智能体生成式AI在游戏设计中的潜力。
Comments Accepted to 2026 Annual Symposium on Computer-Human Interaction in Play (CHI Play)
勿忽视显而易见的内容——RISC:一种用于安全自动驾驶的风险感知切片覆盖协议
机构 * CARIAD SE
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究提出RISC协议,将安全问题转化为风险切片,通过风险引导选择提升自动驾驶关键故障发现率,可应用于多类自动驾驶子系统,补充现有测试验证流程。
Comments 14 pages, 3 figures, 5 tables. Accepted at the ECCV 2026 Workshop on Safe and Defensive Autonomous Driving (SDAD). Non-archival workshop paper
ConVAWG:面向针对妇女和女孩的暴力场景下可控合成对话生成的检索驱动框架
机构 * University of Sheffield(谢菲尔德大学) ; Forensic Capability Network(法医能力网络) ; University of Leeds(利兹大学) ; University of Warwick(华威大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对VAWG场景建模的空白,提出检索驱动框架ConVAWG,生成符合CPS标准的合成VAWG多轮对话,发布6000余个对话事件,经多类评估验证其质量与领域保真度。
E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。