arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1498 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1498 篇

2605.01391 2026-06-12 cs.CV 版本更新 67%

VISTA: Video Interaction Spatio-Temporal Analysis Benchmark

VISTA:视频交互时空分析基准

Alejandro Aparcedo, Akash Kumar, Aaryan Garg, Dalton Pham, Wen-Kai Chen, Anirudh Bharadwaj, Aman Chadha, Yogesh Rawat

机构 * University of Central Florida(中央佛罗里达大学) BITS Pilani(比特斯理工学院) Ho Chi Minh City University of Science(胡志明市科学大学) Amazon GenAI Project(亚马逊生成人工智能项目)

专题命中 评测与基准 :language model(abstract);pretraining(abstract)

AI总结 提出VISTA基准,通过分解视频为实体、动作和关系,实现开放集多实体多动作的时空理解评估,揭示传统指标掩盖的偏差。

Comments Accepted to CVPR 2026 Workshop on Pixel-level Video Understanding in the Wild (PVUW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13830 2026-06-10 cs.SE 版本更新 67%

Practitioner Insights on Fairness Requirements in the AI Development Life Cycle: An Interview Study

从业者对AI开发生命周期中公平性需求的实践见解:一项访谈研究

Chaima Boufaied, Thanh Nguyen, Ronnie de Souza Santos

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 通过26场半结构化访谈,从软件工程视角评估从业者对AI公平性的认知,发现实践不一致、公平性常被降级,需明确公平定义、评估指标和形式化流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02274 2026-06-09 cs.RO 版本更新 67%

Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning

Dexterity-BEV: 对齐3D世界与动作以实现通用机器人策略学习

Huayi Zhou, Wei Gao, Dekun Lu, Ruiji Liu, Zhanqi Zhang, Ziyang Zhang, Jian Chen, Wenlve Zhou, Sheng Xu, Shumin Li, Kangyi Guo, Shichen Xu, Zixin Huang, Yongyi Su, Kui Jia

机构 * DexForce Technology(德克斯技术公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 提出Dexterity-BEV框架,通过对齐顶点图和顶点谱的3D表示以及鸟瞰图对齐,解决2D基础模型在3D操作中的局限性,提升机器人策略的泛化能力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00384 2026-06-09 cs.AI cs.CL cs.CV cs.LG stat.CO 版本更新 67%

VESTA: Visual Exploration with Statistical Tool Agents

VESTA: 基于统计工具代理的视觉探索

William Rudman, Abhishek Divekar, Kanishk Jain, Sebastian Joseph, Stella S. R. Offner, Matthew Lease, Kyle Mahowald, Greg Durrett, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出VESTA框架,通过动态增长的工具集指导数据变换、假设驱动可视化和统计检验,提升视觉语言模型在复杂统计建模任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00238 2026-06-09 cs.CL cs.AI cs.LG 版本更新 67%

DIVERGE: Diversity-Enhanced RAG for Open-Ended Information Seeking

DIVERGE: 面向开放式信息检索的多样性增强RAG

Tianyi Hu, Niket Tandon, Akhil Arora

机构 * Aarhus University(奥胡斯大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有RAG系统忽略开放式信息检索中多样性需求的问题,提出Diverge框架,通过迭代反思引导的多样化视角探索和多样性感知检索支持,在保持质量的同时将多样性提升约2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10534 2026-06-09 cs.LG cs.AI cs.CL 版本更新 67%

Decoupling the "What" and "Where" With Polar Coordinate Positional Embeddings

解耦“什么”和“哪里”:极坐标位置嵌入

Anand Gopalakrishnan, Robert Csordás, Jürgen Schmidhuber, Michael C. Mozer

机构 * DeepMind, London, UK(深度Mind,伦敦,英国)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出极坐标位置嵌入(PoPE)以解耦Transformer注意力机制中的内容和位置,在诊断任务、序列建模和语言模型中优于RoPE,并展现零样本长度外推能力。

Comments ICML 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15422 2026-06-09 cs.SE 版本更新 67%

A Survey on the Applications of Generative Artificial Intelligence in Automated Driving Systems Test Scenario Generation Methods

生成式人工智能在自动驾驶系统测试场景生成方法中的应用综述

Ji Zhou, Yongqi Zhao, Yixian Hu, Hexuan Li, Zhengguo Gu, Nan Xu, Arno Eichberger

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 综述生成式AI在自动驾驶测试场景生成中的应用,分析31篇主要研究,提出包含多模态扩展、伦理检查表和ODD覆盖图的分类法,以解决标准化评估缺失等问题。

Comments 40 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06216 2026-08-13 cs.LG cs.AI 版本更新 66%

Continual Learning in Transition

过渡中的持续学习

Zhiyan Hou, Dan Zhang, Tao Feng, Liyuan Wang, Wei Li, Xiangzhao Hao, Hongyan An, Junfeng Fang, Haokai Ma, Zhaohui Xu, Xinyu Tang, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG;LLM(comments)

AI总结 本文系统综述持续学习从以参数为中心向系统级适配的转变,通过时机、方式、位置三轴框架分析其演化,讨论相关挑战与未来方向。

Comments Survey on continual learning in the LLM and agentic-AI era

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-08-25 cs.AI cs.CL 版本更新 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, Bernard Ghanem, David R. Pugh

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23220 2026-08-25 cs.CL cs.LG 版本更新 62%

Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders

模型方向,而非词语:使用稀疏自编码器的机制性主题模型

Carolina Zheng, Nicolas Beltran-Velez, Sweta Karlekar, Claudia Shi, Achille Nazaret, Asif Mallik, Amir Feder, David M. Blei

机构 * Columbia University(哥伦比亚大学) Google Research(谷歌研究院) Independent(独立研究者)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出机制性主题模型(MTMs),利用稀疏自编码器学习可解释特征,以揭示深层概念主题,并通过topic judge评估框架验证其有效性。

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL). 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17965 2026-08-21 cs.LG cs.AI cs.SE 版本更新 62%

Too Sure to Be Safe: Model Calibration for Reliable Log Anomaly Detection

过于自信难安全:面向可靠日志异常检测的模型校准

Bin Li, Dongdong Wang, Siyang Lu

机构 * Beijing Jiaotong University(北京交通大学) University of Florida(佛罗里达大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对基于语言模型的日志异常检测器置信度校准差的问题,提出轻量级事后校准框架LoRD,经实验验证其可提升置信度可靠性并减少过度自信异常相关错误且不牺牲检测性能。

Comments Accepted at the 2026 IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03259 2026-08-21 cs.LG cs.AI 版本更新 62%

FinVerse: Financial Time-Series Benchmark

FinVerse:金融时间序列基准

Jaehoon Lee, Jun Seo, Seunghan Lee, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Minjae Kim, Sungdong Yoo, Junhyeok Kang, Sangjun Han, Soonyoung Lee, Wonbin Ahn

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究推出金融时间序列预测基准FinVerse,其针对43个公开时间序列基础模型的分析显示,通用预测标准下的优异表现未必对应实用金融预测,凸显了领域感知基准的必要性。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04546 2026-08-20 cs.RO cs.AI cs.CV cs.LG 版本更新 62%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06422 2026-08-20 cs.CL cs.AI cs.CV 版本更新 62%

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

何时称苹果为红色:人类遵循内省规则,而视觉语言模型却不遵循

Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

机构 * University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了视觉语言模型(VLMs)在何时会表现出意外行为,以及模型是否能可靠预测自身行为,发现VLMs系统性违反内省规则,而人类则遵循规则。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07436 2026-08-19 cs.AI cs.CL cs.CR 版本更新 62%

The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

盲选策展人:有偏见的评判者如何在自我进化的智能体中悄然阻碍技能淘汰

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(亚马逊云科技生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体中,有偏见的评判者对技能淘汰的影响。通过损坏奖励分析等方法发现,“误判通过”偏差会导致技能淘汰机制失效,此为行为安全结果。还提出廉价审计可判断评判者是否越过阈值影响智能体。

Comments Published at COLM 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17231 2026-08-19 cs.LG cs.CL 版本更新 62%

FishBack: Pullback Fisher Geometry for Optimal Activation Steering in Transformers

FishBack: 用于变换器中最优激活引导的反向费舍尔几何

Sihan Wang, Jiayi Zhao, Qingyan Cao, Hongbo Yao, Lin Shu

机构 * Sihan Wang, 1 Jiayi Zhao(1 王世涵,1 赵佳怡)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FishBack框架,通过反向费舍尔几何优化变换器中的激活引导,解决激活空间欧几里得假设失效的问题,提出闭式引导方程并实现迭代优化。

Comments Preprint. 22 pages, 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13741 2026-08-18 cs.CL cs.LG 版本更新 62%

GALA: Generation-Aware Cross-Modal Alignment for Text-to-Time-Series Synthesis

GALA:面向文本到时间序列合成的生成感知跨模态对齐

Haochen Zhang, Gengwei Zhang, Laura Yao, Nicholas Konz, Tianlong Chen

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对文本到时间序列合成中条件表示与信号模态不匹配的问题,提出GALA两阶段跨模态对齐方法,在TSFragment-600K数据集上实现SOTA,打破了生成器内部文本编码器的保真度与贴合度权衡。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14882 2026-08-18 cs.IR cs.AI cs.CL 版本更新 62%

Does generative AI supersede supervised XMLC? A Benchmark Study on Automated Subject Indexing with German Scientific Literature

生成式人工智能是否取代了监督式XMLC?关于德国科学文献自动主题索引的基准研究

Maximilian Kähler, Katja Konermann, Lisa Kluge, Markus Schumacher

机构 * Deutsche Nationalbibliothek(德国国家图书馆)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究德国科学文献自动主题索引任务,对比监督式XMLC方法、经典词汇匹配基线及基于大语言模型的方法,发现基于Transformer密集特征的监督式XMLC算法在二元相关性指标最佳,基于大语言模型的生成式方法在分级相关性及长尾性能上更佳。

Comments Submitted to KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05018 2026-08-14 cs.AI cs.LG 版本更新 62%

Short-term load forecasting under EU-AI Act Requirements in Safety-Critical Environments: Results from a 41-day live challenge on the aggregated German transmission-grid load

安全关键环境下符合欧盟AI法案要求的短期负荷预测:德国输电电网聚合负荷41天在线挑战赛结果

Thomas Bartz-Beielstein, Inalbek Akiev, Lalo Mohamad

机构 * THK-AI Research Cluster(THK-AI研究集群)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过41天在线挑战赛验证,符合欧盟AI法案要求的spotforecast2-safe短期负荷预测流程,在德国输电电网聚合负荷预测中优于ENTSO-E基线,其本地模型性能可与超1亿参数的chronos-2等大模型媲美。

Comments Version 3. 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09700 2026-08-14 cs.LG cs.AI 版本更新 62%

Cueless EEG imagined speech for subject identification: dataset and benchmarks

无提示EEG想象言语用于受试者识别:数据集与基准测试

Ali Derakhshesh, Zahra Dehghanian, Reza Ebrahimpour, Hamid R. Rabiee

机构 * Department of Computer Engineering, Sharif University of Technology(沙斐大学计算机工程系) Center for Cognitive Science, Institute for Convergence Science and Technology (ICST)(融合科学与技术研究所认知科学中心) Sharif University of Technology(沙斐大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出无提示EEG想象言语范式,通过自然选择和想象语义词实现高准确率的受试者识别,展示了其在脑机接口中的应用潜力。

Journal ref IEEE Transactions on Biometrics, Behavior, and Identity Science ( Volume: 8, Issue: 2, March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06110 2026-08-12 cs.AI cs.CL 版本更新 62%

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

ECHO:具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手

Abdulkadir Külçe, Alihan Esen, Çağla Fikir, Berke Kurt, Kuzey Arar, Gökhan Ercan, Faik Boray Tek

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手ECHO,其核心聊天机器人、安全层、语音评估模块均达特定性能指标,且可在消费级硬件运行,符合数据保护法规。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02673 2026-08-12 cs.SD cs.AI cs.CL eess.AS 版本更新 62%

dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model

dots.tts.edit:基于连续自回归模型的精确可控语音编辑

Hankun Wang, Bohan Li, Shi Lian, Xiaoyu Gu, Jing Peng, Da Zheng, Yiwei Guo, Colin Zhang, Kai Yu

机构 * dots.tts Team(dots.tts团队)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出dots.tts.edit语音编辑工具,采用XML风格结构化指令接口,基于连续自回归TTS模型,在doteBench评估中表现优异,音频质量与现有系统相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26574 2026-08-11 cs.CR cs.AI cs.LG 版本更新 62%

Attack Ensembles Expose a Safety-Utility Trade-off in Black-Box Guard Defenses Against Encoded VLM Jailbreaks

恢复、解码、再防护:针对编码型VLM越狱的防护无关型防御放大技术

Haoyu Zhang, Zhuoxi Wang, Shibo Zheng, Yi Feng, Xiao Luo, Zijian Xiao, Haowen Xu, Xiangchen Guan, Mohammad Zandsalimy, Shanu Sushmita

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出防护无关型的恢复-解码放大器,评估其对11种攻击集成的编码型VLM越狱防御效果,发现其存在安全-效用上限,贡献了放大器、集成评估方法及防御适用场景图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22357 2026-08-11 cs.CL cs.CV cs.LG 版本更新 62%

ORBIT: Training-Free Multi-Attribute Behavioral Steering via Orthogonal Subspace Rotation

ORBIT: 通过正交子空间旋转实现无训练的多属性行为引导

Narges Ghasemi, Amir Ziashahabi, Salman Avestimehr, Jonathan May

机构 * Information Sciences Institute, University of Southern California(南加州大学信息科学研究所) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出ORBIT方法,利用奇异值分解构建联合子空间并施加单一旋转,实现无训练的多属性行为引导,平衡多个属性并保持输出连贯性。

Comments v2: Updated technical details and added supplementary evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04203 2026-08-11 cs.CL cs.CV cs.LG cs.SE 版本更新 62%

FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback

FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试

Xueqing Wu, Zihan Xue, Da Yin, Shuyan Zhou, Kai-Wei Chang, Nanyun Peng, Yeming Wen

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of California, Los Angeles(加州大学洛杉矶分校) Duke University(杜克大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。

Comments CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02687 2026-08-11 cs.AI cs.CL 版本更新 62%

The Collaboration Gap: Exploration and Benchmarking of Open-World Agentic Cooperation

协作差距:开放世界智能体协作的探索与基准测试

Tim R. Davidson, Adam Fourney, Saleema Amershi, Robert West, Eric Horvitz, Ece Kamar

机构 * EPFL(瑞士联邦理工学院) Microsoft Research(微软研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出协作迷宫求解基准,评估32个模型的协作能力,发现模型存在协作差距,提出中继推理等缓解措施,强调协作相关评估、训练与交互设计的重要性。

Comments Accepted to COLM 2026, code available at https://github.com/trdavidson/collaboration_gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27853 2026-08-10 cs.CL cs.AI q-fin.CP 版本更新 62%

FinanceHarness: Autonomous Financial Deep Research Framework

FinanceHarness:自主金融深度研究框架

Yijia Xiao, Rujun Han, Yanfei Chen, Zifeng Wang, Ke Jiang, Zhongying CuiZhu, Vishy Tirumalashetty, Wei Wang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 FinanceHarness是一款端到端自动化金融深度研究的自主框架,结合自主智能体与金融专用工具,在FinanceGym基准上大幅提升了金融研究评分规则得分。

Comments FinanceHarness available at https://github.com/Yijia-Xiao/FinanceHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02616 2026-08-07 cs.CL cs.AI 版本更新 62%

OpenAI Privacy Filter: A Cross-Lingual, Cross-Domain PII Evaluation Across 32 Benchmarks

评估OpenAI的隐私过滤器:在42个基准测试中开展跨语言、跨领域的个人身份信息(PII)检测

Rohith Uppala

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究首次系统评估OpenAI的15亿参数PII检测器OPF,在42个跨语言跨领域基准中对比其与Presidio、XLM-RoBERTa、GPT-4o的PII检测性能,揭示其优势与缺陷。

Comments 9 pages, 2 figures, 9 tables; evaluation of a production PII detection system

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06052 2026-08-06 cs.CL cs.AI 版本更新 62%

A Survey of Agent Memory in the Second Half: Towards Self-Evolving and Long-Horizon Agents

重新思考基础智能体的内存机制:第二阶段综述

Wei-Chieh Huang, Weizhi Zhang, Yueqing Liang, Yuanchen Bei, Yankai Chen, Tao Feng, Xinyu Pan, Zhen Tan, Yu Wang, Tianxin Wei, Shanglin Wu, Ruiyao Xu, Liangwei Yang, Rui Yang, Wooseong Yang, Chin-Yuan Yeh, Hanrong Zhang, Haozhen Zhang, Siqi Zhu, Henry Peng Zou, Wanjia Zhao, Song Wang, Wujiang Xu, Zixuan Ke, Zheng Hui, Dawei Li, Yaozu Wu, Langzhou He, Chen Wang, Xiongxiao Xu, Baixiang Huang, Juntao Tan, Shelby Heinecke, Huan Wang, Caiming Xiong, Ahmed A. Metwally, Jun Yan, Chen-Yu Lee, Hanqing Zeng, Yinglong Xia, Xiaokai Wei, Ali Payani, Yu Wang, Haitong Ma, Wenya Wang, Chenguang Wang, Yu Zhang, Xin Eric Wang, Yongfeng Zhang, Jiaxuan You, Hanghang Tong, Xiao Luo, Xue Liu, Yizhou Sun, Wei Wang, Julian McAuley, James Zou, Jiawei Han, Philip S. Yu, Kai Shu

机构 * UIC(伊利诺伊大学香槟分校) IIT(伊利诺伊理工学院) UIUC(伊利诺伊大学厄巴纳-香槟分校) UW–Madison(威斯康星大学麦迪逊分校) ASU(亚利桑那州立大学) Emory(埃默里大学) Northwestern(西北大学) NTU(国立台湾大学) UCF(佛罗里达大学) Rutgers(新泽西罗格斯大学) Cambridge(剑桥大学) Harvard(哈佛大学) UTokyo(东京大学) UCSD(加州大学圣地亚哥分校) UCSC(加州大学圣塔克鲁斯分校) TAMU(德克萨斯大学奥斯汀分校) UCSB(加州大学圣塔芭芭拉分校) MBZUAI(马克斯·普朗克人工智能研究所) McGill(麦吉尔大学) UCLA(加州大学洛杉矶分校) Stanford(斯坦福大学) Salesforce Google(谷歌) Meta Roblox Cisco(思科) Capital One

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了基础智能体内存机制,从内存基质、认知机制和主体维度分析内存在不同拓扑结构下的实现,并探讨内存操作的学习策略与评估指标。

Comments Accepted at Transactions on Machine Learning Research (TMLR) with Survey Certification. Project page: https://github.com/AgentMemoryWorld/Awesome-Agent-Memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15212 2026-08-05 cs.AI cs.LG 版本更新 62%

Modeling Matches as Language: A Generative Transformer Approach for Counterfactual Player Valuation in Football

将比赛建模为语言:一种生成式Transformer方法用于足球中的反事实球员估值

Miru Hong, Minho Lee, Geonhee Jo, Hyeokje Cho, Hyunsung Kim, Pascal Bauer, Sang-Ki Ko

机构 * Department of Artificial Intelligence, University of Seoul, Seoul, Republic of Korea(首尔大学人工智能系) Institute for Sports and Preventive Medicine, Saarland University, Saarbrücken, Germany(萨尔兰州预防医学研究所) Chair for Sports Analytics, Saarland University(萨尔兰州体育分析教授职位)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScoutGPT,通过将足球比赛事件视为序列标记,利用生成式Transformer模型模拟反事实球员估值,提升对球员转会效果的预测能力。

Comments 21 pages, 4 figures, 11 tables. Accepted at ECML-PKDD 2026 (Applied Data Science Track)

详情

展开后加载摘要…

URL PDF HTML 收藏