RDBLearn: Simple In-Context Prediction Over Relational Databases
RDBLearn: 关系数据库中的简单上下文预测
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 RDBLearn通过关系数据库中的上下文学习方法,实现了对多表关联数据的高效预测,优于传统监督基线。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
RDBLearn: 关系数据库中的简单上下文预测
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 RDBLearn通过关系数据库中的上下文学习方法,实现了对多表关联数据的高效预测,优于传统监督基线。
Robo-Saber:生成和模拟虚拟现实玩家
机构 * Aalto University(阿alto大学) ; University of California, Berkeley(加州大学伯克利分校) ; NVIDIA ; Simon Fraser University(西蒙弗雷泽大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 Robo-Saber通过生成和模拟虚拟现实玩家行为,为VR游戏测试提供了一种基于风格范例和数据集训练的运动生成系统。
Comments 13 pages, 15 figures. Accepted to Eurographics 2026. Project page: https://robo-saber.github.io/
迈向更标准化的AI评估:从模型到代理
机构 * G42
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文探讨了AI评估从模型向代理转变的必要性,强调评估应作为测量学科而非表演舞台,以在非确定性系统中调节信任和治理。
Comments 19 pages, 3 figures
学习具有保证的最优和样本高效的决策策略
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种样本高效且具有保证的学习方法,用于在存在隐藏混杂因素的情况下学习最优决策策略,并通过实验验证了其在现实决策中的有效性。
Comments A thesis submitted for the degree of DPhil in Computer Science at Oxford
注意GAP:在LLM代理中,文本安全不转移到工具调用安全
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。
Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark
LiveClin: 一种无泄漏的实时临床基准
机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) ; Ant Healthcare, Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; The Ohio State University(俄亥俄州立大学)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 LiveClin通过实时更新的临床病例基准,评估医学大语言模型在真实临床场景中的表现,揭示其在复杂医疗任务中的挑战。
为何合成仍不真实:一种用于客服对话生成的诊断框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出一种诊断框架,用于评估客服对话生成中合成数据的真实性和实用性,揭示当前生成策略在情感和对话真实性方面的不足。
UniST-Pred: 一种用于交通网络中断下的时空交通预测的鲁棒统一框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 UniST-Pred提出了一种统一的时空预测框架,通过解耦时间建模与空间表示学习,实现对交通网络中断下的鲁棒预测。
评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Yale University(耶鲁大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究揭示了基于评分标准的LLM裁判中隐蔽的偏好漂移问题,通过评分标准攻击可系统性降低目标领域准确性,影响模型对齐流程。
TemporalBench: 一个用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的基准
机构 * University of Southern California(美国南加州大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 TemporalBench是一个多领域基准,用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的时序推理能力。
迈向实用的自主网络操作仿真
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Royal Military College of Canada(加拿大皇家军事学院) ; Department of Mathematics and Computer Science(数学与计算机科学系) ; Defence Research and Development Canada(加拿大国防研究发展署) ; Department of Computer and Software Engineering(计算机与软件工程系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出扩展CybORG环境以增强RL训练性能,通过引入新动作和修改奖励信号,提升自主网络操作仿真的真实性与有效性。
GISA:通用信息检索助手的基准测试
机构 * Renmin University of China(中国人民大学) ; Kuaishou Technology(快手科技)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL
AI总结 GISA是一个针对通用信息检索助手的基准测试,包含373个人工设计的查询,旨在评估信息检索任务中深度推理与信息聚合的能力。
Comments Project repo: https://github.com/RUC-NLPIR/GISA
从莱登到欢乐岛:常数Potts模型在社区检测中的应用作为享乐博弈
机构 * Federal University of Rio de Janeiro (UFRJ)(里约热内卢联邦大学) ; National Institute for Research in Digital Science and Technology (Inria)(数字科学与技术国家研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于享乐博弈的常数Potts模型用于社区检测,通过伪多项式时间收敛到平衡划分,提升鲁棒性和准确性。
Comments Manuscript submitted to Physica A: Statistical Mechanics and its Applications
Journal ref Felipe, L. L., Avrachenkov, K., & Menasché, D. S. (2025). From Leiden to Pleasure Island: The Constant Potts Model for community detection as a hedonic game. Physica A: Statistical Mechanics and its Applications, 130989
迈向协作大语言模型系统中路由器的公平且全面评估
机构 * Southern University of Science and Technology(南方科技大学) ; Institut Polytechnique de Paris(巴黎政治学院) ; Peking University(北京大学) ; Deepexi Technology Co. Ltd.(深醒科技有限公司) ; University of Edinburgh(爱丁堡大学) ; Beihang University(北航) ; Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文提出RouterXBench框架和ProbeDirichlet路由器,通过内部隐藏状态提升路由能力与跨领域鲁棒性,实现对协作大语言模型系统中路由器的公平全面评估。
Comments Our code is publicly available at https://github.com/zhuchichi56/RouterXBench
EvoCodeBench:用于自演化LLM驱动编码系统的性能基准
机构 * Nanyang Technological University(南洋理工大学) ; East China University of Science and Technology(东华大学) ; Guangdong Ocean University(广东海洋大学) ; City University of Hong Kong(香港城市大学) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 EvoCodeBench通过跨语言对比和人类表现评估,评估自演化LLM驱动编码系统的性能提升与效率改进。
通用智能体的主动评估:问题定义与基线算法比较
机构 * Google DeepMind(谷歌DeepMind) ; Google DeepMind, University of Waterloo(谷歌深Mind、滑铁卢大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通用智能体的主动评估框架,通过比较基线算法发现Elo系统在实践中可靠,而Soft Condorcet Optimization在真实评估中表现更优。
Comments AAMAS 2026
生成性提示内化
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Microsoft Research(微软研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 生成性提示内化通过联合训练方法实现复杂提示的内化,减少计算开销并提升模型性能。
Comments NAACL 2025 (Main Conference)
Journal ref NAACL 2025
PABU:面向高效LLM代理的进度感知信念更新
机构 * North Carolina State University, Raleigh, NC, USA(北卡罗来纳州立大学) ; University of California, Irvine, CA, USA(加州大学伊市分校) ; Amazon, Seattle, WA, USA(亚马逊公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 PABU通过显式建模任务进度和选择性保留历史信息,提升了LLM代理的任务完成效率和性能。
鲁棒性是一种函数,而不是一个数字:对基于视觉的驾驶OOD鲁棒性进行因素化的综合研究
机构 * University of Haifa(海法大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了基于视觉的驾驶OOD鲁棒性,通过因素分解发现ViT策略比CNN更鲁棒,季节和时间变化显著影响性能,FM特征在延迟成本下表现最佳,多环境训练能提升弱案例表现。
动态秩强化学习用于自适应低秩多头自注意力机制在大语言模型中
机构 * Faculty of Technology, Department of Computer Engineering, Sakarya University of Applied Sciences(技术学院,计算机工程系,萨克萨大学应用科学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出动态秩强化学习方法,通过强化学习优化注意力机制,实现低秩多头自注意力在大语言模型中的自适应调整,显著降低计算成本并保持模型性能。
Journal ref International Journal of Complexity in Applied Science and Technology, 2026
迈向高效探索的大型语言模型代理
机构 * Department of Computer Science(计算机科学系) ; Princeton University(普林斯顿大学) ; Department of Psychology(心理学系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出利用大型语言模型显式实现后验抽样强化学习算法,以提升自然语言任务中的探索效率。
Comments Accepted to the International Conference on Learning Representations (ICLR) 2026
大语言模型对齐的可验证性:行为评估下的规范不可区分性
机构 * Igor Santos-Grueiro(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了大语言模型对齐的可验证性,指出行为评估无法唯一确定潜在对齐,提出了规范不可区分性概念,并通过实验验证了在评估意识下行为基准的局限性。
Comments 10 pages. Theoretical analysis of behavioral alignment evaluation
超越长度:基于上下文的扩展与独立性作为儿童言语发展的敏感评估
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL
AI总结 本文提出了一种基于上下文的评估框架,通过扩展和独立性两个维度评估儿童言语的发展性,提升对儿童对话质量的敏感度。
Autodiscover: 一种基于图感知汤普森采样强化学习的推荐系统,用于主动学习中的冷启动不平衡挑战
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 AutoDiscover通过图感知的强化学习方法,解决主动学习中的冷启动问题,提升文献综述的筛选效率。
Comments Master's Thesis, University of Luxembourg in collaboration with Luxembourg Institute of Science and Technology (LIST). Supervised by Prof. Jun Pang and Dr. Eloi Durant
CRoSS:一种用于可扩展强化学习的连续机器人仿真套件,具有高任务多样性和真实物理仿真
机构 * Department of Computer Science(计算机科学系) ; Fulda University of Applied Sciences(弗鲁达应用科学大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 CRoSS是一种用于连续强化学习的机器人仿真套件,通过高任务多样性和真实物理仿真,提供可扩展且可重复的基准测试环境。
CoSQA+: 以测试驱动代理开创多选代码搜索基准
机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 CoSQA+通过测试驱动代理开创多选代码搜索基准,利用高质查询与多个合适代码配对,提升代码搜索准确率至93.9%。
Comments Accepted to TSE 2025. We provide the code and data at https://github.com/DeepSoftwareAnalytics/CoSQA_Plus
通过大语言模型提升认知代理
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 通过大语言模型提升认知代理,结合两者优势以提高效率和领域适应性。
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 38(1), 655-663 (2024)
BIRDTurk: BIRD文本到SQL数据集对土耳其语的适应
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 BIRDTurk是首个将BIRD文本到SQL基准适应到土耳其语的数据集,通过受控翻译流程保持SQL逻辑结构,评估了代理推理和监督微调在土耳其语中的表现,揭示了语言差异对性能的影响。
Comments Accepted by EACL 2026 SIGTURK
基于掩码潜在变换器的精准高效世界建模
机构 * Computer Vision Lab, CAIDAS \& IFI, University of Würzburg, Germany
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 EMERALD通过高效掩码潜在变换器实现精准高效的世界建模,首次在1000万环境步骤内超越人类专家性能。
SWE-World:在无Docker环境中构建软件工程代理
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽学校人工智能学院) ; BOSS Zhipin, Beijing, China(BOSS智聘,北京,中国)
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.SE
AI总结 SWE-World提出了一种无Docker环境的框架,利用学习模型预测执行结果,提升软件工程代理性能。