arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2604.27539 2026-05-01 cs.HC cs.AI 57%

Knowledge Affordances for Hybrid Human-AI Information Seeking

知识 affordance 用于混合人类-人工智能信息获取

Irene Celino

机构 * Cefriel

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出知识 affordance 概念,用于系统化混合环境中信息获取机会识别,连接多个研究领域,探索更透明和共享的理解系统。

Comments 10 pages, accepted at Hybrid Human Artificial Intelligence Conference (HHAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27297 2026-05-01 cs.AI physics.comp-ph 57%

Machine Collective Intelligence for Explainable Scientific Discovery

机器群体智能用于可解释的科学发现

Gyoung S. Na, Chanyoung Park

机构 * Korea Research Institute of Chemical Technology(韩国化学技术研究院) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出机器群体智能,结合符号主义与元启发式方法,实现自主进化发现 governing equations,无需人工知识,显著降低 extrapolation error。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27156 2026-05-01 cs.AI 57%

Interval Orders, Biorders and Credibility-limited Belief Revision

区间序、双序与可信度限制的信念修正

Richard Booth, Ivan Varzinczak

机构 * Cardiff University, United Kingdom(Cardiff大学,英国) Université Sorbonne Paris Nord, Inserm, Sorbonne Université, Limics(巴黎-索邦大学,Inserm,索邦大学,Limics) CAIR, University of Cape Town, South Africa(开普敦大学,南非) ISTI-CNR, Pisa, Italy(意大利比萨CNR ISTI)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了区间序和双序在信念修正中的应用,提出了非优先修正家族,探讨了可信度限制下的信念修正方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09408 2026-05-01 cs.AI 57%

HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?

HiL-Bench (Human-in-Loop Benchmark): 代理何时该请求帮助?

Mohamed Elfeki, Tu Trinh, Kelvin Luu, Guangze Luo, Nathan Hunt, Ernesto Montoya, Nandan Marwaha, Yannis He, Charles Wang, Fernando Crabedo, Alessa Castilo, Bing Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 HiL-Bench通过评估代理在任务中何时请求帮助的能力,揭示了当前基准测试的不足。核心指标Ask-F1衡量代理在请求与猜测之间的平衡,证明判断力可通过强化学习提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15808 2026-04-30 cs.AI 57%

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

推理时的验证扩展:通过测试时的评分指南验证实现自我进化深度研究代理

Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室) Singapore Management University(新加坡管理学院) The Renmin University of China(中国人民大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出通过测试时评分指南验证实现深度研究代理的自我进化,通过迭代验证策略模型输出,提升验证能力,实验显示在GAIA和XBench-DeepSearch上准确率提升8%-11%。

Comments ACL'2026-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20714 2026-04-30 cs.CV cs.AI 57%

Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation

Inferix:基于块扩散的下一代世界模拟推理引擎

Inferix Team, Tianyu Feng, Yizeng Han, Jiahao He, Yuanyu He, Xi Lin, Teng Liu, Hanfeng Lu, Jiasheng Tang, Wei Wang, Zhiyuan Wang, Jichao Wu, Mingyang Yang, Yinghao Yu, Zeyu Zhang, Bohan Zhuang

机构 * Inferix Team(Inferix 团队)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 Inferix 是一种基于块扩散的下一代推理引擎,通过优化半自回归解码过程实现沉浸式世界合成,支持交互式视频流和性能分析,结合 LV-Bench 提供高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25614 2026-04-29 cs.AI 57%

HotComment: A Benchmark for Evaluating Popularity of Online Comments

HotComment: 一个评估在线评论流行度的基准

Yafeng Wu, Yunyao Zhang, Liliang Ye, Guiyi Zeng, Junqing Yu, Chen Xu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出HotComment基准,通过内容质量、流行度预测和用户行为模拟三个维度评估在线评论的流行度,同时引入StyleCmt提升社交共振效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25152 2026-04-29 cs.CR cs.CL 57%

MGTEVAL: An Interactive Platform for Systemtic Evaluation of Machine-Generated Text Detectors

MGTEVAL:一种用于机器生成文本检测器系统性评估的交互平台

Yuanfan Li, Qi Zhou, Chengzhengxu Li, Zhaohan Zhang, Chenxu Zhao, Zepu Ruan, Chao Shen, Xiaoming Liu

机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) Queen Mary University of London(伦敦大学女王学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 MGTEVAL平台通过统一接口构建自定义基准、应用文本攻击测试集、训练检测器并评估性能,解决MGT检测评估碎片化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25122 2026-04-29 cs.CV cs.AI 57%

M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

M$^3$-VQA:多模态、多实体、多跳视觉问答的基准测试

Jiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 M$^3$-VQA引入了多实体问题,要求模型在多个文档间进行顺序和并行多跳推理,揭示了多模态大语言模型在知识获取和推理方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11443 2026-04-29 cs.CL cs.SI 57%

A Transformer-Based Cross-Platform Analysis of Public Discourse on the 15-Minute City Paradigm

基于Transformer的跨平台公共 discourse 对15分钟城市范式的分析

Gaurab Chhetri, Darrell Anderson, Boniphace Kutela, Subasish Das

机构 * 1 College of Science Engineering, Texas State University, San Marcos, Texas, USA Email 3 Texas A\&M Transportation Institute, Texas A\&M University, Houston, Texas, USA Email

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 本研究首次跨平台分析15分钟城市概念的公共 discourse,采用压缩Transformer模型进行多平台情感分类,发现DistilRoBERTa表现最佳,MiniLM一致性最高,揭示平台特性差异及压缩模型的高效优势。

Comments This is the author's preprint version of a paper accepted for presentation at the 24th International Conference on Machine Learning and Applications (ICMLA 2025), December 3-5, 2025, Florida, USA. The final published version will appear in the official IEEE proceedings. Conference site: https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24579 2026-04-28 cs.SE 57%

Measuring the Unmeasurable: Markov Chain Reliability for LLM Agents

测量不可测量的:用于LLM代理的马尔可夫链可靠性

Phat T. Tran-Truong, Xuan-Bach Le

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出TraceToChain方法,通过构建吸收离散时间马尔可夫链模型,对LLM代理执行轨迹进行可靠性分析,提供更精确的成功时间分布估计和不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24461 2026-04-28 cs.HC cs.AI 57%

Measuring Successful Cooperation in Human-AI Teamwork: Development and Validation of the Perceived Cooperativity and Teaming Perception Scales

在人类-人工智能协作中测量成功协作:感知协作性与团队感知量表的开发与验证

Christiane Attig, Christiane Wiebel-Herboth, Patricia Wollstadt, Tim Schrills, Mourad Zoubir, Thomas Franke

机构 * Honda Research Institute Europe GmbH(本田欧洲研究院) Institute of Human-Centered Interactive Systems(人机交互系统研究所) University of Lübeck(吕贝克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文开发并验证了感知协作性量表和团队感知量表,用于评估人类-人工智能协作的主观质量,通过三个研究验证了量表的有效性和构造效度。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23653 2026-04-28 cs.CV cs.AI 57%

ResAF-Net: An Anchor-Free Attention-Based Network for Tree Detection and Agricultural Mapping in Palestine

ResAF-Net:一种基于注意力的无锚点网络用于巴勒斯坦树木检测和农业制图

Rabee Al-Qasem

机构 * AI-Developer Ministry of Labor - GGateway.ps(AI开发者劳动部 - GGateway.ps)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出ResAF-Net,一种基于卫星的树木检测框架,用于资源受限环境下的大规模农业监测。该框架结合了ResNet-50编码器、ASPP、特征融合阶段、多头自注意力细化模块和无锚点FCOS检测头,实现了在密集和异质场景中对树木的高效定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07709 2026-04-28 cs.AI 57%

MAGELLAN: Metacognitive predictions of learning progress guide autotelic LLM agents in large goal spaces

MAGELLAN:元认知预测学习进度指导自主LLM代理在大规模目标空间中学习

Loris Gaven, Thomas Carta, Clément Romac, Cédric Colas, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Department of XXX, University of YYY, Location, Country(XXX部门,YYYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Inria (Flowers), University of Bordeaux, France(Inria(Flowers),波尔多大学,法国) MIT, Computational Cognitive Science Lab, Cambridge, MA, USA(麻省理工学院,计算认知科学实验室,马萨诸塞州剑桥,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MAGELLAN通过元认知预测学习进度,使LLM代理在大规模目标空间中高效优先目标,提升学习效率和适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23148 2026-04-28 cs.AI 57%

PhySE: A Psychological Framework for Real-Time AR-LLM Social Engineering Attacks

PhySE: 一种用于实时AR-LLM社会工程攻击的心理学框架

Tianlong Yu, Yang Yang, Ziyi Zhou, Jiaying Xu, Siwei Li, Tong Guan, Kailong Wang, Ting Bi

机构 * Hubei University(湖北大学) Apple Inc(苹果公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 PhySE通过视觉语言模型的社会上下文训练和自适应心理代理,解决AR-LLM社会工程攻击中的冷启动个性化和静态攻击策略问题,提升实时交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23141 2026-04-28 cs.CR cs.AI 57%

UNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering Attacks

UNSEEN: 一种跨栈LLM去学习防御对抗AR-LLM社会工程攻击

Tianlong Yu, Yang Yang, Xiao Luo, Lihong Liu, Fudu Xing, Zui Tao, Kailong Wang, Gaoyang Liu, Ting Bi

机构 * Hubei University(湖北大学) University of Southern California(南加州大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对AR-LLM社会工程攻击,提出UNSEEN跨栈防御机制,结合AR访问控制层、基于F-RMU的LLM去学习和运行时代理防护,通过用户研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18803 2026-04-28 cs.CV cs.AI 57%

LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models

用于评估视觉-语言模型中语气诱导幻觉的LLM-as-Judge框架

Zhiyuan Jiang, Weihao Hong, Xinlei Guan, Tejaswi Dhandu, Miles Q. Li, Meng Xu, Kuan Huang, Umamaheswara Rao Tida, Bingyu Shen, Daehan Kwak, Boyang Li

机构 * Kean University(凯恩大学) North Dakota State University(北达科他州立大学) McGill University(麦吉尔大学) University of Notre Dame(圣母大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出Ghost-100基准,通过结构化提示强度框架评估不同模型在提示压力下的表现,发现H-Rate和H-Score在模型家族间显著分化,且某些模型对语气敏感度非单调。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00081 2026-04-28 cs.CR cs.AI 57%

Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies

结合大语言模型和领域本体的透明网络威胁情报赋能

Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

机构 * Department of Information Engineering, University of Brescia, Italy(布雷西亚大学信息工程系) School of Computer Science and Informatics, Cardiff University, United Kingdom(卡迪夫大学计算机科学与信息学学院) Department of Electronics and Computer Science, University of Southampton, United Kingdom(南安普顿大学电子与计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出结合本体驱动的结构化输出与大语言模型,构建提升网络安全日志信息提取准确性和可解释性的AI代理,通过领域本体和SHACL约束提高语义有效性。

Comments 14 pages, 3 figures, 6 tables, presented at the 1st workshops on eXplainable AI, Knowledge Representation and Knowledge Graphs (XAI-KRKG) and User-Centered Explanations in XAI Workshop (UCEX-XAI), October 25-30, 2025, Bologna, Italy

Journal ref Joint Proceedings of the 1st workshops on eXplainable AI, Knowledge Representation and Knowledge Graphs (XAI-KRKG) and User-Centered Explanations in XAI Workshop (UCEX-XAI), 2025, CEUR Workshop proceedings, volume 4172, pages 95-108

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22230 2026-04-27 econ.GN cs.GT cs.LG q-fin.EC 57%

On Benchmark Hacking in ML Contests: Modeling, Insights and Design

在机器学习竞赛中基准黑客现象:建模、洞察与设计

Xiaoyun Qiu, Yang Yu, Haifeng Xu

机构 * Department of Economics, Dartmouth College(达特茅斯学院经济系) Sloan & CSAIL, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院与计算机科学与人工智能实验室) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了机器学习竞赛中基准黑客现象,通过建模揭示其战略均衡,并通过实证支持理论预测,指出奖励结构对竞赛结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22110 2026-04-27 cs.LG 57%

Do Not Imitate, Reinforce: Iterative Classification via Belief Refinement

不要模仿,强化:通过信念细化的迭代分类

Mahdi Kallel, Johannes Tölle, Ahmed Hendawy, Carlo D'Eramo

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出RIC方法,通过强化学习替代传统模仿目标,实现迭代分类,提升预测校准性和计算分配能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21529 2026-04-24 cs.MA cs.AI 57%

Architectures for Robust Self-Organizing Energy Systems under Information and Control Constraints

面向信息与控制约束的鲁棒自组织能源系统架构

Emilie Frost, Astrid Nieße

机构 * Department of Computing Science, Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特定律大学计算机科学系) Distributed Artificial Intelligence, OFFIS - Institute for Information Technology(分布式人工智能,OFFIS信息技术研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出考虑信息访问限制和行动限制的观测器与控制器架构变体,评估不同架构下的控制器动作可能性,以提升基于智能体的能源系统在现实应用中的鲁棒性。

Comments This preprint has not undergone peer review (when applicable) or any post-submission improvements or corrections. The Version of Record of this contribution will be published in Agents and Artificial Intelligence, Lecture Notes in Computer Science, and available online at https://doi.org/10.1007/978-3-032-25029-2_19

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21508 2026-04-24 cs.AI q-bio.BM 57%

BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature

BioMiner:一种用于从文献中自动挖掘蛋白质-配体生物活性数据的多模态系统

Jiaxian Yan, Jintao Zhu, Yuhang Yang, Qi Liu, Kai Zhang, Zaixi Zhang, Xukai Liu, Boyan Zhang, Kaiyuan Gao, Jinchuan Xiao, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) Princeton University(普林斯顿大学) Huazhong University of Science and Technology(华中科技大学) Infinite Intelligence Pharma(无限智能制药)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 BioMiner通过多模态框架提取生物活性数据,解决手动整理与文献增长不匹配的问题,其核心方法结合直接推理和化学结构解析,实现生物活性三元组的高准确率提取。

Comments 20 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21430 2026-04-24 cs.AI 57%

Brief chatbot interactions produce lasting changes in human moral values

简短的聊天机器人互动会产生持久的人类道德价值观变化

Yue Teng, Qianer Zhong, Kim Mai Tich Nguyen Thordsen, Christian Montag, Benjamin Becker

机构 * Department of Psychology, The University of Hong Kong(香港大学心理学系) Techno-Entrepreneurship Core, The University of Hong Kong(香港大学技术企业家精神核心) Department of Psychology, University of Copenhagen(哥本哈根大学心理学系) Centre for Cognitive and Brain Sciences, Institute of Collaborative Innovation, University of Macau(澳门大学协同创新研究院认知与脑科学中心) Department of Psychology, Faculty of Social Sciences, University of Macau(澳门大学社会科学学院心理学系) Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科技学院计算机与信息科学系) SRT AI, Society & Social Dynamics, Faculty of Social Sciences, The University of Hong Kong(SRT AI,社会与社会动态,香港大学社会科学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了指令性AI对话是否能改变道德判断,发现简短互动导致道德评价显著变化,且随时间推移效应增强,但控制条件无变化,表明潜在的未察觉道德价值观操控风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20190 2026-04-23 cs.CV cs.LG 57%

WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

WildFireVQA: 一种大规模的辐射热视觉问答基准用于空中 wildfire 监测

Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik, Camren J. Khoury, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出WildFireVQA基准,整合RGB影像与辐射热数据,包含6097个样本及207298个问题,评估多模态推理能力,揭示RGB和检索增强热上下文在 wildfire 监测中的表现差异。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR-W 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08948 2026-04-23 cs.CL 57%

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice

TaxPraBen:一种可扩展的基准,用于评估LLM在中文实际税收实践中的结构化表现

Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yue

机构 * Yunnan University(云南大学) Wuhan University(武汉大学) Jianghan University(江汉大学) Nanjing Audit University(南京审计大学)

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 本文提出TaxPraBen,首个专注于中文税收实践的基准,结合10项传统任务和3项创新场景,评估19种LLM在税收实践中的表现,揭示封闭源大参数LLM和中文LLM的优势。

Journal ref ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20805 2026-04-23 cs.CY cs.AI cs.MA 57%

Relative Principals, Pluralistic Alignment, and the Structural Value Alignment Problem

相对委托人、多元主义对齐与结构价值对齐问题

Travis LaCroix

机构 * Durham University(杜伦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出价值对齐问题应被视为治理结构问题,通过三个轴框架分析对齐的成因,强调对齐是治理而非工程问题,需通过持续的制度过程管理。

Comments Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19071 2026-04-22 cs.CL 57%

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

HoWToBench: LLM在人类水平写作能力的综合评估方法:写作树

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出Tree-of-Writing方法,通过树状流程结构评估LLM写作能力,构建包含12类文体和1302条指令的中文写作基准,实现与人类判断的高相关性。

Comments 49 pages, 6 figures, 19 tables, ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17894 2026-04-21 cs.CL 57%

Automatic Slide Updating with User-Defined Dynamic Templates and Natural Language Instructions

基于用户定义动态模板和自然语言指令的自动幻灯片更新

Kun Zhou, Jiakai He, Wenmian Yang, Zhensheng Wang, Yiquan Zhang, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出DynaSlide基准,结合多模态解析和自然语言指令,实现幻灯片动态更新,保留布局与样式,并设计评估协议揭示未来研究挑战。

Comments To appear in Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16120 2026-04-21 cs.CL 57%

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

语言模型不知道你想要什么:评估深度研究中个性化需求需要真实用户

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik

机构 * University of Maryland(马里兰大学) Allen Institute for Artificial Intelligence(人工智能研究院) New York University(纽约大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出MyScholarQA系统,通过用户兴趣分析、个性化查询响应和报告生成,评估深度研究中个性化需求,发现LLM评估存在不足,需真实用户参与以实现有效个性化。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01943 2026-04-21 cs.LG 57%

SynRXN: An Open Benchmark and Curated Dataset for Computational Reaction Modeling

SynRXN:计算反应建模的开放基准和精心编纂的数据集

Tieu-Long Phan, Nhu-Ngoc Nguyen Song, Peter F. Stadler

机构 * Bioinformatics Group, Department of Computer Science \& Interdisciplinary Center for Bioinformatics \& School for Embedded Composite Artificial Intelligence (SECAI), Leipzig University, H \"a rtelstra e 16–18, D-04107 Leipzig, Germany School of Pharmacy, University of Medicine

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 SynRXN 提供了一个统一的基准框架和开放数据资源,用于计算机辅助合成规划。通过分解端到端合成规划为五个任务家族,提供透明的评估流程和定制化的评估指标,支持严谨的消融测试和压力测试。

Comments 31 pages (including references), 3 figures, 7 tables

Journal ref Scientific Data 13, 625 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏