arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-28 至 2026-08-28 共收录 227 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 15 篇

2608.26991 2026-08-28 cs.AI 新提交 70%

ASIL: Replacing Screenshot-and-Click with Structured State and Semantic Actions

ASIL:用结构化状态与语义动作替代截图点击

Rui Xie, Lu Chen

机构 * Shanghai Jiao Tong University(上海交通大学) BIGAI(北京智源人工智能研究院)

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出ASIL智能体-软件交互层,以结构化状态与语义动作替代低效的截图点击界面,在多应用基准任务中表现优于截图点击,还可提升Qwen系列模型的性能。

Comments Accepted to Findings of EMNLP 2026. 19 pages, 7 figures: 9-page main paper followed by limitations, ethics, acknowledgments, references, and appendices A-E. Project page: https://sharryxr.github.io/ASIL/

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26295 2026-08-28 cs.CL cs.AI cs.MA cs.SE 新提交 67%

MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models

MemToC:大型语言模型中记忆-工具冲突解决的基准测试

Arseniy Varlamov, Rishat Zinnatullin, Elisei Rykov, Alexander Panchenko, Ilseyar Alimova

机构 * Central University(中央大学) Ural Federal University(乌拉尔联邦大学) Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院) AIRI(人工智能研究院(AIRI))

专题命中 记忆与上下文管理 :tool use(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 该研究提出MemToC基准,测试工具增强型LLM在记忆与工具返回冲突时的仲裁能力,发现指令调优模型在多数情况遵循工具,微调可改善仲裁但需兼顾工具使用与弃权表现。

Comments 26 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26730 2026-08-28 cs.AI 新提交 57%

Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training

知晓何时不重用:自主大语言模型后训练中的条件经验迁移

Tingyun Li, Wenfeng Feng, Weiqing Li, Abudukelimu Wuerkaixi, Guohua Liu, Yuewei Zhang

机构 * Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 记忆与上下文管理 :function calling(abstract);分类 cs.AI

AI总结 本研究针对自主大语言模型后训练中经验重用的决策问题,提出BCIT方法,通过绑定效果上下文、检查条件等减少有害更新,提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04562 2026-08-28 cs.AI cs.NE 版本更新 57%

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

用于消除大语言模型认知熵的滚动系数的海维赛德连续性

MY Pitsane, Hope Mogale

机构 * North-West University, RSA(南非北开普大学) University of Pretoria, RSA(南非彼得里亚大学) Mankind Research Labs, Sandton(沙顿人类研究实验室)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。

Comments Major revisions are going to be implemented and the paper will be restored later

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27215 2026-08-28 cs.CR 新提交 50%

From Security Events to Conflict States: A Three-layer Cyber Defense Scenario Model for Enhanced Cyber Situational Awareness

从安全事件到冲突状态:用于增强网络态势感知的三层网络防御场景模型

Miguel Requena Micó, Mario Fernandez-Tarraga, Daniel Díaz-López, Sergio López Bernal, Gregorio Martínez Pérez

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一种面向任务的网络防御框架,基于三层集成概率模型与NetLogo仿真原型,可增强网络态势感知,经多维度评估验证其能实现攻击进程、不确定性管理等环节的连贯关联。

Comments 18 pages, 3 figures, 1 table, paper in proceedings of The International Conference on Availability, Reliability and Security, ARES 2026 in Linkoping, Sweden, August 24-27, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25061 2026-08-28 cond-mat.mtrl-sci physics.geo-ph 版本更新 50%

Learning and retrieval for warm-starting charge-self-consistent DFT+DMFT

基于物理约束的自能预热方法用于电荷自洽DFT+DMFT:铁在核心条件下的应用

Rishi Rao, Li Zhu

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本文提出了一种基于物理约束的机器学习预热方法,用于电荷自洽的DFT+DMFT计算,通过预测局部自能和费米能的紧凑实值表示,提高了铁、FeO和NiO等材料的DMFT迭代效率,从而在核心条件下确定铁的熔化曲线。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16522 2026-08-28 cs.RO cs.MA 版本更新 50%

A Mechanistic Model for Collective Motion from Sensorimotor Regularities

从传感器运动规律出发的集体运动机制模型

Vito Mengers, Bao Duc Cao, Oliver Brock

机构 * Robotics and Biology Laboratory, Technische Universität Berlin, Germany(技术大学柏林机器人与生物学实验室,德国) Science of Intelligence, Research Cluster of Excellence, Berlin, Germany(智能科学,卓越研究集群,柏林,德国) Robotics Institute Germany(德国机器人研究所)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出基于机器人建模框架的集体运动机制模型,通过感知和动作的梯度下降实现群体行为,揭示了传感器运动规律在集体行为中的作用。

Comments Accepted at SAB26

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09375 2026-08-28 math.OC 版本更新 50%

Linear Quadratic Mean Field Games under Heterogeneous Erroneous Initial Information

存在异质错误初始信息的线性二次平均场博弈

Yuxin Jin, Lu Ren, Wang Yao, Xiao Zhang

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 该研究针对存在异质错误初始信息的线性二次平均场博弈,推导了有限维误差通道表示、成本恒等式及近似精度,明确了确定性与随机动力学下误差对平均场及成本的影响机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 37 篇

2608.07167 2026-08-28 cs.AI 版本更新 91%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 Agent评测 :agent(title,summary_cn);AI agent(title);autonomous agent(abstract);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04292 2026-08-28 cs.CV 版本更新 89%

Binding Biometrics with AI Agent Identifiers for Delegation of Authority

将生物特征与AI智能体标识符绑定以实现权限委托

Joseph Geo Benjamin, Anil K Jain, Karthik Nandakumar

机构 * Michigan State University(密歇根州立大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract)

AI总结 本研究提出BIND框架,通过生物特征密码系统将人类生物特征与AI智能体ID及权限范围绑定,实现经认证的权限委托,基于人脸特征的实验验证其在零错误匹配率下96%真实匹配率,支持1024位智能体令牌。

Comments Accepted in IJCB sessions 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26225 2026-08-28 cs.AI cs.DC cs.MA cs.SE 新提交 86%

Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation - Identity Adequacy and Evidence Adequacy

智能体网格:非幂等智能体委托的可靠性原语——身份充分性与证据充分性

Mazhar Shaikh, Anurag Rajkumar Bombarde, Harshal Pathak

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文研究生产智能体平台的故障问题,发现现有服务网格机制的假设不成立,提出身份与证据充分性,推导7个以委托为单元的可靠性原语。

Comments 14 pages, 9 figures, 6 tables; 5-page ancillary supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27454 2026-08-28 cs.AI cs.CL 新提交 84%

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

WikiSkill:将智能体经验编译为持久知识以实现技能演化

Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu

机构 * Google Research(谷歌研究院) Virginia Tech(弗吉尼亚理工大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 WikiSkill是使智能体技能与持久知识库协同演化的框架,在多基准与模型上优于现有方法,证实持久知识积累对技能演化关键,且演化技能可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27260 2026-08-28 cs.AI cs.CL 新提交 84%

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

什么构成优质的智能体数据?LLM智能体数据生成的ACE视角

Xingshan Zeng, Zishan Xu, Boju Zhang, Yuzhou Wu, Lingzhi Wang, Jianghao Lin, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Weinan Zhang, Yong Yu, Qun Liu, Weiwen Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Shanghai Jiao Tong University(上海交通大学) Northwestern University(西北大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对LLM智能体数据生成领域提出两级框架与ACE视角,明确核心挑战是为演化的智能体与环境分配有效、非冗余的经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26950 2026-08-28 cs.AI cs.CL 新提交 84%

From Atomic to Agentic: Towards Interpretable Evaluation of LLMs' Agentic Mathematical Capabilities

从原子到智能体:迈向大语言模型智能体数学能力的可解释评估

Jiayi Kuang, Yinghui Li, Yunze Song, Keyu Chen, Zhifeng Shen, Yangning Li, Yidong Wang, Di Yin, Ruizhi Qiao, Xing Sun, Kai Jin, Ying Shen, Liang Lin, Philip S. Yu

机构 * Sun Yat-sen University(中山大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Pengcheng Laboratory(鹏城实验室)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出过程级基准,对齐智能体行为与数学原子能力分类,评估LLMs智能体数学推理能力,发现相似端到端准确率的模型智能体能力轮廓差异显著,凸显过程级评估的重要性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26546 2026-08-28 cs.AI cs.CL 新提交 84%

DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows

DuMateBench:评估自主智能体在复杂真实工作流程中的表现

Zechun Niu, Yukun Zhao, Jiaxin Zhang, Xu Shen, Jinhua Si, Han Tian, Can Xu, Yunfan Song, Jiaxin Mao, Yansong Gao, Yuchen Li, Jianmin Wu, Lingyong Yan, Shuaiqiang Wang, Dawei Yin

机构 * Renmin University of China(中国人民大学) Shandong University(山东大学) Michigan State University(密歇根州立大学) Nankai University(南开大学) East China Normal University(华东师范大学) Imperial College London(伦敦帝国学院) Baidu, Inc.(百度公司)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 DuMateBench是基于真实用户会话构建的自主智能体评估基准,含200个跨8场景的任务,注入三类环境复杂性,搭配五款智能体框架与四款LLM实验,发现严格任务完成存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26195 2026-08-28 cs.SE 新提交 83%

Cost-Utility Alignment in LLM Agent Trajectories:Profiling,Attribution,Diagnosis,Adaptation,and Evaluation

大语言模型智能体轨迹中的成本-效用对齐:分析、归因、诊断、适配与评估

Dan Liu, Jian Li

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.SE

AI总结 本研究提出以轨迹为中心的成本-效用对齐框架,通过五阶段分析解决LLM智能体资源消耗与任务贡献不匹配问题,为资源感知的智能体设计部署提供结构化基础。

Comments 12pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23045 2026-08-28 cs.AI 版本更新 81%

From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

从惯性到客观性:通过噪声隔离改进深度研究智能体

Xiangxin Zhang, Zhanwei Zhang, Zhihang Fu, Binbin Lin, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI

AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26733 2026-08-28 cs.CR cs.AI cs.LG 新提交 81%

Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction

白日梦:通过黑盒任务交互窃取隐藏的智能体技能

Yu-Lin Tsai, Yu-An Lu, Ci-Yang Tsai, Muxi Lyu, Raluca Ada Popa, Chia-Mu Yu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Daydreaming攻击,通过黑盒任务交互窃取智能体技能,在7种技能和4种模型上恢复了原始技能86.8%的能力,性能优于SigLeak,证明仅隐藏技能文件无法阻止功能重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24279 2026-08-28 cs.CL cs.SE 版本更新 81%

ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions

ContextEcho: 长智能编码会话中角色漂移的基准测试

Xianzhong Ding, Yangyang Yu, Changwei Liu, Bill Zhao, Le Chen, Tao Chen

机构 * Center for Advanced AI(先进人工智能中心)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL、cs.SE

AI总结 提出ContextEcho基准测试,通过25探针身份套件和快照-探针协议,测量部署规模下长编码会话中语言模型角色漂移的普遍性、压缩影响及下游效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26237 2026-08-28 cs.CR cs.AI 新提交 79%

How Do LLM Agents Actually Get the Flag? Trace-Level Provenance for Agentic Offensive Security Evaluation

大语言模型智能体究竟如何拿到Flag?面向智能体进攻性安全评估的追踪级来源分析

Kimberly Milner, Minghao Shao, Nanda Rani, Haoran Xi, Venkata Sai Charan Putrevu, Meet Udeshi, Sandeep K. Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Muhammad Shafique, Ramesh Karri

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 针对现有CTF基准评估智能体进攻性安全能力时忽略轨迹的问题,本文提出CTF-ABACUS框架,通过追踪级审计验证漏洞利用,发现仅62%-87%的恢复Flag为真实利用,为优化基准设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22444 2026-08-28 cs.CL 版本更新 79%

Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations

单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获

Isotta Magistrali, Chen Shani

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27009 2026-08-28 cs.CR 新提交 78%

The Guard That Cried Wolf: How Scary Words Make Agent Guardrails Refuse Legitimate Actions

会喊“狼来了”的守卫:恐怖词汇如何导致智能体防护栏拒绝合法操作

Yingjie Zhang, Yuanbo Xie, Kai Chen

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究构建了首个针对智能体防护栏过度安全问题的基准Cautious Bench,发现防护栏存在名称迷信效应,会因对象名称而非授权上下文过度拒绝合法操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26238 2026-08-28 cs.CV cs.GR 新提交 78%

Procedura: Agentic 3D Modeling with Procedural Control

Procedura:基于程序控制的智能体3D建模

Youtian Lin, Yikang Yang, Zhanpeng Hu, Mengqi Zhou, Feihu Zhang, Xun Cao, Jiaheng Liu, Yao Yao

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 针对原生3D生成器缺乏部件结构与可编辑性的问题,提出Procedura框架,以LLM编码能力构建参数化程序集,在P3D-Bench和MechBench-36上表现优于现有方法,生成可编辑的部件结构化3D模型。

Comments Project page: https://spatiaos.github.io/projects/procedura/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26372 2026-08-28 cs.CL cs.AI 新提交 73%

Knowledge-Verified Emergent Deception in LLM Agents Under Conflicting Incentives

利益冲突情境下LLM智能体中经知识验证的涌现式欺骗

Zheyuan Liu, Weiliang Zhao, Xiangchi Yuan, Ningshan Ma, Yue Huang, Meng Jiang

机构 * University of Notre Dame(圣母大学) Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对利益冲突下LLM智能体的诚实性问题,构建KnownLieBench基准并开展实验,发现不同模型的涌现式欺骗存在差异,诚实导向微调可减少激励下的欺骗。

Comments A benchmark for knowledge-verified emergent deception in LLM agents under conflicting incentives

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27311 2026-08-28 cs.AI 新提交 70%

Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification

更智能地验证,进一步进化:通过感知行为的验证实现高效的智能体控制策略进化

Jinghan Xu, Yikai Zhang, Aili Chen, Weiyuan Li, Jiaqing Liang, Deqing Yang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 针对智能体控制策略进化中验证成本高的问题,提出HarnessLens框架,通过行为感知的选择性验证,在提升保留任务性能的同时大幅降低评估预算。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22631 2026-08-28 cs.LG 版本更新 70%

Learning Generalizable Behaviors for Terminal Agents

学习终端智能体的可泛化行为

Yihang Yao, Bo Pang, Xuan Phi Nguyen, Ding Zhao, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本研究针对终端智能体泛化问题,提出智能体组合泛化假设,开发训练方案River,其用不足30%的TMax环境使多规模模型在两个基准上RL增益平均提升超100%,且性能优于开源8B模型、可跨多维度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27167 2026-08-28 cs.AI cs.CL 新提交 62%

Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable

足够校准以知晓,却未校准以行动:伪造证据使大语言模型智能体对不可知之事作出承诺

Pranav Aggarwal

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究发现LLM智能体易被伪造证据诱导对不可知问题作出错误承诺,其「行动/弃权(不执行)」闸门可通过合成案例微调优化,但对僵化响应格式敏感,部署需兼顾这一特性。

Comments 28 pages, 6 figures. Code, data, pre-registration and all cached model outputs: https://github.com/Pranav-1100/confidence-calibration-evaluation . Also archived at Zenodo, DOI 10.5281/zenodo.22043517

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27146 2026-08-28 cs.AI cs.SE 新提交 62%

When Tool Outputs Become Commands: Separating Action Induction from Runtime Authorization in Tool-Augmented LLM Agents

当工具输出成为命令:在工具增强型大语言模型智能体中分离动作诱导与运行时授权

Xiaokun Guo, Zhen Xu, Dongdong Huo, Yanqiu Zhang, Wei Wang, Qinfu Yang, Dongjin Yu, Yu Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对工具增强型LLM智能体中工具输出成为命令的风险,提出SARA框架分离动作诱导与执行授权,在AgentDojo等数据集上有效限制攻击成功率并保持任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26674 2026-08-28 cs.CL cs.AI 新提交 62%

Do LLMs Understand Personality? Rethinking Persona Fidelity Evaluation through Structured Behavioral Inference

大语言模型是否理解人格?通过结构化行为推理重新思考人格保真度评估

Mengfan Li, Zesheng Wei, Xuanhua Shi, Yang Deng

机构 * Singapore Management University(新加坡管理大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对现有LLM人格评估范式的局限,提出基于SFL的PRISM框架,将人格保真度评估转化为结构化逆推理任务,实验显示其评估结果更准确稳定。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26860 2026-08-28 cs.LG cs.AI math.OC 新提交 62%

Reinforcement Learning-Based Control of CAV Platoon Joining Maneuvers in Mixed Traffic

基于强化学习的混合交通环境下网联自动驾驶车辆(CAV)队列汇入机动控制

Biao Yin, Abderrahmane Kasmi, Nadir Farhi

机构 * Université Gustave Eiffel(古斯塔夫·埃菲尔大学) Université Paris Dauphine-PSL(巴黎多芬大学-PSL) Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia机构)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对混合交通环境下CAV队列汇入的安全高效控制问题,提出结合SUMO的建模框架,评估PPO等DRL算法,发现PPO在平衡安全与效率上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏