arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-11 至 2026-08-11 共收录 427 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 25 篇

2604.08377 2026-08-11 cs.AI cs.CL 版本更新 81%

SkillClaw: Let Skills Evolve Collectively with Agentic Evolver

SkillClaw: 让技能与代理进化者共同进化

Ziyu Ma, Shidong Yang, Yuxiang Ji, Xucong Wang, Yong Wang, Yiming Hu, Tongwen Huang, Xiangxiang Chu

机构 * DreamX Team(DreamX团队)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09650 2026-08-11 cs.IR cs.CL 新提交 79%

Listwise Cross-Encoder Fine-Tuning vs. Agentic Instruction Tuning for LLM Rerankers: A Systematic Study in Medical Procedure Reranking

用于LLM重排序器的列表式交叉编码器微调与智能体指令微调:医疗流程重排序的系统性研究

Matan Fainzilber, Shlomit Plavner

专题命中 软件智能体 :agentic(title,abstract);分类 cs.CL

AI总结 本文系统性对比列表式交叉编码器微调与智能体指令微调两种LLM重排序范式,在自建医疗流程重排序数据集上,发现1.09亿参数的ListNet微调交叉编码器性能优于40亿参数的Qwen3-Reranker-4B,参数量仅为后者1/37,相关成果已开源。

Comments 10 pages, 6 figures, 4 tables. Code available at https://github.com/matanf-healthee/listwise-crossencoder-reranking

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08793 2026-08-11 cs.CL 新提交 79%

Evidence-Calibrated Runtime Reconstruction for Agent Skills Across Heterogeneous Coding Agents

面向异构编码智能体的技能的证据校准运行时重构

Xueping Gao

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL

AI总结 本文提出Skill Runtime Intelligence系统,针对异构编码智能体重构技能生命周期阶段,在多场景实验中验证其能准确定位失败边界,为适配器资格认定提供支撑。

Comments 17 pages, 1 figure, 6 tables. Submitted to PROFES 2026. Code and artifacts: https://github.com/hellogxp/skill-runtime-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18171 2026-08-11 cs.LG 版本更新 79%

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

FlashRT:用于引导智能体部署实时多模态应用的智能体框架

Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) AMD(超威半导体公司) University at Buffalo(纽约州立大学水牛城分校)

专题命中 软件智能体 :agent(title,abstract);分类 cs.LG

AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14166 2026-08-11 cs.SE cs.CR cs.DC 版本更新 79%

Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives

停止即停止:测量和修复智能体框架控制原语中的执行差距

Sajjad Khan

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究生产型大语言模型智能体框架控制原语执行差距,用无模型差分探针发现漏洞及差距,提出SOUNDGATE修复,能强制执行多种属性,端到端阻止违规,释放合法效果。

Comments 32 pages, 3 figures, 11 tables. Code: pip install soundgate (PyPI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22758 2026-08-11 cs.AI 版本更新 74%

AutoRefine: Compiling Trajectories into Validated Typed Agent Artifacts

AutoRefine: 从轨迹到可重用的专业知识为连续LLM代理优化

Libin Qiu, Zhirong Gao, Junfu Chen, Yuhang Ye, Liangyu Li, Weizhi Huang, Xiaobo Xue, Wenkai Qiu, Shuo Tang

机构 * alibaba(阿里巴巴集团)

专题命中 软件智能体 :agent(title);分类 cs.AI

AI总结 AutoRefine通过提取和维护双重形式的经验模式,提升连续LLM代理的知识积累与维护效率,实现98.4%的准确率提升。

Comments 7 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17902 2026-08-11 cs.AI cs.MA cs.SE physics.chem-ph 版本更新 73%

El Agente Gráfico: A Semantic Execution Runtime for Scientific Agents

图形代理:用于科学代理的结构化执行图

Jiaru Bai, Abdulrahman Aldossary, Thomas Swanick, Marcel Müller, Yeonghun Kang, Changhyeok Choi, Naruki Yoshikawa, Zijian Zhang, Jin Won Lee, Tsz Wai Ko, Aiwei Yin, Mohammad Ghazi Vakili, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * School of Computer Science, McGill University(计算机科学学院,麦吉尔大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 El Agente Gráfico通过结构化执行图和类型安全机制,实现科学代理的高效自动化,适用于复杂计算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09268 2026-08-11 cs.HC cs.AI 新提交 70%

Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

编码智能体能通过渲染代码解决仓库级问题吗?一项关于视觉表示的探索性研究

Weijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究探索将渲染代码作为编码智能体的操作上下文,基于 SWE-bench Verified 实验发现其可降低提示 token 成本但受模型架构限制,仅在原始代码读取为瓶颈时有用,是可行但有条件的压缩机制。

Comments 8 pages of main content

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09253 2026-08-11 cs.AI 新提交 70%

SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance

SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案

You Lu, Xinyu Huang, Bihuan Chen, Xin Peng

专题命中 软件智能体 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08950 2026-08-11 cs.SE 新提交 70%

Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework

基于双向重构-验证框架的代码智能体独立补丁验证

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08570 2026-08-11 cs.AI 新提交 70%

FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents

FailForge:从持续失败中提取过程能力到代码智能体

Dongyi Lv, Fushun E, Aichen Cai, Liang Huang, Ya Zhang, Qiuyu Ding, Canhui Wu, Zhi Wang, Yuesong Zhang, Jiaqi Wang, Nan Duan

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 FailForge 框架将代码智能体的失败案例转化为训练信号,以边际成本恢复超26%失败实例,使 Qwen3.5-4B 在 SWE-bench Verified 上的解决率提升6.6个百分点,增益集中于最难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04203 2026-08-11 cs.CL cs.CV cs.LG cs.SE 版本更新 67%

FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback

FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试

Xueqing Wu, Zihan Xue, Da Yin, Shuyan Zhou, Kai-Wei Chang, Nanyun Peng, Yeming Wen

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of California, Los Angeles(加州大学洛杉矶分校) Duke University(杜克大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。

Comments CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09802 2026-08-11 cs.CL cs.SE 新提交 62%

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准测试

Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 该研究推出SWE-Bench ProMax多语言代码重构基准,含170个跨7种语言的大规模重构任务,经严格筛选后前沿模型仅达41.2%解决率,为AI编码智能体提供挑战性测试。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09292 2026-08-11 cs.LG cs.CL 新提交 62%

Beyond the Capability Boundary: Zeroth-Order Optimization for Self-Evolving LLM Agents

超越能力边界:用于自进化大语言模型智能体的零阶优化

Bingzhen Liu, Xiaomeng Fan, Yuwei Wu, Zhi Gao, Mingyang Gao, Chuanhao Li, Yunde Jia

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳北理莫斯科大学) Alaya Lab(阿莱亚实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出零阶自进化框架,通过扰动LLM的LoRA参数形成闭环自进化循环,结合并行扰动推理等机制,在多基准实验中显著提升了LLM智能体在困难样例上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07645 2026-08-11 cs.AI cs.LG 新提交 62%

Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution

孟德尔哥德尔机:基于比较进化的递归自改进编码智能体

Changzhi Liu, Yilun Liu, Sikuan Yan, Volker Tresp, Yunpu Ma

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对现有自改进编码智能体仅利用单轨迹的缺陷,提出孟德尔哥德尔机,新增反应规范突变与跨谱系杂交两种自修改策略,经理论证明与实验验证,其在编码任务上的性能、效率及泛化性均优于基线方法。

Comments Project Page at https://reallcz.github.io/MGM; Code at https://github.com/RealLcz/MGM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19329 2026-08-11 cs.SE cs.AI 版本更新 62%

Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification

Goedel-Code-Prover:面向开放状态的最新代码验证的分层证明搜索

Zenan Li, Ziran Yang, Deyuan He, Haoyu Zhao, Andrew Zhao, Shange Tang, Kaiyu Yang, Aarti Gupta, Zhendong Su, Chi Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Princeton Language and Intelligence(普林斯顿语言与智能实验室) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) MiroMind

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Goedel-Code-Prover框架,通过分层证明搜索提升Lean4中代码验证的自动化水平,实现62%的成功率,优于现有基线方法。

Comments Published as a COLM paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09799 2026-08-11 cs.SE 新提交 57%

SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories

SpecPath:在合同等价的规范历史中测试编码智能体

Yangfan Wu, Haozhe Wang, Huanyu Yang, Jianmin Ji, Fangzhen Lin

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 针对编码智能体的规范路径敏感性问题,提出SpecPath诊断评估方法,通过控制变量测试发现多数智能体在等价规范历史中存在行为不一致的问题,凸显需评估智能体对规范路径的鲁棒性。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09643 2026-08-11 cs.CR cs.LG 新提交 57%

Activation Probes Surface Code-Security Signals that the Model's Output Misses

激活探针:挖掘模型输出遗漏的表面代码安全信号

Ivan Wiryadi

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。

Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28069 2026-08-11 cs.AI 版本更新 57%

SemPIC: Learning Semantic Position-Independent KV Caches

SemPIC:学习语义位置无关的键值缓存

Hui Xie, Peng Xiao, Yutong Deng, Shuoran Dou, Jian Yang, Jinyang Guo

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 SemPIC通过训练启用LoRA的Writer编译文档KV,结合KV梯度检查点,提升了长上下文场景下的KV缓存性能,平均微F1值达0.60,接近全重计算效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09410 2026-08-11 cs.RO 新提交 50%

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习

Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

专题命中 软件智能体 :agent(abstract)

AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。

Comments 9 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08861 2026-08-11 math.OC 新提交 50%

Simultaneous Group-Envelope Bounds for $Γ$-Robust Multiple-Choice Knapsack Problems

Γ-鲁棒多选背包问题的 simultaneous 组-包络界

Zi Yuan Eric Shao

专题命中 软件智能体 :planning(abstract)

AI总结 本文针对Γ-鲁棒多选背包问题,提出 simultaneous 组-包络界方法,可同时界定阈值族,大幅加速松弛求解,在实验中实现2.37倍几何平均加速。

Comments 19 pages, 2 figures. Code and reproducibility materials: https://github.com/eric939/simultaneous-group-envelope-mckp

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28600 2026-08-11 quant-ph 版本更新 50%

SymFT: Universal Fault-Tolerant Quantum Circuit Simulation via Symbolic Clifford--Pauli Frames and Stabilizer Coordinates

SymFT:基于符号Clifford–Pauli框架和稳定子坐标的通用容错量子电路模拟

Wang Fang, Huazhe Lou, Riling Li

专题命中 软件智能体 :planning(abstract)

AI总结 SymFT是一款高吞吐量容错量子电路模拟器,通过符号Clifford–Pauli框架分解和自适应稳定子坐标规划优化采样,在多种量子电路上实现了比Stim、Clifft、SOFT更优的采样性能。

Comments 28 pages, 1 figure, 5 tables; v2: update benchmark results and related work. SymFT is the second-generation successor to SOFT, see GitHub repository: https://github.com/haoliri0/SOFT

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 25 篇

2608.08939 2026-08-11 cs.AI 新提交 85%

Not an A11y: How Android Accessibility Exposes Mobile AI Agents to Indirect Prompt Injection

并非无障碍功能(A11y):安卓无障碍功能如何将移动智能体暴露于间接提示注入攻击

Rahul Deivasigamani, Sayeda Faatin Alvi, Derqui Andrea, Kaushal Punjabi, Stjepan Picek

机构 * Radboud University Nijmegen(奈梅亨拉德堡德大学)

专题命中 GUI与网页智能体 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文揭示安卓移动智能体框架因依赖未过滤的无障碍元数据,存在间接提示注入漏洞,经实证验证其攻击成功率达0.822,需强化零信任输入验证等安全措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08163 2026-08-11 cs.AI 新提交 85%

Agentic AI-driven Immersive Simulation: A Knowledge-Aware Virtual Training Platform forHigh Dose Rate (HDR) Brachytherapy

智能体AI驱动的沉浸式模拟:用于高剂量率(HDR)近距离放射治疗的知识感知虚拟训练平台

Ronghua Xu, Kepha Barasa, Manoj Kumal, Xinyun Liu, Weihua Zhou, Xin Qian

专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究提出一款智能体AI驱动的沉浸式模拟平台,用于HDR阴道圆柱近距离放射治疗虚拟训练,集成VR、移动计算与RAG技术,经原型验证可提供高保真无风险训练环境,具备合适延迟与高RAG支持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09278 2026-08-11 cs.SE cs.AI 新提交 81%

Software Engineering for and with GUI Agent

面向GUI智能体的软件工程及与GUI智能体协同的软件工程

Shengcheng Yu, Yuchen Ling, Junyang Xing, Quan Zhou, Chunrong Fang, Zhenyu Chen

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 该研究通过分析2018年1月至2026年4月的336篇GUI智能体论文,指出其在恢复机制、安全执行等方面的不足,提出需结合可靠执行与生命周期测试等以构建可部署的GUI智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06134 2026-08-11 cs.HC 版本更新 80%

MAESTRO: Adapting GUIs and Guiding Navigation with User Preferences in Conversational Agents with GUIs

MAESTRO:在具有GUI的对话代理中通过用户偏好适应GUI并引导导航

Sangwook Lee, Adnan Abbas, Sang Won Lee, Young-Ho Kim, Yan Chen

专题命中 GUI与网页智能体 :workflow(abstract,abstract_cn);agent(abstract);agentic(abstract)

AI总结 MAESTRO通过提取用户偏好并指导工作流导航,提升对话代理中GUI的适应性和导航效率,通过实验验证其有效性。

Comments 19 pages, 6 figures, 2 tables. Published at UIST '26. This is the camera-ready version, posted under CC BY 4.0

Journal ref Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 2-5, 2026, Detroit, MI, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09073 2026-08-11 cs.RO 新提交 78%

Latent World Models with Monotone Planning Costs for Image-Goal Navigation

带有单调规划代价的潜在世界模型用于图像目标导航

Amirhosein Chahe, Siwei Cai, Lifeng Zhou

机构 * Drexel University(卓克索大学)

专题命中 GUI与网页智能体 :planning(title,abstract)

AI总结 本文提出基于冻结DINO编码器的潜在世界模型,通过自回归回退损失与单调代价排序损失优化,在GNM数据集上实现图像目标导航最优性能,方向误差较基线降低2.7倍,还可零样本部署于物理机器人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26041 2026-08-11 cs.CV 版本更新 78%

Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation

重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角

Daiqiang Li, Zihao Pan, Zeyu Zhang, Xuyang Liu, Shijia Xu, Ronghao Chen, Huacan Wang, Honggang Chen, Linfeng Zhang, Zhangquan Chen, Haiyun Jiang

机构 * Sichuan University(四川大学) Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08392 2026-08-11 cs.AI cs.CL 新提交 73%

CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception

CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准

Zejun Xu, Taiyi Chen, Jin Li, Yongtong Gu, Qi Cheng, Aixuan Lv, Shuai Zhu, Pengfei Zhu, Kaichen Yang, Boyu Sun, Yixian Yang, Mulong Xie, Xin Liu, Dagang Li, Xiaoteng Ma, Hongru Wang

机构 * Macau University of Science and Technology(澳门科技大学) Tsinghua University(清华大学) Southeast University(东南大学) FellouAI ARGUS Lab(ARGUS实验室) The University of Edinburgh(爱丁堡大学)

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。

Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07508 2026-08-11 cs.HC cs.AI cs.CL 新提交 73%

JaleesBench: Are AI Assistants Good Spiritual Company?

JaleesBench:AI助手能否成为良好的精神陪伴?

M. Waleed Kadous, Benjamin Olsen

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出JaleesBench基准测试,评估AI助手的精神陪伴能力,发现简单提示指导可提升通用模型的陪伴表现,领域微调助手的优势来自检索和提示层,还可用于改进现有宗教类AI助手。

Comments 21 pages, 8 figures, 4 tables. Open-source harness, scenario bank, proof texts, and full evaluation (model responses and both judges' verdicts): https://github.com/iaser-ai/jaleesbench . Interactive browser for inspecting scenarios, responses, and judge verdicts: https://s.iaser.ai/jb

详情

展开后加载摘要…

URL PDF HTML 收藏