arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-13 至 2026-02-13 共收录 6 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 6 篇

2510.04860 2026-02-13 cs.LG cs.AI 73%

Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails

对齐倾倒过程:自我进化如何推动LLM代理偏离轨道

Siwei Han, Kaiwen Xiong, Jiaqi Liu, Xinyu Ye, Yaofeng Su, Wenbo Duan, Xinyuan Liu, Cihang Xie, Mohit Bansal, Mingyu Ding, Linjun Zhang, Huaxiu Yao

机构 * Rutgers University(罗切斯特大学)

专题命中 工作流自动化 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了自我进化LLM代理在部署后因持续互动而偏离对齐约束的风险,通过自我利益探索和模仿策略扩散两种范式分析,发现对齐优势会迅速衰减,现有对齐方法难以有效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04722 2026-02-13 cs.RO cs.HC 71%

Fitts' List Revisited: An Empirical Study on Function Allocation in a Two-Agent Physical Human-Robot Collaborative Position/Force Task

Fitts列表重审:一项关于两人agent物理人机协作位置/力任务功能分配的实证研究

Nicky Mol, J. Micah Prendergast, David A. Abbink, Luka Peternel

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 工作流自动化 :agent(title)

AI总结 本文通过实证研究验证Fitts列表在物理人机协作中功能分配的适用性,发现人类控制位置提升性能和用户满意度,而机器人控制力减少过度混合和用户不适。

Comments 8 pages, 6 figures, published in IEEE Robotics and Automation Letters, col. 11, no. 1, January 2026

Journal ref IEEE Robotics and Automation Letters, Volume 11, Issue 1, January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12092 2026-02-13 cs.CL cs.AI cs.CR cs.CV 62%

DeepSight: An All-in-One LM Safety Toolkit

DeepSight: 一个全方位的大型模型安全工具包

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yijin Zhou, Yuyao Wu, Shaoxiong Guo, Tianyi Du, Jingyi Yang, Xuhao Hu, Ziqi Miao, Xiaoya Lu, Jing Shao, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 DeepSight是一个开源工具包,旨在通过整合安全评估与诊断,提升大型模型的安全性与可解释性。

Comments Technical report, 29 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05517 2026-02-13 cs.CL cs.AI 62%

Empowering Healthcare Practitioners with Language Models: Structuring Speech Transcripts in Two Real-World Clinical Applications

通过语言模型赋能医疗从业者:在两个真实临床应用中结构化语音转录

Jean-Philippe Corbeil, Asma Ben Abacha, George Michalopoulos, Phillip Swazinna, Miguel Del-Agua, Jerome Tremblay, Akila Jeeson Daniel, Cari Bader, Yu-Cheng Cho, Pooja Krishnan, Nathan Bodenstab, Thomas Lin, Wenxuan Teng, Francois Beaulieu, Paul Vozila

机构 * Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文通过语言模型在两个临床应用中结构化语音转录,提出代理流程生成非敏感数据,并发布首个开源数据集以支持进一步研究。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11957 2026-02-13 cs.LG 57%

Are Two LLMs Better Than One? A Student-Teacher Dual-Head LLMs Architecture for Pharmaceutical Content Optimization

两个大语言模型是否比一个更好?一种学生-教师双头大语言模型架构用于药学内容优化

Suyash Mishra, Qiang Li, Anubhav Girdhar

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本研究提出一种学生-教师双头大语言模型架构,用于提升药学内容的合规性与准确性,通过模块化设计和规则过滤实现高效质量控制。

Comments Submitted to the Demo Track of Top Tier Conference; currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16204 2026-02-13 astro-ph.HE astro-ph.IM 50%

Fastest or Significant: A Systematic Framework for Validating Global Minimum Variability Timescale Measurements of Gamma-ray Bursts

最快或显著:用于验证伽马射线暴全球最小变异性时间尺度测量的系统框架

S. Bala, P. Veres, A. Goldstein, R. Sonawane, R. Samanta, S. Iyyani

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种系统框架,用于验证伽马射线暴最小变异性时间尺度测量的可靠性,揭示了MVT测量中统计显著性与信噪比的关系,指出部分已发表的MVT值应重新解释为上限。

Comments Accepted in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏