arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Salesforce

共收录 320
2609.03430 2026-09-04 cs.CL 新提交

Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

随机注意力:重新思考高效推理的KV缓存驱逐策略

Heng Wang, Jielin Qiu, Wenting Zhao, Cheng Qian, Liangwei Yang, Jiawei Han, Heng Ji, Silvio Savarese, Shelby Heinecke, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 Random Attention方法不计算KV缓存token的得分,均匀随机驱逐token,在四个模型六个推理任务上性能与现有最强方法相当,且vLLM部署吞吐量提升32%-43%,揭示了推理轨迹的冗余抵御驱逐的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01466 2026-09-02 cs.AI 新提交

Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers

解析流:面向长视野智能体及其观察者的实时轨迹模型

Egor Pakhomov, Erik Nijkamp

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 该研究提出实时轨迹模型,可将长视野智能体的轨迹折叠为类型化运行状态,经评估能降低观察者侧的令牌用量与成本、提升准确率,在智能体侧序列依赖任务中表现优于全上下文提示,相关成果与代码已公开。

Comments 22 pages, 4 figures. Code: https://github.com/SalesforceAIResearch/tracelab ; dataset: https://huggingface.co/datasets/Salesforce/tracelab-comprehend

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00805 2026-09-02 cs.AI cs.SE 新提交

Towards a Reliable and Practical Eval Pipeline

面向可靠且实用的评估流程

Emma Thuong Nguyen, Abhishek Ghose

机构 * Salesforce(Salesforce(赛富时))

AI总结 针对现有LLM软件评估仅处理局部可靠性问题的不足,提出结合清单创建与学习聚合的端到端评估流程,提升评判一致性与准确性,还提供自一致性等功能并实证验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03053 2026-09-02 cs.AI cs.CL cs.MA 版本更新

MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems

MAS-ProVe: 理解多智能体系统的进程验证

Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Austin Xu, Xiaoxiao He, Yingbo Zhou, Semih Yavuz, Hao Wang, Shafiq Joty

机构 * Rutgers University(罗杰斯大学) Salesforce AI Research(Salesforce人工智能研究)

AI总结 MAS-ProVe研究多智能体系统进程验证的有效性,发现LLM作为法官表现优于奖励方法,但验证过程仍面临上下文长度与性能的权衡问题。

Comments ICML 2026 Regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29971 2026-09-01 cs.AI cs.LG 新提交

EDGE: Engine for Deterministic Graph Evaluation through Conversation Simulation from Graph Structured DSL Configuration

EDGE:基于图结构DSL配置的对话模拟实现确定性图评估的引擎

Ram Kulathumani, Regunathan Radhakrishnan, Anupam Tripathi, Xiangbo Mao, Roshanak Omrani, Keshav Somani, Shwet Kamal Mishra, Shayna Lurya

机构 * Salesforce

AI总结 EDGE基于AgentGraph等框架,通过图遍历生成对话路径评估集,定义新指标量化智能体确定性,证实带受控节点转换的智能体确定性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29432 2026-09-01 cs.RO 新提交

SMILE: Smooth Motion for Improved Long-Horizon VLA Execution

SMILE:用于改进长视界视觉-语言-动作(VLA)执行的平滑运动

Jongwoo Park, E-Ro Nguyen, Kanchana Ranasinghe, Cristina Mata, Xiang Li, Michael S Ryoo

机构 * Stony Brook University(石溪大学) Salesforce AI Research(Salesforce AI研究院)

AI总结 SMILE是一种保留架构的接口,通过预测B样条系数生成平滑动作序列,应用于多款VLA模型后,在多个基准及真实实验中提升了长视界VLA执行的准确率与效率

Comments Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28643 2026-09-01 cs.CL cs.AI 新提交

Redesigning and Auditing Deep Research Writing for Faithful Reports

深度研究写作的重新设计与审计以生成忠实报告

Hiroaki Hayashi, Pranav Narayanan Venkit, Prafulla Kumar Choubey, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 针对深度研究系统的细粒度事实错误问题,提出CLAIMPROBE审计方法,设计CLAIMWRITER主张分层写作器,可显著降低幻觉、提升必要事实召回率且成本效益更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-09-01 cs.CL cs.AI cs.MA 版本更新

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22631 2026-08-28 cs.LG 版本更新

Learning Generalizable Behaviors for Terminal Agents

学习终端智能体的可泛化行为

Yihang Yao, Bo Pang, Xuan Phi Nguyen, Ding Zhao, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究针对终端智能体泛化问题,提出智能体组合泛化假设,开发训练方案River,其用不足30%的TMax环境使多规模模型在两个基准上RL增益平均提升超100%,且性能优于开源8B模型、可跨多维度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25152 2026-08-27 cs.CL cs.AI 新提交

Belief Cascades Drive Persuasion in LLM Agent Networks

信念级联驱动LLM智能体网络中的说服行为

Haoyi Qiu, Genglin Liu, Pranav Narayanan Venkit, Kung-Hsiang Huang, Saadia Gabriel, Chien-Sheng Wu, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究)

AI总结 该研究构建受控测试平台,发现LLM智能体网络中说服动态受拓扑等因素影响,直接暴露可预测立场变化,需结合多维度数据评估多智能体说服。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09263 2026-08-27 cs.AI cs.LG 版本更新

Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation

特权似然并非自动等价于价值:在线自蒸馏中 token 信用的三项检验

Xuan-Phi Nguyen, Zeyu Leo Liu, Yang Li, Shrey Pandit, Yiran Zhao, Anurag Koul, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 该研究针对在线自蒸馏中 token 信用问题,通过三项检验分析特权似然与价值的关系,实验表明 token 分数变体效果不及仅结果对照组,需单独验证分数等因素的有效性。

Comments Updated Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13431 2026-08-26 cs.LG cs.AI cs.CL 版本更新

Discrete Diffusion Models: A Unified Framework from Tokenization to Generation

离散扩散模型:从词元化到生成的统一框架

Ye Yuan, Weien Li, Rui Song, Zeyu Li, Haochen Liu, Xiangyu Kong, Zixuan Dong, Linfeng Du, Zipeng Sun, Weixu Zhang, Jiaxin Huang, Changjiang Han, Yonghan Yang, Zichen Zhao, Xiuyuan Hu, Haolun Wu, Yankai Chen, Fengran Mo, Jikun Kang, Bowei He, Dawn Song, Philip S. Yu, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Tsinghua University(清华大学) Rochester Institute of Technology(罗彻斯特理工学院) Salesforce(Salesforce公司) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究离散扩散模型,引入统一框架从离散状态空间构建审视该模型,让现有公式成为共同设计空间实例,揭示训练、推理等方面权衡,为未来研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22167 2026-08-25 cs.AI cs.LG 新提交

MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning

MCP-Universe RL:一种通过强化学习训练MCP工具使用智能体的框架

Ziyang Luo, Yan Yang, Xiangru Jian, Ziji Shi, Xiaoqiang Lin, Jun Hao Liew, Silvio Savarese, Junnan Li

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 该研究提出MCP-U RL开源框架,依托MCP协议解决RL训练中环境搭建与GPU利用率问题,在gpt-oss-20b上训练三类工具使用智能体并提升了任务奖励。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18066 2026-08-19 cs.AI cs.CL cs.LG 新提交

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

自改进智能体的脆弱性:方差、任务顺序与规格不足

Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 本研究通过多轮运行与打乱任务顺序的实验,揭示当前基于记忆的自改进智能体存在脆弱性,发现其性能受方差与任务顺序影响,还指出规格不足是相关诱因,呼吁采用更严格评估方案与人工监督机制。

Comments Code: https://github.com/SalesforceAIResearch/self-improve-fragility Data: https://huggingface.co/datasets/Salesforce/self-improve-fragility

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20131 2026-08-19 cs.LG cs.AI cs.IT math.IT 版本更新

LZ Penalty: An information-theoretic repetition penalty for autoregressive language models

LZ惩罚:一种用于自回归语言模型的信息论重复惩罚项

Antonio A. Ginart, Naveen Kodali, Jason Lee, Caiming Xiong, Silvio Savarese, John R. Emmons

机构 * Salesforce AI Research(Salesforce人工智能研究)

AI总结 本文提出LZ惩罚,基于LZ77压缩算法,可让开源推理模型用贪婪解码时无退化重复,优于现有频率、重复惩罚。

Comments Post-publication corrections (minor calculation mistakes)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12307 2026-08-13 cs.LG cs.AI cs.CL 新提交

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

测试时的AI辅助AI:通过 harness 实现强模型到弱模型的能力迁移

Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu, Heng Ji, Silvio Savarese, Huan Wang, Shelby Heinecke

机构 * Salesforce AI Research(Salesforce人工智能研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究提出在测试时通过构建 harness,无需重新训练即可将强模型的认知结构迁移给弱模型,使目标模型在四个心理理论基准上的平均性能从0.49提升至0.91,为模型能力迁移提供了新的思路。

Comments 23 Pages, 12 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11171 2026-08-12 cs.CL cs.AI cs.CY 新提交

From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop

从可解释性到控制:TrustNLP研讨会六年的启示

Rahul Gupta, Abhinav Mohanty, Anaelia Ovalle, Anil Ramakrishna, Anubrata Das, Apurv Verma, Jwala Dhamala, Ninareh Mehrabi, Tharindu Kumarage, Yada Pruksachatkun, Yang Trista Cao, Kai-Wei Chang, Aram Galstyan

机构 * Meta Autodesk(欧特克公司) New Jersey Institute of Technology(新泽西理工学院) Salesforce(salesforce公司) University of California, Los Angeles(加州大学洛杉矶分校) Amazon AGI(亚马逊AGI)

AI总结 该研究基于TrustNLP研讨会六年论文,分析NLP可信领域从可解释性到生成式系统控制的转变,明确各信任维度的发展趋势及与领域整体的关联性,提出结构性见解与研究方向。

Comments 17 pages, 2 figures, 3 tables. Submitted to ACL ARR August 2026 cycle (EACL 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10408 2026-08-12 cs.CL 新提交

VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?

VisEditBench:视觉语言模型能否基于多模态反馈编辑可视化代码?

Mizanur Rahman, Arshia Azimlu, Shadikur Rahman, Md Tahmid Rahman Laskar, Amran Bhuiyan, Shafiq Joty, Enamul Hoque Prince

机构 * York University(约克大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

AI总结 本研究推出可视化代码编辑基准VisEditBench,评估20种VLMs的编辑能力,提出基于渲染的VisEditAgent框架,显著提升了编辑任务的通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10366 2026-08-12 cs.AI cs.CL 新提交

DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince

机构 * York University(约克大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究院)

AI总结 DSAgentBench是首个评估智能体在真实计算机环境中自动化完整数据科学工作流的基准,含275项任务,实验显示现有智能体与实际需求存在显著能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07545 2026-08-11 cs.NE cs.AI cs.LG cs.SE 新提交

DarwinX: Evolving Agent Harnesses Through Natural Selection

DarwinX:通过自然选择进化智能体控制程序

Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang, Zhiyuan Hu, James Zhu, Phil Mui, Silvio Savarese, Ran Xu, Zeyuan Chen

机构 * Salesforce AI Research(Salesforce人工智能研究院) Salesforce Agentforce

AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22877 2026-08-11 cs.AI cs.HC cs.RO 版本更新

Physical AI Governance: From Theory to Practice Across Life Cycle

物理人工智能治理:跨越生命周期从理论到实践

Wang Yang, Shaobo Wang, Hongxuan Liu, Xiaoran Cai, Yunyu He, Jingzong Zhou, Mengzhong Ma, Yi Yu, Rohit Sharma, Jingjing Fu, Peng Qi

机构 * Case Western Reserve University(凯斯西储大学) Shanghai Jiao Tong University(上海交通大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学) University of California, Riverside(加州大学河滨分校) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Salesforce(Salesforce公司) Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 本文对物理人工智能治理进行全面综述,综合现有原则形成统一框架,提出五阶段生命周期,通过具体实践展示各阶段治理操作,为构建安全可信且符合社会价值的物理人工智能系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25220 2026-08-10 cs.AI 版本更新

DATAREEL: Automated Data-Driven Video Story Generation with Animations

DATAREEL:基于动画的自动化数据驱动视频故事生成

Ridwan Mahbub, Syem Aziz, Mizanur Rahman, Mahir Ahmed, Shadikur Rahman, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Bangladesh University of Business and Technology(孟加拉国商业与技术大学) RBC, Canada(加拿大RBC) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

AI总结 本文提出DataReel基准,通过328个真实故事评估模型生成动画数据视频故事的能力,采用多智能体框架提升自动化生成效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06052 2026-08-06 cs.CL cs.AI 版本更新

A Survey of Agent Memory in the Second Half: Towards Self-Evolving and Long-Horizon Agents

重新思考基础智能体的内存机制:第二阶段综述

Wei-Chieh Huang, Weizhi Zhang, Yueqing Liang, Yuanchen Bei, Yankai Chen, Tao Feng, Xinyu Pan, Zhen Tan, Yu Wang, Tianxin Wei, Shanglin Wu, Ruiyao Xu, Liangwei Yang, Rui Yang, Wooseong Yang, Chin-Yuan Yeh, Hanrong Zhang, Haozhen Zhang, Siqi Zhu, Henry Peng Zou, Wanjia Zhao, Song Wang, Wujiang Xu, Zixuan Ke, Zheng Hui, Dawei Li, Yaozu Wu, Langzhou He, Chen Wang, Xiongxiao Xu, Baixiang Huang, Juntao Tan, Shelby Heinecke, Huan Wang, Caiming Xiong, Ahmed A. Metwally, Jun Yan, Chen-Yu Lee, Hanqing Zeng, Yinglong Xia, Xiaokai Wei, Ali Payani, Yu Wang, Haitong Ma, Wenya Wang, Chenguang Wang, Yu Zhang, Xin Eric Wang, Yongfeng Zhang, Jiaxuan You, Hanghang Tong, Xiao Luo, Xue Liu, Yizhou Sun, Wei Wang, Julian McAuley, James Zou, Jiawei Han, Philip S. Yu, Kai Shu

机构 * UIC(伊利诺伊大学香槟分校) IIT(伊利诺伊理工学院) UIUC(伊利诺伊大学厄巴纳-香槟分校) UW–Madison(威斯康星大学麦迪逊分校) ASU(亚利桑那州立大学) Emory(埃默里大学) Northwestern(西北大学) NTU(国立台湾大学) UCF(佛罗里达大学) Rutgers(新泽西罗格斯大学) Cambridge(剑桥大学) Harvard(哈佛大学) UTokyo(东京大学) UCSD(加州大学圣地亚哥分校) UCSC(加州大学圣塔克鲁斯分校) TAMU(德克萨斯大学奥斯汀分校) UCSB(加州大学圣塔芭芭拉分校) MBZUAI(马克斯·普朗克人工智能研究所) McGill(麦吉尔大学) UCLA(加州大学洛杉矶分校) Stanford(斯坦福大学) Salesforce Google(谷歌) Meta Roblox Cisco(思科) Capital One

AI总结 本文综述了基础智能体内存机制,从内存基质、认知机制和主体维度分析内存在不同拓扑结构下的实现,并探讨内存操作的学习策略与评估指标。

Comments Accepted at Transactions on Machine Learning Research (TMLR) with Survey Certification. Project page: https://github.com/AgentMemoryWorld/Awesome-Agent-Memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28818 2026-08-03 cs.AI cs.CL 新提交

Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift in AI Companions

并非永远的最佳伙伴:评估AI伴侣中的长时角色崩溃与行为漂移

Pranav Narayanan Venkit, Akshara Prabhakar, Yu Li, Daniel Lee, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 本研究针对AI伴侣的长时角色崩溃与行为漂移问题,引入ANCHOR审计方法开展大规模实验,发现现有模型无法可靠维持角色与轨迹,需区分多维度指标进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22798 2026-07-28 cs.SE cs.CV 新提交

StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

StateAct:在像素之前的程序状态,用于长期计算机使用代理

Yan Yang, Xiangru Jian, Ziyang Luo, Zirui Zhao, Yutong Dai, Ziji Shi, Hanshu Yan, Jun Hao Liew, Silvio Savarese, Junnan Li

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 研究针对计算机使用代理,提出基于程序状态的StateAct多代理框架,主要代理用代码处理状态,GUI子代理辅助,支持验证,在OSWorld 2.0上提升了Claude Opus 4.8的成功率,且成本降低,实现从感知到推理的瓶颈转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20452 2026-07-24 cs.AI 新提交

AINTMA: Agentic AI Architecture for Autonomous Test Management with Generative Intelligence, Secure Cloud Communication and Adaptive Quality Analytics

AINTMA:用于自主测试管理的智能AI架构,具备生成式智能、安全云通信和自适应质量分析

Vinil Pasupuleti, Shyalendar Reddy Allala, Siva Rama Krishna Varma Bayyavarapu, Shrey Tyagi, Srinivasateja Songa

机构 * International Business Machines (IBM)(国际商业机器公司(IBM)) Global Atlantic Financial(全球大西洋金融公司) Docusign(DocuSign公司) Salesforce Inc(Salesforce公司) The Home Depot(家得宝公司)

AI总结 研究针对现代软件质量保证需求,提出AINTMA多智能体AI系统。通过六个专门智能体及安全通信框架协调,结合生成式智能等技术。经实验评估,该系统在测试优先级、周期时间、缺陷逃逸率等方面表现出色,推进了云环境下软件质量管理。

Comments 11 pages, 2 figures, 4 tables, Submitted to AICCONS (AIP Conference Proceedings format)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19336 2026-07-22 cs.AI cs.CL 新提交

Agents in the Wild: Where Research Meets Deployment

野外的智能体:研究与部署的交汇点

Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini

机构 * Georgetown University(乔治敦大学) Salesforce(Salesforce公司) Bayer(拜耳公司) Bloomberg(彭博公司) Microsoft Research(微软研究院)

AI总结 探讨基于大语言模型的智能体系统从研究到部署的转变,通过案例研究分析成功设计模式及失败缓解策略,为与会者提供跨行业安全可靠部署的全面视角、设计模式、评估清单和模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16839 2026-07-17 cs.CV 版本更新

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa:用于多模态理解的大型扩散语言模型

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Adobe Research(Adobe研究) Salesforce Research(Salesforce研究)

AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11862 2026-07-14 cs.CV cs.AI 新提交

Evidence-Backed Video Question Answering

有证据支持的视频问答

Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles

机构 * Salesforce, Palo Alto, CA, USA(Salesforce公司) Brown University, Providence, RI, USA(布朗大学)

AI总结 研究视频问答中模型缺乏可视化依据的问题,提出E-VQA任务及ST-Evidence基准,开发数据集ST-Evidence-Instruct,通过微调提高模型表现,为可解释的视频理解建立基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏