arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Salesforce

2026-09-01 至 2026-09-01 共收录 4
2608.29971 2026-09-01 cs.AI cs.LG 新提交

EDGE: Engine for Deterministic Graph Evaluation through Conversation Simulation from Graph Structured DSL Configuration

EDGE:基于图结构DSL配置的对话模拟实现确定性图评估的引擎

Ram Kulathumani, Regunathan Radhakrishnan, Anupam Tripathi, Xiangbo Mao, Roshanak Omrani, Keshav Somani, Shwet Kamal Mishra, Shayna Lurya

机构 * Salesforce

AI总结 EDGE基于AgentGraph等框架,通过图遍历生成对话路径评估集,定义新指标量化智能体确定性,证实带受控节点转换的智能体确定性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29432 2026-09-01 cs.RO 新提交

SMILE: Smooth Motion for Improved Long-Horizon VLA Execution

SMILE:用于改进长视界视觉-语言-动作(VLA)执行的平滑运动

Jongwoo Park, E-Ro Nguyen, Kanchana Ranasinghe, Cristina Mata, Xiang Li, Michael S Ryoo

机构 * Stony Brook University(石溪大学) Salesforce AI Research(Salesforce AI研究院)

AI总结 SMILE是一种保留架构的接口,通过预测B样条系数生成平滑动作序列,应用于多款VLA模型后,在多个基准及真实实验中提升了长视界VLA执行的准确率与效率

Comments Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28643 2026-09-01 cs.CL cs.AI 新提交

Redesigning and Auditing Deep Research Writing for Faithful Reports

深度研究写作的重新设计与审计以生成忠实报告

Hiroaki Hayashi, Pranav Narayanan Venkit, Prafulla Kumar Choubey, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 针对深度研究系统的细粒度事实错误问题,提出CLAIMPROBE审计方法,设计CLAIMWRITER主张分层写作器,可显著降低幻觉、提升必要事实召回率且成本效益更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-09-01 cs.CL cs.AI cs.MA 版本更新

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏