arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Salesforce

2026-04-21 至 2026-04-21 共收录 7
2604.17677 2026-04-21 cs.AI

Semantic Entanglement in Vector-Based Retrieval: A Formal Framework and Context-Conditioned Disentanglement Pipeline for Agentic RAG Systems

向量检索中的语义纠缠:一种形式框架和上下文条件下的解缠管道用于智能RAG系统

Nick Loghmani

机构 * Salesforce School of Information Studies, Syracuse University(苏利文大学信息研究学院)

AI总结 本文提出了一种形式框架和上下文条件解缠管道,用于解决向量检索中因多主题文档交织导致的语义纠缠问题,通过改进文档结构提升检索精度。

Comments 34 pages, 5 Figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17240 2026-04-21 cs.AI

Safe and Policy-Compliant Multi-Agent Orchestration for Enterprise AI

企业AI中的安全且符合政策的多智能体编排

Vinil Pasupuleti, Shyalendar Reddy Allala, Siva Rama Krishna Varma Bayyavarapu, Shrey Tyagi

机构 * International Business Machines (IBM)(国际商业机器公司(IBM)) Global Atlantic Financial(全球大西洋金融) Salesforce Inc(Salesforce公司)

AI总结 本文提出CAMCO框架,通过约束投影引擎、适应性风险加权拉格朗日效用塑造和迭代谈判协议,实现企业AI中多智能体的约束优化编排,有效保障政策合规性与风险控制。

Comments 6 pages, 3 figures, 3 tables, IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15690 2026-04-21 cs.AI stat.AP

From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models

从被动度量到主动信号:不确定性量化在大语言模型中的演变角色

Jiaxin Zhang, Wendi Cui, Zhuohang Li, Lifu Huang, Bradley Malin, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院) Intuit(Intuit公司) Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校) Vanderbilt University Medical Center(范德比大学医学中心)

AI总结 本文探讨大语言模型中不确定性量化从被动诊断指标到主动控制信号的演变,分析其在高级推理、自主代理和强化学习中的应用及贡献。

Comments This paper has been accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23542 2026-04-21 cs.CL cs.AI cs.LG

On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization

大语言模型判官的保质期:未来证明、向后兼容性和问题泛化

Janvijay Singh, Austin Xu, Yilun Zhou, Yefan Zhou, Dilek Hakkani-Tur, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Dartmouth College(达特茅斯学院)

AI总结 本文研究了细调判官模型在现实部署中的挑战,探讨了未来证明、向后兼容性和问题泛化三个核心问题,并通过实验发现持续学习在适应响应分布变化方面表现更优。

Comments Updated after ICLR 2026 Acceptance; 29 pages;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16830 2026-04-21 cs.LG cs.AI

The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation

确定性的幻觉:在在线策略蒸馏中解耦能力与校准

Jiaxin Zhang, Xiangyu Peng, Qinglin Chen, Qinyuan Ye, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 本文提出CaOPD框架,通过估计模型运行时的置信度来解决在线策略蒸馏中因信息不匹配导致的过度自信问题,实现了校准优化与能力保持的平衡。

Comments 40 pages, Code: https://github.com/SalesforceAIResearch/CaOPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14240 2026-04-21 cs.AI

LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild

LiveResearchBench: 一个用于真实世界中以用户为中心的深度研究的实时基准

Jiayu Wang, Yifei Ming, Riya Dulepet, Qinglin Chen, Austin Xu, Zixuan Ke, Frederic Sala, Aws Albarghouthi, Caiming Xiong, Shafiq Joty

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Stanford University(斯坦福大学) Salesforce AI Research(Salesforce AI研究院)

AI总结 本文提出LiveResearchBench,一个包含100个专家精选任务的实时基准,涵盖日常生活、企业与学术领域,要求进行广泛、动态的实时网络搜索与综合。通过DeepEval评估17个前沿深度研究系统,揭示其优势、失败模式及关键组件。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12831 2026-04-21 cs.CL cs.AI cs.DB cs.LG

MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training

MTSQL-R1:通过代理训练实现长视界多轮文本到SQL

Taicheng Guo, Hai Wang, ChaoChun Liu, Mohsen Golalikhani, Xin Chen, Xiangliang Zhang, Chandan K. Reddy

机构 * University of Notre Dame(诺特丹大学) Amazon(亚马逊) Salesforce

AI总结 MTSQL-R1通过代理训练框架提升多轮文本到SQL任务的长视界表现,通过环境驱动验证和记忆引导细化提升对话连贯性。

Comments ACL 2026 Main camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏