arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-02-09 至 2026-02-09 共收录 6 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 6 篇

2602.06616 2026-02-09 cs.CR cs.LG 82%

Confundo: Learning to Generate Robust Poison for Practical RAG Systems

Confundo: 学习生成稳健的毒药以应对实际RAG系统

Haoyang Hu, Zhejun Jiang, Yueming Lyu, Junyuan Zhang, Yi Liu, Ka-Ho Chow

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) City University of Hong Kong(香港城市大学)

专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(abstract)

AI总结 Confundo是一种学习生成毒药的框架,通过微调大型语言模型以提高RAG系统的鲁棒性和隐蔽性,有效应对实际系统中的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18659 2026-02-09 cs.CL 70%

CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning

CLaRa:通过连续潜在推理弥合检索与生成

Jie He, Richard He Bai, Sinead Williamson, Jeff Z. Pan, Navdeep Jaitly, Yizhe Zhang

机构 * Apple(苹果公司) University of Edinburgh(爱丁堡大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 CLaRa通过连续潜在推理框架实现检索与生成的统一优化,提升压缩和重排性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06325 2026-02-09 cs.CR cs.SE 50%

Identifying Adversary Tactics and Techniques in Malware Binaries with an LLM Agent

利用LLM代理识别恶意软件二进制中的攻击战术与技术

Zhou Xuan, Xiangzhe Xu, Mingwei Zheng, Louis Zheng-Hua Tan, Jinyao Guo, Tiantai Zhang, Le Yu, Chengpeng Wang, Xiangyu Zhang

专题命中 检索器与排序 :dense retrieval(abstract)

AI总结 TTPDetect通过结合密集检索与LLM神经检索,利用LLM代理识别恶意软件二进制中的TTPs,实现高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16956 2026-02-09 cs.SE cs.LG 50%

SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

SpIDER:面向软件问题定位的时空感知密集嵌入检索

Shravan Chaudhari, Rahul Thomas Jacob, Mononito Goswami, Jiajun Cao, Shihab Rashid, Christian Bock

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 检索器与排序 :dense retrieval(abstract)

AI总结 SpIDER通过结合LLM推理和图结构探索信息,提升代码库中相关代码单元的密集检索性能,实验显示在多个编程语言和基准测试中性能提升达13%。

Comments Initial preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12783 2026-02-09 cs.LG q-fin.ST stat.AP 50%

Credit Risk Estimation with Non-Financial Features: Evidence from a Synthetic Istanbul Dataset

利用非金融特征进行信用风险估计:来自合成伊斯坦布尔数据集的证据

Atalay Denknalbant, Emre Sezdi, Zeki Furkan Kutlu

机构 * Department of Computer Engineering(计算机工程系) Bahcesehir University(巴赫切希尔大学) Department of Big Data Analytics(大数据分析系) Department of Artificial Intelligence(人工智能系)

专题命中 检索器与排序 :retrieval augmented generation(abstract)

AI总结 本文通过合成伊斯坦布尔数据集,利用非金融行为属性提升信用风险评估的准确性,展示了替代金融数据在改善信贷评估中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02213 2026-02-09 cs.LG 50%

InstructLR: A Scalable Approach to Create Instruction Dataset for Under-Resourced Languages

InstructLR: 一种可扩展的方法,用于为资源匮乏语言创建指令数据集

Mamadou K. Keita, Sebastien Diarra, Christopher Homan, Seydou Diallo

机构 * Rochester Institute of Technology(罗切斯特理工学院) RobotsMali MALIBA-AI

专题命中 检索器与排序 :RAG(abstract)

AI总结 InstructLR通过结合LLM生成与双层质量过滤机制,为低资源语言创建高质量指令数据集,促进了三个多领域基准的建立。

详情

展开后加载摘要…

URL PDF HTML 收藏