arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-01 至 2026-01-01 共收录 193 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 50 篇

2512.25055 2026-01-01 cs.AI cs.HC 85%

Context-aware LLM-based AI Agents for Human-centered Energy Management Systems in Smart Buildings

面向人类中心的基于大语言模型的AI代理用于智能建筑中的能源管理系统

Tianzhi He, Farrokh Jazizadeh

机构 * organization= School of Civil \& Environmental Engineering Construction Management, The University of Texas at San Antonio , addressline= BSE 1.310, One UTSA Circle , city= San Antonio , postcode= 78249 , state= TX , country= U.S. organization= Department of Civil Environmental Engineering, Virginia Polytechnic Institute State University , addressline= 200 Patton Hall, 750 Drillfield , city= Blacksburg , postcode= 24060 , state= VA , country= U.S.

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于大语言模型的AI代理,用于智能建筑中的人类中心能源管理,通过自然语言交互实现情境感知的能源优化与管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21635 2026-01-01 cs.CL 85%

Heaven-Sent or Hell-Bent? Benchmarking the Intelligence and Defectiveness of LLM Hallucinations

天降还是地狱?评估大语言模型幻觉的智能与缺陷

Chengxu Yang, Jingling Yuan, Siqi Cai, Jiawei Jiang, Chuang Hu

机构 * Wuhan University of Technology(武汉理工大学) Hubei Key Laboratory of Transportation Internet of Things(湖北省交通运输物联网重点实验室) BreathingCORE Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HIC-Bench框架,通过分类智能与缺陷幻觉,评估LLM在创造力与准确性之间的平衡,揭示幻觉对科学创新的推动作用。

Comments Published as a conference paper at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04235 2026-01-01 cs.CL 85%

Addressing Hallucinations with RAG and NMISS in Italian Healthcare LLM Chatbots

通过RAG和NMISS解决意大利医疗LLM聊天机器人中的幻觉

Maria Paola Priola

机构 * Department of Economics and Business, University of Cagliari(经济与商业系,卡利亚里大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过RAG和NMISS方法有效缓解和检测LLM中的幻觉问题,验证了GPT-4和NMISS对提升医疗领域LLM性能的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18565 2026-01-01 cs.CL cs.AI 84%

Bielik 7B v0.1: A Polish Language Model -- Development, Insights, and Evaluation

Bielik 7B v0.1:波兰语言模型——开发、见解与评估

Krzysztof Ociepa, Łukasz Flis, Krzysztof Wróbel, Adrian Gwoździej, Remigiusz Kinas

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 Bielik 7B v0.1通过创新技术提升波兰语处理能力,实现多项NLP任务性能提升,为语言AI发展提供新基准。

Journal ref Computer Science 26(4) (2025) 131-161

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24947 2026-01-01 cs.CV cs.CL 83%

CPJ: Explainable Agricultural Pest Diagnosis via Caption-Prompt-Judge with LLM-Judged Refinement

CPJ: 通过基于提示-判断的图像描述实现可解释的农业害虫诊断

Wentao Zhang, Tao Fang, Lina Lu, Lifei Wang, Weihe Zhong

机构 * Business School, Shandong University of Technology, Shandong, China(山东科技大学商学院) Institute of International Language Services Studies, Macau Millennium College, Macau SAR, China(国际语言服务研究所,澳门 Millennium 学院)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 CPJ通过基于提示-判断的图像描述实现可解释的农业害虫诊断,无需训练即可提升诊断性能。

Comments This paper is 6 pages in length and contains 2 figures. Tao Fang (Corresponding Author), Lina Lu (Co-corresponding Author)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15301 2026-01-01 cs.CL cs.AI 81%

A Survey on LLM-Assisted Clinical Trial Recruitment

关于LLM辅助临床试验招募的综述

Shrestha Ghosh, Moritz Schneider, Carina Reinicke, Carsten Eickhoff

机构 * University of Tübingen(图宾根大学) Boehringer Ingelheim(勃林格殷曼)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM在临床试验招募中匹配试验与患者任务的应用,分析了现有方法和挑战,并探讨了未来发展方向。

Comments Accepted to IJCNLP-AACl 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17083 2026-01-01 cs.CL cs.AI 79%

When F1 Fails: Granularity-Aware Evaluation for Dialogue Topic Segmentation

当F1失效时:面向对话主题分段的粒度感知评估

Michael H. Coen

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出粒度感知评估框架,用于对话主题分段,强调粒度选择而非单一边界预测。

Comments 34 pages, 4 figures. Evaluation and methodology study on dialogue topic segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03179 2026-01-01 cs.AI cs.LG cs.MA 79%

Toward Autonomous Engineering Design: A Knowledge-Guided Multi-Agent Framework

迈向自主工程设计:一种知识引导的多智能体框架

Varun Kumar, George Em Karniadakis

机构 * School of Engineering, Brown University(布朗大学工程学院) Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种知识引导的多智能体框架,用于提升工程设计的效率与质量,通过协作智能体和知识图谱实现自动化设计优化。

Comments Added appendices and updated literature review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23739 2026-01-01 cs.CL cs.AI cs.CV cs.RO 79%

Break Out the Silverware -- Semantic Understanding of Stored Household Items

拿出银器——对存储家居物品的语义理解

Michaela Levi-Richter, Reuth Mirsky, Oren Glickman

机构 * Bar Ilan University, Computer Science Department(巴伊兰大学计算机科学系) Tufts University, Department of Computer Science(塔夫茨大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出NOAM模型,通过结合结构化场景理解和大语言模型推理,实现对家庭物品存储位置的语义理解,显著提升预测准确率并接近人类水平。

Comments Poster presented at the Israeli Seminar on Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24415 2026-01-01 cs.CR cs.HC 78%

Language Model Agents Under Attack: A Cross Model-Benchmark of Profit-Seeking Behaviors in Customer Service

语言模型代理受攻击:客户服务中心中逐利行为的跨模型基准测试

Jingyu Zhang

专题命中 评测与基准 :language model(title);LLM(abstract)

AI总结 本文提出了一项跨领域基准测试,评估客户服务中心中LLM代理在面对利润驱动攻击时的鲁棒性,揭示了攻击的领域和技术依赖性,并提供了可复现的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09009 2026-01-01 cs.LG cs.AI cs.CL 78%

Open-sci-ref-0.01: open and reproducible reference baselines for language model and dataset comparison

Open-sci-ref-0.01: 开放和可重复的参考基线用于语言模型和数据集比较

Marianna Nezhurina, Jörg Franke, Taishi Nakamura, Timur Carstensen, Niccolò Ajroldi, Ville Komulainen, David Salinas, Jenia Jitsev

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 open-sci-ref通过开放和可重复的参考基线,为语言模型和数据集的比较提供标准化评估框架,支持训练过程的比较与未来研究。

Comments v.1.1. AAAI Workshop on Reproducible Artificial Intelligence (RAI, https://reproducibleai.github.io) 2026, camera ready version. Model weights and intermediate training checkpoints are available at https://huggingface.co/collections/open-sci/open-sci-ref-001; code for reproducing training, evaluation and raw experiments data at https://github.com/LAION-AI/open-sci-ref-0.01

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23897 2026-01-01 cs.NI 78%

Wireless Multimodal Foundation Model (WMFM): Integrating Vision and Communication Modalities for 6G ISAC Systems

无线多模态基础模型(WMFM):为6G ISAC系统集成视觉与通信模态

Mohammad Farzanullah, Han Zhang, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出基于对比学习的无线多模态基础模型WMFM,通过联合学习无线信道系数和视觉图像,实现6G ISAC系统的高效多模态学习与应用。

Comments Journal Paper, 13 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25015 2026-01-01 cs.CL 77%

MAMA-Memeia! Multi-Aspect Multi-Agent Collaboration for Depressive Symptoms Identification in Memes

MAMA-Memeia! 多维度多智能体协作在表情包抑郁症状识别中的应用

Siddhant Agarwal, Adya Dhuler, Polly Ruhnke, Melvin Speisman, Md Shad Akhtar, Shweta Yadav

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MAMAMemeia通过多智能体多维度协作框架,利用CAT能力提升表情包抑郁症状识别的宏F1指标,达到7.55%的提升,成为新的基准模型。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24834 2026-01-01 cs.AI 77%

GenZ: Foundational models as latent variable generators within traditional statistical models

GenZ:在传统统计模型中通过可解释的语义特征作为潜在变量生成器的基础模型

Marko Jojic, Nebojsa Jojic

机构 * Arizona State University(亚利桑那州立大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GenZ通过可解释的语义特征连接基础模型与统计模型,实现更精准的预测,其在房地产价格预测和电影推荐中均取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07017 2026-01-01 cs.SE cs.AI 77%

Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice

基于实践丰富上下文的LLM细粒度代码审查基准测试

Ruida Hu, Xinchen Wang, Xin-Cheng Wen, Zhao Zhang, Bo Jiang, Pengfei Gao, Chao Peng, Cuiyun Gao

机构 * Harbin Institute of Technology(哈尔滨工业大学) ByteDance(字节跳动)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ContextCRBench通过丰富上下文的细粒度代码审查基准测试,评估LLM在代码审查中的性能,发现文本上下文比代码上下文更有效,且在工业应用中提升了审查系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22418 2026-01-01 cs.SE cs.HC 75%

Building Software by Rolling the Dice: A Qualitative Study of Vibe Coding

通过掷骰子构建软件:关于vibe编码的定性研究

Yi-Hung Chou, Boyuan Jiang, Yi Wen Chen, Mingyue Weng, Victoria Jackson, Thomas Zimmermann, James A. Jones

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过分析vibe编码实践,揭示开发者在依赖AI生成代码时的行为差异及心理模型影响,为软件工程的未来研究和工具设计提供新方向。

Comments Accepted for publication at the ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (ESEC/FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06205 2026-01-01 cs.AI cs.CL cs.LG 75%

On measuring grounding and generalizing grounding problems

关于测量 grounding 并推广 grounding 问题

Daniel Quigley, Eric Maynard

机构 * Center for Possible Minds(可能心智中心) Indiana University(印第安纳大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种框架,用于测量和推广 grounding 问题,通过定义不同需求和评估标准,分析了符号、参照、向量和关系四种模式的 grounding 现状,并探讨了其在不同任务中的表现。

Comments resubmission: 39 pages, 85 sources, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24340 2026-01-01 cs.CV cs.AI cs.CL 73%

DermaVQA-DAS: Dermatology Assessment Schema (DAS) & Datasets for Closed-Ended Question Answering & Segmentation in Patient-Generated Dermatology Images

DermaVQA-DAS:皮肤科评估方案(DAS)及用于患者生成皮肤科图像中封闭式问答与分割的数据库

Wen-wai Yim, Yujuan Fu, Asma Ben Abacha, Meliha Yetisgen, Noel Codella, Roberto Andres Novoa, Josep Malvehy

机构 * Microsoft Health AI(微软健康人工智能) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Hospital Clinic of Barcelona(巴塞罗那医院诊所)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 DermaVQA-DAS引入了皮肤科评估方案DAS,支持封闭式问答与分割任务,通过专家标注数据集和多模态模型评估,提升患者为中心的皮肤科视觉语言模型研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23713 2026-01-01 cs.CL cs.AI 73%

PyBangla at BLP-2025 Task 2: Enhancing Bangla-to-Python Code Generation with Iterative Self-Correction and Multilingual Agents

在BLP-2025任务2中提升孟加拉语到Python代码生成:通过迭代自我纠正和多语言代理

Jahidul Islam, Md Ataullha, Saiful Azad

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BanglaCodeAct框架,通过多代理提示和迭代自我纠正,提升孟加拉语到Python代码生成的性能,实验显示Qwen3-8B结合该框架在开发集和盲测集上分别达到94.0%和71.6%的准确率。

Comments 6 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03401 2026-01-01 cond-mat.mtrl-sci 71%

A Comprehensive Assessment and Benchmark Study of Large Atomistic Foundation Models for Phonons

对大原子基础模型在声子特性上的全面评估和基准研究

Md Zaibul Anam, Ogheneyoma Aghoghovbia, Mohammed Al-Fahdi, Lingyu Kong, Victor Fung, Ming Hu

专题命中 评测与基准 :foundation model(title)

AI总结 本文评估了六种大原子基础模型在声子特性预测中的表现,发现EquiformerV2在预测原子力和三阶IFCs方面表现最佳,而微调版本在预测二阶IFCs、LTC等声子性质上优于其他模型。

Journal ref Advanced Intelligent Discovery 2025, 0, e202500075

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24733 2026-01-01 cs.CL 70%

BIOME-Bench: A Benchmark for Biomolecular Interaction Inference and Multi-Omics Pathway Mechanism Elucidation from Scientific Literature

BIOME-Bench: 一个用于生物分子相互作用推断和多组学通路机制阐明的基准

Sibo Wei, Peng Chen, Lifeng Dong, Yin Luo, Lei Wang, Peng Zhang, Wenpeng Lu, Jianbin Guo, Hongjun Yang, Dajun Zeng

机构 * Beijing Wenge Technology Co., Ltd(北京文格科技有限公司) Experimental Research Center, China Academy of Chinese Medical Sciences(中国中医科学院实验研究中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东科学院)) School of New Media and Communication, Tianjin University(天津大学新闻与传播学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BIOME-Bench通过四阶段工作流评估LLMs在多组学分析中的生物分子相互作用推断和通路机制阐明能力,揭示现有模型在细粒度关系区分和通路解释上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24587 2026-01-01 stat.ML cs.LG 70%

MultiRisk: Multiple Risk Control via Iterative Score Thresholding

MultiRisk: 多风险控制 via 迭代分数阈值

Sunay Joshi, Yan Sun, Hamed Hassani, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MultiRisk通过迭代分数阈值控制多个风险约束,利用动态规划算法实现对大型语言模型在安全约束下的有效控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00683 2026-01-01 cond-mat.mtrl-sci cs.LG 70%

Testing the spin-bath view of self-attention: A Hamiltonian analysis of GPT-2 Transformer

检验自注意力机制的自旋浴观点:GPT-2变换器的哈密顿量分析

Satadeep Bhattacharjee, Seung-Cheol Lee

机构 * Indo-Korea Science and Technology Center (IKST)(印度-韩国科学技术中心) Electronic Materials Research Center(电子材料研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过分析GPT-2变换器的哈密顿量,验证了自旋浴观点对自注意力机制的解释,发现理论logit间隙与模型实证token排名呈强负相关,证实了因果联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17126 2026-01-01 cs.CV cs.LG 70%

MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs

MM-SpuBench:迈向更好地理解多模态大语言模型中伪偏差的深入研究

Wenqian Ye, Bohan Liu, Guangtao Zheng, Di Wang, Yunsheng Ma, Xu Cao, Bolin Lai, James M. Rehg, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MM-SpuBench通过分析多模态大语言模型中的伪偏差,揭示其存在与缓解的挑战,提供公开基准以促进相关技术发展。

Comments Accepted at KDD 2026 (Dataset and Benchmark Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23844 2026-01-01 cs.SE cs.AI cs.HC 70%

From Correctness to Collaboration: Toward a Human-Centered Framework for Evaluating AI Agent Behavior in Software Engineering

从正确性到协作:迈向以人为中心的评估AI代理行为在软件工程中的框架

Tao Dong, Harini Sampath, Ja Young Lee, Sherry Y. Shi, Andrew Macvean

机构 * Google LLC(谷歌公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出以人为中心的评估框架,旨在评估AI代理在软件工程中的协作行为,通过定义代理行为期望和引入情境适应框架,推动AI代理向协作智能发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23716 2026-01-01 cs.CL 70%

Noise-Driven Persona Formation in Reflexive Neural Language Generation

噪声驱动的自我反思神经语言生成中的身份形成

Toshiyuki Shigemura

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Luca-Noise Reflex协议,通过注入噪声种子研究大语言模型中噪声驱动的身份形成,揭示三种稳定的生成模式并验证噪声对生成动态的影响。

Comments 324 pages, 9 figures (Figure 7 intentionally skipped), with Appendices A-I. This manuscript presents a computational framework for noise-driven persona formation in neural language generation, analyzing 152 generation cycles using GPT-5.1 with stochastic noise seeds generated by Microsoft Copilot. Primary category: cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23711 2026-01-01 cs.CL 70%

CAT: A Metric-Driven Framework for Analyzing the Consistency-Accuracy Relation of LLMs under Controlled Input Variations

CAT:一种基于度量的分析LLMs在受控输入变化下一致性-准确性关系的框架

Paulo Cavalin, Cassia Sanctos, Marcelo Grave, Claudio Pinhanez, Yago Primerano

机构 * IBM Research Brazil(IBM巴西研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CAT框架通过分析LLMs在可控输入变化下的准确性与一致性关系,提供了一种评估方法,结合CAR曲线和CORE指数,量化准确率与一致性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24119 2026-01-01 cs.CV 67%

GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation

GeoBench: 通过分层评估重新思考多模态几何问题解决

Yuan Feng, Yue Yang, Xiaohan He, Jiatong Zhao, Jianlong Chen, Zijun Chen, Daocheng Fu, Qi Liu, Renqiu Xia, Bo Zhang, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 GeoBench通过分层评估框架,系统评估几何问题解决能力,揭示任务复杂度对性能的影响及子目标分解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21799 2026-01-01 cs.IR 67%

KG20C & KG20C-QA: Scholarly Knowledge Graph Benchmarks for Link Prediction and Question Answering

KG20C & KG20C-QA:面向链接预测和问答的学术知识图谱基准测试

Hung-Nghiep Tran, Atsuhiro Takasu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出KG20C和KG20C-QA两个学术知识图谱基准测试,用于提升基于学术数据的问答和推理能力。

Comments extracted and extended from author's PhD thesis, "Multi-Relational Embedding for Knowledge Graph Representation and Analysis"

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12980 2026-01-01 cs.IR cs.DB 67%

Reveal Hidden Pitfalls and Navigate Next Generation of Vector Similarity Search from Task-Centric Views

揭示隐藏的陷阱并导航下一代向量相似性搜索:从任务导向的角度

Tingyang Chen, Cong Fu, Jiahua Wu, Haotian Wu, Hua Fan, Xiangyu Ke, Yunjun Gao, Yabo Ni, Anxiang Zeng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 从任务导向角度提出Iceberg基准测试套件,揭示向量相似性搜索中信息损失漏斗的三大来源,并通过任务特定的元特征和决策树指导方法选择与调优。

Comments SIGMOD2026

详情

展开后加载摘要…

URL PDF HTML 收藏