EviRank: Evidence-Based Confidence Estimation for LLM-Based Ranking
EviRank: 基于证据的LLM排序置信度估计
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出EviRank方法,通过单次前向传播提取三种互补证据并聚合,结合位置感知校准,实现LLM排序的置信度估计与优化。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
EviRank: 基于证据的LLM排序置信度估计
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出EviRank方法,通过单次前向传播提取三种互补证据并聚合,结合位置感知校准,实现LLM排序的置信度估计与优化。
ACE: 面向LLM增强序列推荐的可控各向异性嵌入
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM生成嵌入的强各向异性问题,提出ACE方法,通过线性自编码器结合L2正则化与重构损失控制嵌入分布,平衡几何均匀性与语义保持,在序列推荐中提升性能。
Comments Accepted by SIGIR 2026. 5 pages
超越静态响应:多智能体LLM系统作为社会科学研究的新范式
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文探讨了LLM系统从静态工具向完全智能体系统转变的潜力,提出了一种结构化框架来理解LLM智能体在社会科学研究中的多样化应用,从简单的数据处理器到复杂的多智能体系统,能够模拟涌现的社会动态,并指出在技术边界、方法论和伦理责任方面面临的挑战。
HSUGA:基于层次语义理解与群体感知对齐的LLM增强推荐
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 HSUGA通过引入层次语义理解和群体感知对齐模块,解决LLM增强推荐中用户语义嵌入提取与利用的可靠性与适应性问题,提升推荐性能。
Comments Accepted by ACL 2026 Findings
通过证据引导的LLM报告过滤从常规临床扫描中获得全身CT衰减和体积图表
机构 * Institute of Radiology, School of Medicine and Health, Technical University of Munich(医学与健康学院放射学研究所,慕尼黑技术大学) ; Institute of Neuroradiology, School of Medicine and Health, Technical University of Munich(医学与健康学院神经放射学研究所,慕尼黑技术大学) ; Munich Data Science Institute (MDSI), Technical University of Munich(慕尼黑数据科学研究所(MDSI),慕尼黑技术大学) ; Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑)
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出证据引导的LLM集成方法,通过过滤病理发现,构建病理减少的队列,建立106个解剖结构的全身参考图表,支持标准化定量表型分析和多中心影像研究。
Comments Supplement available at: https://github.com/ai-med/body-charts/blob/main/body_charts_supp.pdf
基于多模态LLM的ICT图像描述:弥合通用与行业领域之间的差距
机构 * GTS, Huawei Technologies Co., Ltd.(华为技术有限公司GTS部门)
专题命中 领域大模型 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出多阶段训练策略,构建ICT领域图像描述模型DICModel,通过合成图像文本对提升模型性能,实验表明其在BLEU指标和准确率上均优于现有模型。
Journal ref 2025 CCF BigData
从隐藏档案到可控个性化:在LLM代理时代推荐系统
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文探讨LLM代理时代推荐系统从隐藏平台档案转向可控个性化,提出五个研究方向,强调用户模型的透明性、隐私保护及跨领域设计。
Comments 6 pages, under review
多LLM令牌过滤与路由用于序列推荐
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出MLTFR框架,通过多LLM令牌空间整合提升序列推荐性能,无需文本输入或模型修改,实验显示优于现有方法。
Comments 11 pages,3 figs
从语言到行动:通过任务感知的MCP服务器推荐提升LLM任务效率
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出任务感知的MCP服务器推荐框架,通过构建任务-工具关联数据集和改进的推荐模型,提升LLM在实际开发任务中的效率和准确性。
Comments 44 pages, 12 figures, 4 tables
超越标记:面向LLM推荐的项感知注意力
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出项感知注意力机制,通过区分项内和项间标记关系,提升LLM在推荐中的表现,实验证明其有效性。
利用大型语言模型(LLM)在文本分类任务中的随机性:在法律事务中定位特权文件
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 本文研究了在法律事务中利用LLM随机性提高特权文件识别准确性的方法,并探讨了其在合规流程中的应用价值。
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
Comments ACMConference on Human Factors in Computing Systems (CHI'25)
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI、cs.LG
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
Comments accepted at ITiCSE 2024, Milan, Italy
面向纳米光子学的大语言模型综合综述:从代理建模到自主设计
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract)
AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。
Comments Accepted for publication in Advanced Photonics
大语言模型作为网络优化的通用策略
机构 * Bytedance(字节跳动) ; Shenzhen International Graduate School(深圳国际研究生院) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Department of Computer Science and Technology(计算机科学与技术系)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract)
AI总结 本文提出Trailblazer框架,利用大语言模型实现跨任务和环境的通用网络策略,通过网络对齐和策略协作机制提升效率与泛化能力。
Comments Arxiv version. Official version has been submitted to IEEE Transactions on Mobile Computing
提示工程并不能普遍提升大型语言模型在临床决策任务中的性能
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 本研究发现提示工程对LLMs在临床决策任务中的性能提升具有高度依赖模型和任务的特性,强调了定制化策略的重要性。
大型语言模型中类人指代消解
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 本研究探究话语结构等认知科学确定的指代消解影响因素对GPT-2-XL等五个开源权重LLM的作用,发现部分LLM对部分因素具类人敏感性,明确了LLM近似人类指代消解的条件。
Comments 7 pages, 6 figures, 1 table. Presented at CogSci 2026 and the 2026 Annual Meeting of the Society for Text & Discourse. Code: https://github.com/wristy/anaphor
对大型语言模型在机器人健康护理员控制中的安全性的基准测试
机构 * Kyushu Institute of Technology(九州工业技术大学)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 本文通过270条有害指令评估72个LLM,在模拟环境中测试其安全性,发现模型大小和发布日期影响安全性能,专有模型更安全,但医疗领域微调和提示防御策略效果有限,需将安全性作为首要考量。
Comments 20 pages, 9 figures, 3 tables, 8 pages supplementary material
为大规模语言模型的可扩展数据归因与估值绘制读出
机构 * Stevens Institute of Technology(史蒂文斯理工学院) ; Lambda Inc.(Lambda公司) ; Columbia University(哥伦比亚大学) ; Mailman School of Public Health(马利曼公共卫生学院) ; University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)
AI总结 本文提出RISE方法,通过聚焦输出层影响热点,利用分解的外积形式实现高效归因与估值,减少存储并扩展至32B参数模型,验证了其在数据检测、领域分离和高质量数据选择中的有效性。
Comments 54 pages
大型语言模型重塑科学语言
机构 * School of Information Management, Nanjing University(南京大学信息管理学院) ; School of Economics and Management, Shanxi University(山西大学经济管理学院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 通过分析2020-2024年间2136万篇摘要,发现LLM导致科学写作词汇复杂度上升、句法复杂度下降,且对非英语母语学者影响更大,可能扩大科学话语与公众语言的差距。
Comments 72 pages, 24 figures
评估大语言模型中联想干扰的两阶段统计框架
机构 * Department of Mathematics and Statistics, University of West Florida(数学与统计学系,西弗吉尼亚大学)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 提出两阶段统计框架,分离响应遵从性与任务一致性,评估三个LLM在性别-职业等领域的联想干扰,发现效应因模型而异。
Comments 11 pages; 2 figures
PersianMedQA: 在波斯语-英语双语医学问答基准上评估大型语言模型
机构 * School of Electrical and Computer Engineering, University of Tehran(德黑兰大学电气与计算机工程学院) ; Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医学科学大学) ; Institute for Research in Fundamental Sciences (IPM)(基础科学研究所(IPM))
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 本文提出PersianMedQA数据集,包含20,785道波斯语医学多选题,用于评估41个LLM在零样本和思维链设置下的双语医学推理能力,发现闭源通用模型表现最佳,而波斯语模型性能较差,且翻译会丢失文化临床线索。
Comments Accepted at LREC 2026 (The Fifteenth Language Resources and Evaluation Conference), Palma, Mallorca, Spain, May 2026
基于大语言模型的多阶段检索在运营技术网络安全合规中的应用:铁路案例研究
机构 * Digital Transit Limited, 3M Buckley Innovation Centre(数字交通有限公司,3M Buckley创新中心) ; Department of Computer Science at University of Huddersfield(赫德瑟尔大学计算机科学系)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 本文提出利用大语言模型和多阶段检索提升铁路网络安全合规性验证,通过对比不同模型展示PCA在合规性验证中的有效性,建立评估指标并指出LLM在合规性验证中的优势与局限。
PoliLegalLM:政治与法律领域大型语言模型的技术报告
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) ; Zhejiang University(浙江大学) ; Zhejiang Zhengfa Xinxi Guanli Zhongxin(浙江正法信息警务中心)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);pretraining(abstract)
AI总结 本文提出PoliLegalLM,通过统一训练框架提升法律知识和推理能力,针对法律领域挑战实现高性能表现。
VIVID-Med: 基于LLM监督的结构化预训练用于可部署的医学ViT
机构 * Shanghai University of Engineering Science(上海工程技术大学) ; National University of Singapore(新加坡国立大学) ; Case Western Reserve University(凯斯西储大学)
专题命中 领域大模型 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
AI总结 VIVID-Med通过LLM监督的结构化预训练方法,实现轻量级可部署的医学ViT模型,在医学图像分析中表现出高效和强泛化能力。
Comments 10 pages, 4 figures