ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments NAACL 2025
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments NAACL 2025
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)
Comments 7 pages, 3 figures
Journal ref COSIT 2024 Poster Paper
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)
Comments Accepted at ACL 2024 - Proceedings of the 62st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)
Journal ref Proceedings of the 62st Annual Meeting of the Association for Computational Linguistics - Volume 1: Long Papers (ACL 2024)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments To appear at ICML 2024
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Preprint version, Under Review
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 11 pages, 4 tables, 2 figures
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
基本B效应:基于大语言模型(LLM)的智能体的使用会降低人们选择的独特性与多样性
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究通过实地研究和对照实验发现,使用基于LLM的智能体会降低人们选择的独特性与多样性,且顺序选择、智能体个性化会放大该效应,相关发现对设计维护人类多样性的AI系统具有重要意义。
自提示与跨模型共识:利用大语言模型从科学文献中实现可复现的数据提取
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.AI
AI总结 本研究提出结合自提示与跨模型共识的方法,通过四个工作流程优化LLMs从科学文献提取数据的性能,为科学数据规模化整理提供可行方案。
从安全文档到安全知识支持:面向医疗器械的基于证据的大语言模型框架
专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对现有LLM在医疗器械安全工程中源链接等支持不足的问题,本文提出基于证据的LLM框架,用于安全知识支持,不做安全判定,还给出对应评估策略。
Comments ISSRE 2026, AISQ, 8 pages
EntailLLM:通过逻辑编程结合领域知识验证大语言模型生成的漏洞发现路径
专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 EntailLLM通过逻辑编程结合领域知识验证LLM生成的漏洞发现路径,在三类CWE、四个LLM等多组实验中,将合并蕴含率从78%提升至98%,可端到端部署且无需逐设备调优。
当规范冲突时:一种基于对称性的测量大语言模型(LLM)偏好的框架
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出基于对称性的框架,通过含550个实例的数学基准等评估,发现LLM在冲突规范下有系统性偏好,排序为形式类>纯自然语言>输入-输出示例,可跨领域应用。
Comments Submitted to AAAI 2027
OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现
机构 * OpenAI
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。
Comments 13 pages, two graphs
IPO金融分析师:超越Finance Agent v2的LLM金融分析师评估,带自动评分标准生成——以SpaceX (SPCX) IPO为例
机构 * Vals AI
专题命中 领域大模型 :LLM(title,title_cn);language model(abstract);分类 cs.AI
AI总结 针对IPO尽职调查中长文档检索的挑战,提出IPO Finance Agent框架,通过上下文检索和自动评分标准生成,在SpaceX S-1文件上评估多个LLM,最佳模型Qwen 3.7 Max准确率79.4%,成本$0.30/查询。
一种基于NLP的课程-劳动力市场对齐框架:模式约束的LLM抽取、ESCO锚定的语义匹配和多维差距量化
专题命中 领域大模型 :LLM(title,title_cn);prompting(abstract);分类 cs.AI
AI总结 提出一个四阶段NLP框架,通过模式约束的LLM抽取、ESCO语义匹配、仲裁协议和验证机制,实现课程与劳动力市场的对齐,并量化多维供需差距。
Comments 53 pages, 9 figures, 4 tables
基于领域适应语言模型的威胁建模:实证评估与洞察
机构 * Department of Systems(系统部) ; School of Information Technology(信息技术学院)
专题命中 领域大模型 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);small language model(abstract)
AI总结 本文通过评估不同规模的领域适应语言模型,探讨了领域适应、模型规模、解码策略和提示技术对STRIDE威胁分类的影响,揭示了当前LLM在结构化威胁建模中的局限性。
PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现
机构 * Columbia University(哥伦比亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; IBM, New York(IBM,纽约)
专题命中 领域大模型 :LLM(title,title_cn);foundation model(abstract);分类 cs.AI
AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。
Comments 23 pages, 3 figures
迈向自主SOC操作:面向安全操作中威胁检测、查询生成与解决的端到端LLM框架
机构 * Ontario Tech University(安大略技术大学)
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出端到端威胁管理框架,通过集成基于集成的检测、语法约束查询生成和检索增强的解决支持,自动化安全操作流程,提升效率与准确性。
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL
Comments WMT 2023 Terminology Translation Task
跨模型一致性分析:AI生成运动处方的重复生成研究:在三个大型语言模型间
机构 * Data Convergence Team, Office of Hospital Information, Seoul National University Bundang Hospital(数据融合团队,医院信息办公室,首尔国立大学医院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究比较了三种大型语言模型在重复生成运动处方时的一致性,发现GPT-4.1在语义相似度上最高,而Gemini 2.5 Flash表现出重复性,揭示了生成行为的差异,强调模型选择应作为临床决策。
Comments 24 Pages, 2 Figures, 6 Tables and 2 Supplementary Materials. v2: Removed personal contact information
Journal ref International Journal of Medical Informatics, 220 (2026) 106594
评估领域自适应大语言模型中的幻觉现象
机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究通过微调Llama-2模型,测试其记忆、回忆和推理能力,发现领域自适应大语言模型在生成新领域特定信息时存在幻觉问题,表明仅靠微调难以有效缓解幻觉。
Comments 13 pages, 2 figures, 3 tables
医疗大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
机构 * John Snow Labs Inc.(约翰·索克斯实验室公司)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出一个多领域红队框架,通过690个临床场景评估11个当代大语言模型,发现平均准确率掩盖了临床意义上的风险,性能方差和最坏情况失败比平均准确率更能反映可靠性,混合评估方法对可信安全评估至关重要。
Comments 10 pages, 4 figures. To be presented at the Text2Story 2026 Workshop (Delft, The Netherlands, 29 March 2026); CEUR Workshop Proceedings (forthcoming). Affiliation: John Snow Labs Inc
JMedEthicBench:用于评估日语大语言模型医疗安全性的多轮对话基准
机构 * Kyoto University(京都大学) ; Hohai University(河海大学) ; The University of Tokyo(东京大学) ; University of Science and Technology of China(中国科学技术大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出首个多轮对话基准JMedEthicBench,基于日本医学会67条指南和7种自动越狱策略生成5万+对抗对话,评估27个模型发现医疗专用模型安全性脆弱,且多轮交互中安全性显著下降。
Comments 12 pages, 6 figures
微不足道的大小,显著的效果:大型语言模型中的尺度向量
机构 * Peking University(北京大学)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文系统研究了大型语言模型中的尺度向量,发现其虽参数占比极小但对预训练至关重要,通过自放大预条件效应优化优化过程,并提出了三种轻量级改进策略,在多种模型规模上一致提升性能。
Comments 36 pages
钙钛矿-R1:一个专门领域的大型语言模型,用于智能发现前驱体添加剂和实验设计
机构 * School of Physics, Renmin University of China(中国人民大学物理学院) ; School of Chemistry and Life Resource, Renmin University of China(中国人民大学化学与生命资源学院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究提出Perovskite-R1,一个专门用于发现钙钛矿太阳能电池前驱体添加剂和实验设计的大型语言模型,通过系统挖掘和整理1232篇高质量科学文献,并整合33269种候选材料,构建了领域特定的指令微调数据集,从而提升材料发现的效率。
Comments 24 pages; 5 figures
Journal ref Communications Materials 7, 86 (2026)
大语言模型中的解释公平性:对LLMs在不同人口群体中解释决策差异的实证分析
机构 * Independent Researcher(独立研究者)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)
AI总结 本文提出解释公平性分类法,分析大语言模型在不同群体中解释决策的差异,发现模型选择与差异幅度密切相关,提出两种提示方法减少解释差异。
Comments 10 pages, 4 figures, 9 tables
评估大型语言模型在科学发现中的表现
机构 * Deep Principle(深原则) ; Department of Computer Science, Cornell University(计算机科学系,康奈尔大学) ; Department of Computer Science and Engineering, The Ohio State University(计算机科学与工程系,俄亥俄州立大学) ; Department of Chemical Engineering & Applied Chemistry, University of Toronto(化学工程与应用化学系,多伦多大学) ; Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,圣母大学) ; QuEra Computing Inc.(QuEra计算公司) ; Department of Pathology, Department of Genetics, Cancer Biology Program, Stanford University School of Medicine(病理学系、遗传学系、癌症生物学项目,斯坦福大学医学院) ; Harvard Law School(哈佛法学院) ; Department of Computer Science, Tufts University(计算机科学系,塔夫茨大学) ; School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) ; Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校) ; Department of Computer Science, Virginia Tech(计算机科学系,弗吉尼亚理工大学) ; Department of Physics, Tsinghua University(物理系,清华大学) ; Institute for Advanced Study, Tsinghua University(清华大学高级研究所) ; Laboratory of Artificial Chemical Intelligence, Ecole Polytechnique Federale de Lausanne(人工化学智能实验室,瑞士联邦理工学院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI、cs.LG
AI总结 本文提出一个基于场景的基准测试,评估LLM在生物学、化学、材料科学和物理学中的科学发现能力,揭示了模型在科学发现任务中的性能差距和改进方向。
针对南非结核病护理的领域专用大型语言模型的开发与初步评估
机构 * University of Pretoria(南非大学)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文提出一种专门用于南非结核病护理的大型语言模型,通过量化低秩适应算法和图检索生成技术,提升了模型在结核病领域的上下文对齐能力。
Comments 12 pages, 2 figures, ICICT 2026 Conference
LayerTracer:一种用于任意大语言模型架构的联合任务-粒子和脆弱层分析框架
机构 * China Electronic Technology Nanhu Research Institute(中国电子科技纳湖研究院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出LayerTracer框架,通过逐层提取隐藏状态并映射到词汇概率分布,实现任务粒子定位与层脆弱性量化分析,为混合架构设计和模型优化提供科学依据。
Comments 5 pages, 3 figures