Arming Data Agents with Tribal Knowledge
赋予数据代理以部落知识
机构 * UC Berkeley(伯克利大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Tk-Boost通过积累经验纠正NL2SQL代理的误解,提升其在大规模数据库中的查询准确性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
赋予数据代理以部落知识
机构 * UC Berkeley(伯克利大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Tk-Boost通过积累经验纠正NL2SQL代理的误解,提升其在大规模数据库中的查询准确性。
MedReasoner: 通过强化学习实现从临床思维到像素级精度的推理 grounding
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 MedReasoner 通过强化学习实现从临床推理到像素级精度的医学影像 grounding,提出统一医学推理 grounding 任务和 U-MRG-14K 数据集,展示其在医学影像分析中的优越性能。
Comments AAAI2026
具有显著性意识的多路由思考:重新审视视觉-语言推理
机构 * University of Virginia(弗吉尼亚大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 本文提出Saliency-Aware Principle(SAP)方法,通过高层次推理原则提升视觉-语言推理的稳定性与效率,减少幻觉并提升响应速度。
Comments preprint 10 pages, 4 figures
基于算法的可靠且意图保留的代码翻译管道
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 本文提出一种基于算法的代码翻译管道,通过引入语言中立的中间规范提升翻译准确性和可靠性,实验结果显示其在多个指标上均优于直接翻译方法。
Comments Accepted at 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)
可信且公平的SkinGPT-R1:用于在不同种族中普及皮肤病推理
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) ; Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学) ; Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(皮肤科,天津整合皮肤科研究所,天津中医研究院附属医院) ; Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院) ; Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(皮肤科,北京安贞医院,首都医科大学) ; School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) ; Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; Department of Dermatology, Beijing Aerospace General Hospital(皮肤科,北京航天总医院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 SkinGPT-R1通过公平性意识的专家混合架构实现可解释且公平的皮肤病诊断,提升不同种族间的诊断准确性与安全性。
恶意示例:通过模板填充和不安全推理实现大语言模型的劫持
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 TrojFill通过模板填充和不安全推理漏洞,实现对大语言模型的安全过滤绕过,展示了对齐LLM的系统性弱点。
Comments under review
语言统计与虚假信念推理:来自41个开放权重语言模型的证据
机构 * Rutgers University - Newark(新泽西罗格斯大学-新布朗斯维尔) ; UC San Diego(加州大学圣地亚哥分校) ; Stony Brook University(史泰文斯理工学院) ; MIT(麻省理工学院)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过41个开放权重语言模型测试,发现人类和模型在非事实性动词提示下对虚假信念的归因存在偏差,揭示语言统计学在解释人类认知中的局限性。
Comments 15 pages, 7 figures, submitted to conference
SurgRAW:基于链式推理的多智能体工作流用于机器人手术视频分析
机构 * National University of Singapore(国立新加坡大学) ; Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR)(生物信息研究所(BII),科技研究局(A*STAR)) ; Wellcome/EPSRC Centre for Interventional and Surgical Sciences (WEISS) and the Department of Medical Physics and Biomedical Engineering, University College London(Wellcome/EPSRC介入与外科科学中心(WEISS)及伦敦大学学院医学物理与生物医学工程系)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 SurgRAW通过基于链式推理的多智能体工作流,在机器人手术视频分析中实现零样本多任务推理,提升准确性和临床相关性。
Journal ref IEEE Robotics and Automation Letters, 2026, pp. 1-8
空间音频问答与动态声源运动推理
机构 * Qualcomm Technologies Inc.(高通技术公司)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。
视觉自校准:一种像素引导的准确图表解析范式
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CPII under InnoHK(创新香港下的CPII) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 推理与问题求解 :language model(abstract)
AI总结 本文提出视觉自校准范式,通过像素引导提升图表解析的准确性,并构建了新的挑战性基准测试ChartP-Bench。
提前窥视田野研究:探索VLM人设作为人机交互领域具身研究的支持工具
专题命中 推理与问题求解 :language model(abstract)
AI总结 本文提出利用VLM人设模拟田野研究结果,验证其在具身研究中的应用潜力,发现其在响应模式上接近人类但缺乏多样性。
Comments Accepted to CHI 2026
MedVLThinker: 多模态医疗推理的简单基线
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; Amazon Research(亚马逊研究院)
专题命中 推理与问题求解 :SFT(abstract)
AI总结 MedVLThinker通过简单基线和RLVR方法,在医疗多模态推理中实现新突破,超越现有开源模型并接近专有模型性能。
Comments Project page: https://ucsc-vlaa.github.io/MedVLThinker/ ; Code: https://github.com/UCSC-VLAA/MedVLThinker ; Model and Data: https://huggingface.co/collections/UCSC-VLAA/medvlthinker-688f52224fb7ff7d965d581d ; Accepted by ML4H'25
IndicEval:一种用于大型语言模型的双语印度教育评估框架
机构 * Department of Computer Sciencce and Engineering(计算机科学与工程系) ; Swami Vivekanand Technical University Bhilai, India(斯瓦米·维韦kanand技术大学比哈尔,印度)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 IndicEval提出了一种双语印度教育评估框架,通过真实考试题目评估LLM的推理、领域知识和双语适应性,揭示了跨模型性能差异和多语言退化问题。
大型语言模型在水分配系统建模与决策中的应用
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LLM-EPANET框架,利用大型语言模型实现与EPANET的自然语言交互,提升水分配系统建模与决策的效率和透明度。
Comments Accepted to EWRI Congress 2025
大型语言模型用于协助美国大学申请
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。
大语言模型中的长尾知识:分类、机制、干预与影响
机构 * Google(谷歌)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了大语言模型中长尾知识的定义、机制、干预及影响,提出统一框架以理解其表现和挑战。
AREG:对抗性资源提取游戏用于评估大型语言模型的说服力与抗性
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Islamic University of Technology(伊斯兰技术大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 AREG通过对抗性资源提取游戏评估大型语言模型的说服与抗性能力,发现两者弱相关且存在系统性防御优势。
Comments 15 pages, 5 figures, 11 tables. Includes appendix with detailed experimental results and prompts
内在公平动态:定向大语言模型对齐中的偏见溢出效应
机构 * Department of Applied Mathematics and Computer Science, Technical University of Denmark(应用数学与计算机科学系,丹麦技术大学) ; Department of Mathematical Sciences, University of Copenhagen(数学科学系,哥本哈根大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 本文研究了定向性别对齐对多敏感属性公平性的影响,发现改善某一属性公平性可能加剧其他属性的不平等,强调了多属性、情境感知公平性评估的重要性。
Comments Submitted to the BiAlign CHI Workshop 2026
基于经验累积分布函数的LLM代理系统分析聚类
机构 * NTT Computer and Data Science Laboratories(NTT计算机与数据科学实验室)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出基于经验累积分布函数的LLM代理系统评估方法,通过聚类分析揭示不同配置下的响应质量分布差异。
评分的不确定性有多大?基于大语言模型的自动评估中不确定性度量的基准测试
机构 * Michigan State University(密歇根州立大学) ; University of Southern California(南加州大学) ; Washington State University(华盛顿州立大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文研究了基于大语言模型的自动评估中不确定性度量的基准测试,分析了不同方法的优劣及影响因素,旨在提升评分系统的可靠性。
AgentNoiseBench: 在噪声条件下评估工具使用LLM代理的鲁棒性基准测试
机构 * University of Science(科学大学) ; National University of Singapore, Singapore(新加坡国立大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 AgentNoiseBench通过在噪声环境中评估LLM代理的鲁棒性,揭示了现有模型对现实扰动的敏感性。
VerifyBench: 大型语言模型参考式奖励系统的基准测试
机构 * Zhejiang University(浙江大学) ; Meituan Group(美团集团) ; Peking University(北京大学) ; University of Electronic Science and Technology of China(电子科技大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 VerifyBench通过设计专门的基准测试评估基于参考的奖励系统,揭示现有验证器在复杂任务中的不足,推动推理模型训练的改进。
Comments ICLR 2026: https://openreview.net/forum?id=JfsjGmuFxz Project Page: https://zju-real.github.io/VerifyBench Dataset: https://huggingface.co/datasets/ZJU-REAL/VerifyBench Code: https://github.com/ZJU-REAL/VerifyBench
用LLM生成的测试用例验证形式规范
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 本文利用GPT-5等大语言模型自动生成测试用例,用于验证形式规范的正确性,有效检测人类编写错误的规范。
通过谈判评估语言模型的代理能力
机构 * EPFL(瑞士联邦理工学院) ; UGA(普罗万大学) ; CNRS(法国国家科学研究中心) ; LIG(里莫恩-盖朗实验室) ; Stanford University(斯坦福大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过谈判游戏评估语言模型的代理能力,发现封闭源模型更擅长完成任务,合作谈判游戏最具挑战性,且强模型可能输给弱对手。
Comments Accepted to ICLR 2024, code and link to project data are made available at https://github.com/epfl-dlab/LAMEN
迈向语言学习的初学者友好型LLM:对话中的难度控制
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出通过可控生成技术提升初学者与LLM对话的可理解性,实验表明该方法能显著提高输出清晰度,并引入新的评估指标支持语言学习研究。
Comments EACL 2026
对MEG基础模型的样本级分词策略系统评估
机构 * Oxford Centre for Human Brain Activity(牛津人类大脑活动中心) ; University of Oxford(牛津大学) ; Nuffield Department of Clinical Neurosciences(努尔菲尔德临床神经科学系) ; Department of Psychiatry(精神病学系)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文系统评估了MEG数据中样本级分词策略对神经基础模型的影响,提出了一种基于自编码器的可学习分词方法,实验表明简单固定分词策略在重建准确性和下游任务性能上表现良好。
Comments 15 pages, 10 figures, 1 table
远在天边:评估语言模型在澳大利亚英语和印度英语俚语上的表现
机构 * University of New South Wales(新南威尔士大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究评估了语言模型在澳大利亚英语和印度英语俚语上的表现,发现印度英语在目标词选择任务中表现更优,揭示了生成与判别能力在俚语理解上的不对称性。
Comments Accepted as a paper at 13th VarDial workshop at EACL 2026
视觉-语言模型在位置披露中是否尊重上下文完整性?
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
AI总结 本文研究了视觉-语言模型在位置披露中的隐私问题,指出现有模型在隐私保护方面存在不足,提出VLM-GEOPRIVACY基准以评估模型对上下文完整性的尊重程度。
Comments Accepted by ICLR 2026. Code and data can be downloaded via https://github.com/99starman/VLM-GeoPrivacyBench
利用基础模型实现无需校准的c-VEP脑机接口
机构 * Department of Biomedical Engineering, University of Calgary(生物医学工程系,卡尔加里大学) ; Department of Electrical and Computer Engineering, Queen’s University(电气与计算机工程系,皇后大学) ; Department of Pediatric and Clinical Neuroscience, University of Calgary(儿科与临床神经科学系,卡尔加里大学) ; Department of Electrical and Software Engineering, University of Calgary(电气与软件工程系,卡尔加里大学)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG
AI总结 本文提出基于基础模型的无需校准c-VEP脑机接口方法,通过训练分类头实现即插即用,无需受试者特定数据,实验显示在两个数据集上均取得较高准确率。
Comments 8 Pages, 2 figures, Accepted and Presented at the IEEE SMC Conference 2025
Journal ref 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Vienna, Austria, 2025, pp. 4564-4571
LLMs能评估人格吗?验证对话式AI用于特质分析
机构 * University of Tartu(塔尔图大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究验证了LLM在对话中评估人格特质的可行性,发现其在部分人格维度上与传统问卷结果相当,但需进行特定特质校准。
Comments 13 pages, 7 figures, 4 tables, 2 appendices