LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests
LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。
PILOT:通过路径引导、迭代式大语言模型提示进行命令行界面模糊测试
专题命中 评测与基准 :large language model(title);language model(title);prompting(title);LLM(abstract)
AI总结 PILOT通过引导路径和迭代式大语言模型提示生成命令行参数和输入文件,提升模糊测试覆盖率并发现51个零日漏洞。
Comments Accepted at the 47th IEEE Symposium on Security and Privacy (IEEE S&P 2026)
探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究
专题命中 评测与基准 :prompting(title,abstract);LLM(title,comments);large language model(abstract);language model(abstract)
AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。
Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages
专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title)
Comments Accepted by regular paper in NAACL 2025, with 13 pages, 5 figures
专题命中 评测与基准 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments ICLR 2025. 60 pages
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to Autonomous Robots (AuRo) - Special Issue: Large Language Models in Robotics, 2023 and IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2023. Project page: https://tidybot.cs.princeton.edu
专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 99 pages, 16 figures
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;foundation model(comments)
Comments Foundation Models, Large Language Models, Arabic NLP, Arabic Speech, Arabic AI, GPT3.5 Evaluation, USM Evaluation, Whisper Evaluation, GPT-4, BLOOMZ, Jais13b
面向地热井阵列的大型语言模型决策支持与建模
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究评估ChatGPT等前沿LLMs在地热领域的应用潜力,提出用NotebookLM加速生成地热基准,分析地热井阵列等技术的机遇,还展示了LLMs助力地热数值模型自动并行化的案例。
Comments 10 pages, 8 figures. Presented at the 50th Workshop on Geothermal Reservoir Engineering, Stanford University, February 10-12, 2025
Journal ref Proceedings of the 50th Workshop on Geothermal Reservoir Engineering, Stanford University, SGP-TR-229 (2025)
超越基准测试:面向个性化学习的大语言模型场景化评估
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究提出场景化评估框架,以Gemini为外部评估器结合Bradley-Terry模型等,发现不同LLMs在个性化学习场景中教学行为存在差异,为AI增强教育提供有意义的模型行为信号。
用于Verilog代码生成的大型语言模型:文献综述与未来方向
机构 * Zhejiang University \& Northwestern Polytechnical University China ; Northwestern Polytechnical University China ; Nantong University China ; Zhejiang University China ; Monash University Australia ; Singapore Management University Singapore ; Zhejiang University \& Northwestern Polytechnical University ; Northwestern Polytechnical University ; Nantong University ; Zhejiang University ; Monash University ; Singapore Management University
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文综述了LLMs在Verilog代码生成中的应用,分析了现有方法的有效性、局限性及未来研究方向。
Comments Accept in ACM Computing Surveys
以人为中心的基准测试大型语言模型(LLM)育儿建议方法
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文以育儿专家的多维度评分为标准,采用LLM作为评判者,评估15个LLM在100个育儿场景中英、中文的表现,发现聚合分数掩盖弱点、模型隐性影响育儿风格等,为相关应用提供见解。
Comments 15 pages. Submitted for review
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted at NeurIPS 2024-AI4Mat Workshop. The Benchmark and code can be found at https://github.com/vertaix/LLM4Mat-Bench
Journal ref 2025 Mach. Learn.: Sci. Technol. 6 020501
MEDLEY-BENCH:在AI元认知中规模购买评估但不控制
机构 * Department of Clinical Science, Intervention and Technology (CLINTEC), Karolinska Institutet(临床科学、干预与技术部门(CLINTEC),Karolinska研究所) ; Department of Clinical Physiology, Karolinska University Hospital(临床生理学部门,Karolinska大学医院) ; Department of Biomedical Engineering and Health Systems, KTH Royal Institute of Technology(生物医学工程与健康系统部门,KTH皇家理工学院) ; Department of Textile Technology, University of Borås(纺织技术部门,Borås大学) ; Department of Medical Technologies, Karolinska University Hospital(医学技术部门,Karolinska大学医院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 MEDLEY-BENCH评估了12种模型家族中35个模型在五个领域130个模糊实例上的行为元认知能力,发现评估能力随模型规模增加而增强,但控制能力不增加,揭示了元认知能力与规模无关的结论。
基于大语言模型的符号图形编程
机构 * The Chinese University of Hong Kong(香港中文大学) ; Westlake University(西湖大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG
AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。
Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/
评估大型语言模型在跨器官系统CT放射报告零样本疾病标注中的效果
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 本研究评估了大型语言模型在CT报告零样本疾病标注中的效果,发现轻量级LLMs在多器官系统标注中表现优于规则方法,但需注意二元标签的局限性。
Comments 19 pages, 6 figures, 4 tables. Under review in Radiology: Artificial Intelligence
基于大语言模型的代理软件问题解决:综述
机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文综述了基于大语言模型的代理软件问题解决的最新研究,探讨了其方法、挑战及未来方向。
技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?
机构 * East China Normal University(华东师范大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学) ; Tencent Hunyuan(腾讯混元)
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。
MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准
机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Minhang Hospital, Fudan University(复旦大学附属闵行医院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。
反转大语言模型中的箭头
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 本研究首次系统探究大语言模型的反向关系方向性,用含5457个实例的基准评估5种开源模型,发现其反向关系分类存在不对称性,关系描述与实体表示会影响性能。
Comments The preprint is under review in a venue
ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。
Comments Submitted to Journal of Biomedical Informatics (under review)
CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL
AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted by ISSTA 2025
Journal ref Proceedings of the ACM on Software Engineering, Vol. 2, ISSTA, pp. 2136-2157, 2025
非对称通信:大语言模型与语言游戏
专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。
超越认知:认知分裂症与作为技术符号机器的大语言模型
机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。
印度评估:一个在印度语言和文化背景下评估大语言模型的开放基准框架
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 Inspect India Evals是在印度语言文化背景下评估大语言模型的开放框架,基于Inspect AI平台构建,含六个基准。测试五个模型,Sarvam-M 24B和Gemma 2 27B表现最佳,各模型在多语言安全测试中表现一致,DPI安全得分有差异,框架公开可扩展。
Comments 19 pages, 9 figures, 7 tables
跨不同数据集对英语-泰米尔语和泰米尔语-英语的大语言模型和基于Transformer的机器翻译的系统分析
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 研究针对泰米尔语等低资源语言机器翻译挑战,在多数据集上评估多种模型,用BLEU等指标分析其性能,通过注意力分析增强可解释性,证明上下文提示可实现少样本翻译并与监督方法比较,揭示数据集及领域匹配对模型性能的影响。
引导语言模型更具同理心:通过人机协作生成具有文化敏感性的心理健康建议
机构 * Ahsanullah University of Science and Technology(阿山努拉科技大学) ; Bangladesh University of Business and Technology(孟加拉国商业与技术大学) ; The University of New South Wales(新南威尔士大学) ; Jashore University of Science and Technology(贾绍尔科技大学) ; American International University - Bangladesh(孟加拉国美国国际大学)
专题命中 评测与基准 :language model(title,abstract);LLM(title);large language model(abstract);prompting(abstract)
AI总结 研究探索大语言模型在低资源语言中生成同理心心理健康建议的能力,提出角色扮演反思性思维链咨询框架和基于Grok 4的评估框架,通过人机协作及特定策略,提升心理健康建议质量,使其更符合专业咨询。
使用大语言模型衡量跨语言的负面竞选活动:对19个国家1800万条推文的研究
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 该研究利用大语言模型对19个国家1800万条推文进行分析,评估其用于负面竞选跨语言分类的可行性。通过此方法进行跨国研究,基于战略激励框架得出不同类型政党负面竞选程度不同的结论,为相关研究提供新证据并展示了大语言模型的作用。
大型语言模型个性化能力的基准测试
机构 * Adobe Media & Data Science Research(Adobe媒体与数据科学研究)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究大型语言模型个性化能力,将贝叶斯说服框架应用于生成式智能体并实例化到销售场景,发布SDR-Bench语料库,发现个性化存在平台期,通过现场部署验证框架,还公开了SDR-Arena和SDR-Bench以支持相关可重复研究。