arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2608.10699 2026-08-12 cs.LG cs.AI 新提交 86%

ProTAGAD: A Foundation Model for TAG Anomaly Detection with Decoupled Topological and Textual Prototypes

ProTAGAD:一种用于文本属性图异常检测的基础模型,具有解耦的拓扑和文本原型

Ziyan Wang, Liwen Wu, Cheng Xie, Song Gao, Zhenli He, Xin Jin

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ProTAGAD基础模型,通过解耦拓扑与文本原型构建双原型库,缓解传统方法的异常边界模糊问题,在14个基准数据集的跨域场景中实现最先进TAG异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03079 2026-08-05 cs.CV cs.AI cs.LG stat.AP 新提交 86%

CorePath: A Breast-Specialized Pathology Foundation Model for Core Needle Biopsy Diagnosis and Risk-Controlled Report Generation

CorePath:用于核心针活检诊断和风险可控报告生成的乳腺专用病理基础模型

Ting Yin, Danning Li, Chen Shu, Xiaoxia Yao, Boyu Fu, Yujing Chang, Tianyu Shi, Mengna Feng, Jie Chen, Jing Fu, Xiuli Xiao, Tianlin Li, Mumin Shao, Jiaxin Bi, Wenchuan Zhang, Xiaoyan Wu, Xiao Han, Zhang Zhang, Yuhao Yi, Hong Bu

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究开发乳腺专用病理基础模型CorePath,经7901对数据微调后,在多队列及基准上的CNB诊断任务中性能优于现有模型,结合风险控制模块实现低幻觉的可靠报告生成。

Comments The code will be made publicly available upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28887 2026-08-03 cs.SE cs.AI cs.LG 新提交 86%

To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

添加是机器,删除是人类:测量和缓解大语言模型代码编辑中的删除回避问题

Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia, Gopi Krishnan Rajbahadur, Ahmed E. Hassan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究针对大语言模型代码编辑中的删除回避问题,通过SWE-bench Verified等基准测量其表现,发现后期训练中加入删除相关训练可缓解该问题并提升代码编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24688 2026-07-28 cs.DB cs.CL cs.LG 新提交 86%

Beyond Scale and Generation: Understanding Language Model-based Entity Matching

超越规模和生成:理解基于语言模型的实体匹配

Zeyu Zhang, Xue Li, Iacer Calixto, Paul Groth, Sebastian Schelter

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究基于语言模型的实体匹配,通过控制因子研究Qwen3家族的多种架构、变体和大小,评估跨数据集可迁移性与计算成本,明确模型变体对双编码器的关键作用,以及不同匹配器架构性能差异因素,推动相关研究与基准设计发展。

Comments 12 pages, 6 figures, 7 tables. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24339 2026-07-28 cs.AI cs.CL 新提交 86%

Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families

Gubernaut:用于情感调节的大语言模型代理的确定性稳态控制器,在独立模型家族中得到验证

Dushyant Sharma

机构 * Gubernaut Research(Gubernaut研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型代理的故障模式,提出Gubernaut认知控制器,通过在四个前沿模型上预注册的评估协议验证,该控制器能使模型更平静,有恢复特征等机制,附带可重判记录及预注册故障模式。

Comments 26 pages, 7 figures, 3 tables. Data, transcripts, and analysis scripts: https://github.com/thegubernaut/Gubernaut_Validation Project page: https://gubernaut.com (archived at https://doi.org/10.5281/zenodo.21303518)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23710 2026-07-28 cs.CR cs.AI cs.HC cs.LG cs.MA 新提交 86%

The Illusion of Secure LLM Code: Closing the Security Gap via Iterative Reprompting

安全大语言模型代码的幻觉:通过迭代重新提示缩小安全差距

Ishpuneet Singh, Shreyas Mahajan, Gurjot Singh, Maninder Singh

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型集成到软件开发中自主生成安全认证代码的能力,通过双模式评估框架结合四种提示策略评估五个AI编码助手,发现当前助手不能默认生成安全应用,企业部署需转向持续、标准驱动的验证管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20265 2026-07-23 cs.CL cs.AI 新提交 86%

The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models

可掩码性指数:预测预训练语言模型中的任务目标对齐

Ahmad Pouramini, Mahsa Afsharzadeh

机构 * Sirjan University of Technology(锡尔詹理工大学) Department of Computer Engineering(计算机工程系)

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究提出可掩码性指数(MI),用于评估知识关系适合的提示方式,通过掩码与未掩码模板的DepthRank分数差异计算。在ATOMIC2020基准上评估发现MI与下游生成性能正相关,有助于选择提示模板和策略提取预训练语言模型的关系知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18360 2026-07-22 cs.CR cs.AI cs.LG 新提交 86%

HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers

HALLMARK:诊断大语言模型引用验证器中的三种失败模式

Patrik Reizinger, Wieland Brendel

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型引用验证器的失败模式,通过HALLMARK基准测试评估多种验证器,发现误报率决定验证器是否可部署,并具体指出三种失败模式,强调误报率是部署瓶颈,未检测到的伪造对科学记录代价更高。

Comments 59 pages, 7 figures, 40 tables. Benchmark and code: https://github.com/rpatrik96/hallmark (v1.2.0); verification tool: https://github.com/rpatrik96/bibtexupdater (v1.5.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17979 2026-07-21 cs.LG cs.AI 新提交 86%

Harness Engineering for LLM-Driven GPU Kernel Generation

用于大语言模型驱动的GPU内核生成的工具工程

Yue Shui, Chenyu Ma, Hangfei Xu, Shengzhao Wen, Yanpeng Wang

机构 * Baidu, Inc.(百度公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 在MLSys 2026 FlashInfer竞赛中,针对NVIDIA Blackwell B200 GPU,提出以工具为中心的大语言模型驱动的GPU内核优化系统,分离评估工具与优化控制器,利用Codex等生成候选内核,实验显示优化后平均延迟加速显著,且代理辅助内核效果更佳。

Comments 24 pages, 6 figures. Extended technical report on our submission to the MLSys 2026 FlashInfer AI Kernel Generation Contest. Code: https://github.com/syhya/mlsys26-flashinfer-contest

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16215 2026-07-21 cs.AI cs.CL cs.SE 新提交 86%

RAIL Guard: Closing the Evaluation-to-Remediation Gap in Responsible AI for LLM Agents

RAIL Guard:弥合大语言模型智能体负责任人工智能中评估与修复的差距

Sumit Verma, Pritam Prasun, Pritish Kumar

机构 * Responsible AI Labs(负责任人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型智能体评估与修复差距问题,提出RAIL Guard闭环负责任人工智能管道,在多维度评估输出并迭代修复。实验表明其闭环修复收敛率高,能减少不安全执行,还区分了可修复与结构维度问题,系统开源。

Comments 15 pages, 10 figures, 4 tables. Code: https://github.com/Responsible-AI-Labs/rail-score-sdk (Python). Benchmark: https://huggingface.co/datasets/responsible-ai-labs/rail-guard-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14099 2026-07-17 cs.CL cs.AI cs.CV 新提交 86%

Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs

只需持续提示:评估视觉语言模型中的重复苏格拉底式提示

Shayda Moezzi, Bishoy Galoaa, Lorena Genua, Taskin Padir, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :prompting(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究视觉语言模型在反复提示下的稳定性,引入JKP多轮评估框架,用三种策略对模型提问,在STAR基准子集上评估GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B,发现重复提示利弊兼具且因模型而异,揭示了模型压力反应概况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19727 2026-06-19 cs.CL cs.AI 新提交 86%

NRITYAM: Language Models Meet Art and Heritage of Dance

NRITYAM:语言模型遇见舞蹈的艺术与遗产

Punit Kumar Singh, Niladri Ghosh, Advait Joshiınst, Shailee Choudhary, Michael Färber, Haiqin Yang

机构 * Shenzhen Technology University(深圳技术大学) New Delhi Institute of Management(新德里管理学院) Technische Universität Dresden(德累斯顿工业大学) Ramakrishna Mission Vivekananda Educational and Research Institute(罗摩克里希纳传道会维韦卡南达教育与研究学院) Indian Institute of Technology(印度理工学院) Swami Vivekananda Institute of Technology(斯瓦米·维韦卡南达技术学院) GuangDong Engineering Technology Research Center of Edge Intelligence(广东省边缘智能工程技术研究中心)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 提出NRITYAM基准,包含9,260个跨12语言的文化问答对,评估语言模型对全球舞蹈传统的文化理解能力,涵盖多种模型类型。

Comments 18 pages, 12 figures, in ECML_PKDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14141 2026-06-15 cs.SD cs.AI cs.CL 新提交 86%

Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources

动态声源的时空音频语言建模

Oh Hyun-Bin, Kazuki Shimada, Yuhta Takida, Kim Sung-Bin, Toshimitsu Uesaka, Takashi Shibuya, Kyeongyoon Lee, Tae-Hyun Oh, Yuki Mitsufuji

机构 * POSTECH(浦项科技大学) Sony AI(索尼AI) Sony Group Corporation(索尼集团) Sungkyunkwan University(成均馆大学) KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出ST-AudioLM模型,通过时空音频编码器联合学习事件语义与源轨迹,在ST-AudioQA基准上提升动态声源问答的语义-定位权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11386 2026-06-11 cs.CL cs.AI eess.AS 新提交 86%

Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering

通过激活引导克服全双工口语语言模型中的状态惯性

Cheng-Kuang Chang, Kai-Wei Chang, Alexander H. Liu, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 评测与基准 :language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对全双工口语模型在用户打断时响应延迟的问题,提出基于感知向量的激活引导方法,无需微调即可显著提升中断理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08194 2026-06-09 cs.CL cs.AI 新提交 86%

GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models

GlobeAudio:用于大型音频-语言模型自然主义评估的多语言多文化基准

Ryner Tan, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出GlobeAudio基准,包含5637道多语言多选题,评估大型音频-语言模型在自然音频条件下的听觉推理和文化理解能力,发现开源模型和低资源语言存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18086 2026-07-21 cs.AI 新提交 86%

Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs

临床大语言模型中证据充分性提示的依赖判断的安全增益和特定模型的有用性成本

Koyar Afrasyab

专题命中 评测与基准 :prompting(title);LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 研究临床大语言模型中证据充分性提示的安全增益及有用性成本,通过在公共数据基准中让四个模型用标准提示和包装器回答问题,发现安全增益有方向和幅度差异且依赖评判者,同时存在模型特定的有用性成本。

Comments https://github.com/KAVentures/clinical-evidence-sufficiency-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20896 2026-08-24 cs.SE cs.HC 新提交 86%

Beyond the Traceback: Using LLMs for Adaptive Explanations of Programming Errors

超越回溯:利用大语言模型(LLMs)实现编程错误的自适应解释

Alexandru-Radu Moraru, Shreyan Biswas, Ujwal Gadiraju

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究通过103人众包实验,探究LLM生成的两类编程错误解释对调试的影响,发现LLM提升主观评价但未显著改善客观调试性能,提出自适应AI反馈系统需转向动态调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20822 2026-08-24 cs.CY 新提交 86%

Interaction Effects Between Learner Characteristics and Dialogue Format in TTS Dialogue-Based Lessons

基于TTS对话课程的学习者特征与对话形式间的交互效应

Fumie Watanabe, Tota Suko, Takashi Ishida, Yuko Kuma, Manabu Kobayashi, Shigeichi Hirasawa, Gendo Kumoi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究以222名高一学生为对象,用LLM与TTS生成三类对话课程,发现学习者特征与对话形式对ARCS动机有显著交互效应,提示需结合学习者特征选对话形式,结果为个性化学习设计提供初步证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17355 2026-08-19 cs.CR cs.CE cs.CY 新提交 86%

FlowShield: cryptocurrency anti-money laundering with transaction semantics parsing and fund flow tracking

FlowShield:基于交易语义解析与资金流追踪的加密货币反洗钱

Qishuang Fu, Andreas Deppeler, Joseph K. Liu, Yixin Liu, Shirui Pan, Qin Wang, Weiqing Wang, Tsz Hon Yuen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 FlowShield是一种加密货币反洗钱框架,通过解析交易语义、重构资金流子图并结合LLM与GCN实现洗钱检测,在BybitML等数据集上平均F1达98.0%,还可生成可读报告辅助调查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17029 2026-08-19 cs.SE cs.HC 新提交 86%

LadderTeam: Dual-Agent Laddering Elicitation Framework

LadderTeam:双智能体阶梯式引出框架

Manjushree Aithal, Alexander Kotz, James Mitchell

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 LadderTeam是基于双智能体LLM架构的自动化UX线框图访谈框架,采用三种探测策略,经216次模拟访谈验证,实现高收敛率与可执行响应匹配率,且无主题偏离。

Comments 4 pages, 1 figure, 2 tables, Accepted in ACM AI Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16022 2026-08-18 cs.SE 新提交 86%

OpenHarmony Bench: Evaluating LLMs and Coding Agents on OpenHarmony App Development

OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现

Li Li, Han Hu, Tianjian Zhang, Xin Peng, Fangzhu Mao, Qingyu Zhang, Xiaoheng Xie, Zhongmin Tang, Zhihao Lin, Haolin Ruan, Miaomiao Dong, Liuchuan Zhu, Yue Li, Chi Chen, Wenkang Zhong, Mingfei Zhang, Yang Yu, Bo Sun, Chaorui Zhang, Weixi Zhang, Wei Han, Bo Bai, Kui Liu, Gang Fan, Siru Liu, Jiaqian Zhou, Jiali Sun, Yunbiao Dong, Wenhao Zhong, Yunhong Xu

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15928 2026-08-18 cond-mat.mtrl-sci 新提交 86%

Synthesizing like a chemist: an iterative, feedback-driven loop for materials discovery

像化学家一样合成:用于材料发现的迭代式反馈驱动循环

Fang Sheng, Steven B. Torrisi, Amanda Volk, Kevin Tran, Koki Nakano, Brian W. Anthony, Tonio Buonassisi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出一种结合LLM、高光谱成像与多目标贝叶斯优化的闭环框架,可自动化材料合成工作流程,在配对优化中表现优于基线方法,还成功合成了未报道的钙钛矿型化合物Rb3BiI6薄膜。

Comments 38 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13454 2026-08-14 cs.HC 新提交 86%

Before You Say It: Anticipating Verbal Behavior from Longitudinal Everyday Conversations with LLMs

在你开口前:基于与大语言模型(LLM)的日常纵向对话预测言语行为

Yasith Samaradivakara, Valdemar Danry, Paul Liang, Pattie Maes

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 本研究提出基于LLM的预测性行为建模方法,通过14名参与者超1000小时的纵向对话数据集,证实可预测特定用户言语行为,为构建个性化AI系统提供新方向。

Journal ref The 39th Annual ACM Symposium on User Interface Software and Technology, UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11033 2026-08-12 cs.MA 新提交 86%

Who Are You Explaining To? A Multi-Agent System for Audience-Aware XAI Narratives

你在向谁解释?面向受众感知的XAI叙事多智能体系统

Francesco Musicco, Danilo Danese, Giuseppe Fasano, Angela Lombardi, Alberto Carlo Maria Mancino, Tommaso Di Noia

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有XAI叙事无法适配不同受众的问题,提出XstrAI多智能体框架,结合三类LLM智能体与修正循环,在糖尿病、中风风险预测任务中,其叙事适配性与保真度优于多数基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08277 2026-08-11 cs.NI 新提交 86%

WirelessOpsAgent: A Benchmark and Agent Design for Action Assurance in Wireless Networks

WirelessOpsAgent:无线网络行动保障的基准测试与智能体设计

Zijian Lu, Yiping Zuo, Hao Xu, Weicong Chen, Xin He, Jiajia Guo, Shi Jin

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有无线网络运维LLM智能体基准未测试执行阶段支持检查的问题,本文提出WirelessOptBench基准与WirelessOpsAgent智能体,使后者在600片段评估中精确行动准确率达0.983,不安全执行率大幅下降。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04120 2026-08-06 cs.HC 新提交 86%

Echoes in the Sky: Computational Thematic Analysis of Online Public Discourse on Bluesky Across Trump's Reelection

空中回响:特朗普连任期间Bluesky平台线上公共话语的计算主题分析

Qile Wang, Ali Salloum, Carolina Coimbra Vieira, Benjamin E. Bagozzi, Mikko Kivelä, Kenneth E. Barner, Matthew Louis Mauriello

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究对特朗普连任期间Bluesky平台上的3850万条相关帖子进行分析,采用LLM辅助聚类结合人工验证识别主题,揭示话语与行政命令的主题分布及情绪变化。

Comments Accepted at ASONAM 2026, to appear in the Springer proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01592 2026-08-04 cs.SE 新提交 86%

How Well Do LLMs Generate Taxonomies in the SE Domain? A Multi-perspective Evaluation Framework

大型语言模型在软件工程领域生成分类体系的表现如何?一个多视角评估框架

Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出首个SE领域自动化分类体系生成的多视角评估框架,对比TnT-LLM与CLIMB两种方法及5种LLM,揭示二者在质量、效率上的权衡,为SE领域应用该技术提供了可操作见解。

Comments 13 pages, Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25907 2026-07-29 cs.LG cs.AI cs.CL 新提交 86%

Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models

最小化目标激活:大语言模型中仅输入的评估感知潜在因素抑制

Deepanshu Mody, Samarth Agarwal, Utkarsh Mittal, Dipesh Mahato

机构 * Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型中仅通过输入优化提示来抑制“评估感知”潜在因素,采用特定方法在多种目标结构下对Llama模型进行实验,发现潜在因素可抑制,但激活可读性与行为可控性不同,还解决了相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25447 2026-07-29 cs.MA 新提交 86%

CoRenew: A large language model agent-based policy simulation platform for multifamily residential redevelopment

CoRenew:一个基于大语言模型智能体的多户住宅重建政策模拟平台

Yudi Zhang, Yuming Lin, Li Tian, Yu Wang, Jianghao Yu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 多户住宅重建政策设计面临集体行动难题,CoRenew平台基于大语言模型智能体,整合地理人口数据,能模拟多利益相关者谈判,评估政策组合效果,支持多种输入与可视化导出,经案例验证,可用于不同背景政策评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15555 2026-07-20 cs.IR 新提交 86%

LLMs Encode Relevance as a Layer-Wise Cross-Lingual Signal

语言模型将相关性编码为分层跨语言信号

Pietro Bernardelle, Samaneh Mohtadi, Stefano Civelli, Joel Mackenzie, Gianluca Demartini

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型中查询与文档相关性是否可线性解码,通过引导中等规模模型、提取激活并训练线性探针,发现相关性是深度依赖信号,多语言实验有部分跨语言可移植性,为基于LLM的相关性评估提供表征视角。

详情

展开后加载摘要…

URL PDF HTML 收藏