科研速览 · Science Skim继续刷下去 · Keep skimming →
◆ Nature Communications2026-06-19· Memorization

Memorization in large language models in medicine prevalence characteristics and implications

Anran Li, Lingfei Qian, Meirong Du, Yin Yu, Yan Hu, Zihao Sun, Yangyang Fu, Hyunjae Kim, Erica Stutz, X. C. Ai, Qianqian Xie, Rui Zhu, Jimin Huang, Yifan Yang, Siru Liu, Yih Chung Tham, Lucila Ohno‐Machado, H.S. Cho, Zhong‐Lin Lu, Hua Xu, Qingyu Chen

原始摘要(英文原文)· Original abstract
Large Language Models (LLMs) have demonstrated significant potential in medicine, with many studies adapting them through continued pretraining or fine-tuning on medical data. However, a key question remains: to what extent do LLMs memorize medical training data-that is, recall or regenerate content seen during continued pretraining or fine-tuning. In this work, we investigate memorization of LLMs in medicine, assessing its prevalence (frequency), characteristics (what is memorized), volume (how much), and potential downstream impacts. We systematically analyze common adaptation scenarios: (1) continued pretraining on medical corpora, (2) fine-tuning on standard medical benchmarks, and (3) fine-tuning on real-world clinical data, including over 13,000 unique inpatient records from Yale New Haven Health System. The results demonstrate that memorization is prevalent and significantly higher than that in the general domain. Memorization has distinct characteristics during continued pretraining and fine-tuning, and it is persistent: up to 87% of content memorized during continued pretraining remains after fine-tuning. Memorization can be categorized into three types: beneficial (e.g., accurate recall of clinical guidelines), uninformative (e.g., templated language), and harmful (e.g., sensitive clinical content). We offer practical recommendations to facilitate beneficial memorization, minimize uninformative memorization, and mitigate harmful memorization to protect patient privacy and improve medical utility.
读原文 · Read the paper ↗

AI 追问PRO

登录后使用 AI 追问

讨论区

登录后参与讨论

相关论文 · Related

Memorization in large language models in medicine prevalence characteristics and implications — 科研速览 Science Skim