Fine-Tuning Large Language Models for Structured Extraction of Infectious Disease-Related Information From Clinical Notes in Japanese Primary Care: Development and Internal Validation Study.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
BACKGROUND: The COVID-19 pandemic highlighted the importance of timely infectious disease surveillance. In Japan, conventional sentinel and claims-based systems incur reporting lags and capture limited clinical detail, whereas free-text clinical notes in electronic health records (EHRs) hold richer, timelier symptom and vaccination information. Natural language processing (NLP) with large language models (LLMs) offers a way to structure such free text at scale. OBJECTIVE: We aimed to develop and internally validate an NLP algorithm to extract structured infectious disease-related symptoms and vaccination history from free-text clinical notes in Japanese primary care, as a feasibility step toward low-latency, EHR-based surveillance. METHODS: A total of 773 clinical notes, originating from 526 unique patients, were provided by M3 Inc through the Japan Medical Data Survey and used for analysis. Three physicians annotated information related to infectious disease symptoms and vaccination history. The data were divided into 622 (80%) training cases and 151 (20%) evaluation cases with no patient overlap. We compared a physician-designed, rule-based algorithm, few-shot learning (FSL) using commercial and open-source LLMs, and supervised fine-tuning (SFT) of open-source LLMs, using the macroaveraged F1-score (unweighted mean across 9 clinical categories). Sensitivity, specificity, positive predictive value (PPV), and negative predictive value (NPV) were also computed, with 95% CIs from a patient-level cluster bootstrap (2000 replicates). RESULTS: Rule-based extraction achieved a macroaveraged F1-score of 0.685 (95% CI 0.630-0.736). FSL markedly improved the extraction of high-variability items such as vaccination history and onset date. Anthropic Claude 3.5 Sonnet achieved a macroaveraged F1-score of 0.875 (95% CI 0.800-0.913; sensitivity 0.929, specificity 0.918). SFT of Google's open-source Gemma 2 27B model with quantized low-rank adaptation (QLoRA) achieved the highest point estimate (macroaveraged F1-score of 0.906, 95% CI 0.833-0.945; sensitivity 0.921, specificity 0.969, PPV 0.906); the difference from Claude 3.5 Sonnet was small and not statistically distinguishable (ΔF1-score=0.030, 95% CI -0.035 to 0.140). A small, fine-tuned Gemma 2 2B model reached 0.822 (95% CI 0.752-0.874), significantly lower than that of the 27B model (ΔF1-score=0.084, 95% CI 0.040-0.163). CONCLUSIONS: A fine-tuned open-source LLM can accurately extract and structure infectious disease-related information from Japanese free-text clinical notes, achieving performance comparable to that of a commercial model while enabling processing within a closed environment. These findings support the feasibility of EHR-based digital surveillance, whose downstream utility remains to be demonstrated.
نتیجه فارسی
این مطالعه نشان داد که مدلهای زبانی بزرگ پس از تنظیم دقیق میتوانند به طور دقیق اطلاعات بیماریهای عفونی را از یادداشتهای بالینی ژاپنی استخراج کنند. تنظیم دقیق مدل Gemma 2 27B عملکردی مشابه مدل تجاری Claude 3.5 Sonnet داشت.
- استفاده از یادداشتهای بالینی متنی برای نظارت بر بیماریهای عفونی در ژاپن بررسی شد.
- تنظیم دقیق مدلهای زبانی بزرگ (SFT) عملکرد بهتری نسبت به الگوریتمهای مبتنی بر قاعده داشت.
- مدل Gemma 2 27B پس از تنظیم دقیق (QLoRA) بالاترین امتیاز F1 ماکرو (۰.۹۰۶) را کسب کرد.
- تفاوت عملکرد بین مدل Gemma 2 27B و Claude 3.5 Sonnet از نظر آماری معنادار نبود.
- این روش قابلیتسازی نظارت دیجیتال بر اساس سوابق الکترونیک سلامت را نشان میدهد.
ترجمه فارسی چکیده
پاندمی کووید-۱۹ اهمیت نظارت بر بیماریهای عفونی را در زمان مناسب برجسته کرد. در ژاپن، سیستمهای سنتی و مبتنی بر ادعاها دارای تأخیر گزارشدهی هستند و جزئیات بالینی محدودی را ثبت میکنند، در حالی که یادداشتهای بالینی متنی آزاد در سوابق الکترونیک سلامت (EHR) اطلاعات غنیتری از علائم و تاریخ واکسیناسیون را در زمان مناسب نگه میدارند. پردازش زبان طبیعی (NLP) با استفاده از مدلهای زبانی بزرگ (LLM) راهی برای ساختاردهی این متن آزاد در مقیاس بزرگ ارائه میدهد. هدف این مطالعه توسعه و اعتبارسنجی داخلی یک الگوریتم NLP برای استخراج علائم مرتبط با بیماریهای عفونی و تاریخچه واکسیناسیون از یادداشتهای بالینی متنی در مراکز درمانی ژاپن بود. دادهها شامل ۷۷۳ یادداشت بالینی از ۵۲۶ بیمار متمایز بود. سه پزشک اطلاعات مرتبط با علائم و تاریخچه واکسیناسیون را برچسبگذاری کردند. الگوریتمها شامل یک الگوریتم مبتنی بر قاعده طراحی شده توسط پزشکان، یادگیری چندنمونهای (FSL) و تنظیم دقیق نظارتشده (SFT) بودند. عملکرد با امتیاز F1 میانگین ماکرو (95% CI) ارزیابی شد. الگوریتم مبتنی بر قاعده امتیاز F1 ماکرو ۰.۶۸۵ (95% CI ۰.۶۳۰-۰.۷۳۶) را به دست آورد. مدل Claude 3.5 Sonnet با FSL امتیاز F1 ماکرو ۰.۸۷۵ (95% CI ۰.۸۰۰-۰.۹۱۳) را به دست آورد. تنظیم دقیق مدل Gemma 2 27B با استفاده از QLoRA بالاترین برآورد را داشت (F1 ماکرو ۰.۹۰۶، 95% CI ۰.۸۳۳-۰.۹۴۵). تفاوت بین این مدل و Claude 3.5 Sonnet از نظر آماری قابل تشخیص نبود.
روش پژوهش
دادهها شامل ۷۷۳ یادداشت بالینی از ۵۲۶ بیمار بود. سه پزشک برچسبگذاری کردند. دادهها به ۶۲۲ مورد آموزشی (۸۰٪) و ۱۵۱ مورد ارزیابی (۲۰٪) تقسیم شدند. الگوریتمها شامل مبتنی بر قاعده، FSL و SFT بودند. عملکرد با F1 ماکرو و حساسیت/تخصص ارزیابی شد.
محدودیتها
این مطالعه شامل اعتبارسنجی داخلی بود و نتایج ممکن است در محیطهای بالینی واقعی متفاوت باشد. دادهها از یک شرکت داده پزشکی (M3 Inc) دریافت شدند.
نمای PICO و پیامدها
- جمعیت
- بیماران در مراکز درمانی ژاپن (مراقبت اولیه) که یادداشتهای بالینی متنی داشتند.
- مداخله/مواجهه
- استفاده از مدلهای زبانی بزرگ (LLM) برای استخراج ساختاریافته اطلاعات بیماریهای عفونی.
- مقایسه
- الگوریتم مبتنی بر قاعده طراحی شده توسط پزشکان و مدلهای LLM با یادگیری چندنمونهای (FSL).
- حجم نمونه
- ۷۷۳ یادداشت بالینی (۵۲۶ بیمار متمایز).
متن کامل اصلی
لینک مستقیم از metadata منبع گرفته شده و در تب جدید باز میشود.
باز کردن متن کامل