Extraction of Pain Severity and Functional Interference From Clinical Narratives Using Domain-Informed Large Language Models: Protocol for a Development and Validation Study.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
BACKGROUND: Chronic pain is a leading cause of disability and requires multidimensional assessment of pain intensity and functioning, yet electronic health records rarely capture these measures systematically. By contrast, surveys collecting patient-reported outcomes can assess pain over multiple dimensions but remain resource-intensive and difficult to scale for continuous population-level monitoring. OBJECTIVE: The objective of this study is to develop and validate a domain-informed natural language processing framework to derive pain severity and functional interference outcomes from unstructured clinical narratives. We aim to demonstrate that natural language processing-derived outcomes can serve as a reliable, scalable surrogate for resource-intensive patient-reported surveys. METHODS: This study uses a retrospective cohort of 3725 Veterans with chronic musculoskeletal pain initiating complementary and integrative health therapies across 18 Veterans Health Administration Whole Health Flagship sites (2021-2023). The dataset encompasses longitudinal patient-reported outcome surveys serving as the benchmark, linked with unstructured clinical narratives from the Veterans Health Administration electronic health record. Guided by established psychometric instruments and subject matter expert (SME) input, we developed a seed lexicon and annotation guidelines to identify language distinguishing 3 pain domains: pain severity, interference with enjoyment of life, and interference with general activities. Preliminary large language model (LLM) prompting was used to identify 600 candidate encounters (200 per domain) from 6747 notes across 260 patients for SME annotation, forming a ground truth validation sample. Two candidate LLMs will be evaluated on this sample; the best-performing LLM will generate a large library of span-level annotations to train a scalable, lightweight language model. The study uses a 3-stage validation process: (1) documentation completeness of pain interference in clinical narratives against SME-annotated references; (2) inference accuracy of the LLM-as-annotator and the fine-tuned lightweight model against SME annotations across note-level classification and span-level localization; and (3) concordance between the lightweight model's output and patient-reported pain, enjoyment, and general activity scores across a range of temporal windows. RESULTS: As of July 2026, the cohort of 3725 Veterans has been identified and linked to clinical notes. The seed lexicon and annotation guidelines have been developed. Applying a developmental LLM to screen 6747 text notes in 6642 unique encounters over a 7-month period for 260 patients, at least 1 of the 3 pain domains was identified in 75% of notes and 99% of patients. SME validation at the encounter level is in progress. Final results from the subsequent knowledge distillation and validation stages are expected in the first half of 2027. CONCLUSIONS: This protocol outlines a framework for identifying severe pain intensity and interference from clinical narratives, addressing a critical gap in health care system surveillance. To our knowledge, this is the first study to validate clinical text-based pain outcome extraction against patient-reported outcomes in a nationwide longitudinal cohort. If successful, this approach will enable health care systems to continuously monitor reports of pain-related functional interference and support more holistic, patient-centered pain management at scale.
نتیجه فارسی
این مطالعه پروتکل توسعه و اعتبارسنجی یک چارچوب پردازش زبان طبیعی است برای استخراج شدت درد و اختلال عملکردی از روایتهای بالینی. هدف آن نشان دادن اینکه نتایج حاصل از پردازش زبان طبیعی میتوانند به عنوان جایگزین پرسشنامههای پرهزینه عمل کنند. این مطالعه از دادههای سربازان بازنشسته با درد عضلانیاسکلتی مزمن استفاده میکند و از یک لکسکون بذر و دستورالعملهای برچسبگذاری مبتنی بر متخصصان استفاده میکند. نتایج نهایی انتظار میرود در نیمه اول سال ۲۰۲۷ ارائه شود.
- توسعه یک چارچوب پردازش زبان طبیعی برای استخراج شدت درد و اختلال عملکردی از روایتهای بالینی.
- استفاده از یک لکسکون بذر و دستورالعملهای برچسبگذاری مبتنی بر متخصصان موضوع.
- ارزیابی دو مدل زبانی بزرگ کاندیدا بر روی نمونهای از ۶۰۰ مورد.
- اعتبارسنجی خروجی مدل بر اساس پرسشنامههای بیمار گزارششده.
- انتظار برای نتایج نهایی در نیمه اول سال ۲۰۲۷.
ترجمه فارسی چکیده
درد مزمن یکی از علل اصلی ناتوانی است و نیاز به ارزیابی چندبعدی شدت درد و عملکرد دارد، اما سوابق سلامت الکترونیکی این معیارها را به طور سیستماتیک ثبت نمیکنند. در مقابل، پرسشنامههای جمعآوری نتایج گزارششده توسط بیمار میتوانند درد را در چندین بعد ارزیابی کنند اما منابع زیادی میطلبد و برای پایش مداوم در سطح جمعیت مقیاسپذیر نیست. هدف این مطالعه توسعه و اعتبارسنجی یک چارچوب پردازش زبان طبیعی مبتنی بر دامنه برای استخراج شدت درد و اختلال عملکردی از روایتهای بالینی غیرسازمانیافته است. ما نشان میدهیم که نتایج حاصل از پردازش زبان طبیعی میتوانند به عنوان جایگزین قابل اعتماد و مقیاسپذیر برای پرسشنامههای پرهزینه بیمار گزارششده عمل کنند. این مطالعه از یک کوهورت پسرونده ۳۷۲۵ سرباز بازنشسته با درد عضلانیاسکلتی مزمن استفاده میکند که درمانهای سلامت مکمل و یکپارچه را آغاز کردهاند. دادهها شامل پرسشنامههای طولی بیمار گزارششده به عنوان معیار مرجع است که با روایتهای بالینی غیرسازمانیافته از سوابق سلامت الکترونیکی سربازان و ایالات متحده متصل شدهاند. با راهنمایی ابزارهای روانسنجی و ورودی متخصصان موضوع، یک لکسکون بذر و دستورالعملهای برچسبگذاری برای شناسایی زبان متمایز ۳ حوزه درد: شدت درد، اختلال در لذت بردن از زندگی و اختلال در فعالیتهای عمومی توسعه یافته است. استفاده از پیشنمایش مدل زبانی بزرگ برای شناسایی ۶۰۰ مورد کاندیدا (۲۰۰ در هر حوزه) از ۶۷۴۷ یادداشت در ۲۶۰ بیمار برای برچسبگذاری متخصصان، نمونه اعتبارسنجی حقیقت زمین را تشکیل میدهد. دو مدل زبانی بزرگ کاندیدا بر این نمونه ارزیابی میشوند؛ بهترین عملکرد مدل، یک کتابخانه بزرگ از برچسبهای سطح بازه برای آموزش یک مدل زبانی سبک و مقیاسپذیر تولید میکند. مطالعه از یک فرآیند اعتبارسنجی سه مرحلهای استفاده میکند: (۱) کامل بودن مستندات اختلال درد در روایتهای بالینی در برابر مراجع برچسبگذاری شده متخصص؛ (۲) دقت استنتاج مدل زبانی بزرگ به عنوان برچسبزن و مدل سبک تنظیمشده در برابر برچسبهای متخصص در طبقهبندی سطح یادداشت و مکانیابی سطح بازه؛ و (۳) توافق بین خروجی مدل سبک و امتیازات درد، لذت و فعالیت عمومی گزارششده توسط بیمار در طیفی از پنجرههای زمانی.
روش پژوهش
این مطالعه یک کوهورت پسرونده ۳۷۲۵ سرباز بازنشسته با درد عضلانیاسکلتی مزمن را بررسی میکند. دادهها شامل پرسشنامههای طولی بیمار و روایتهای بالینی غیرسازمانیافته است. با راهنمایی ابزارهای روانسنجی و ورودی متخصصان موضوع، یک لکسکون بذر و دستورالعملهای برچسبگذاری توسعه یافته است. استفاده از پیشنمایش مدل زبانی بزرگ برای شناسایی ۶۰۰ مورد کاندیدا برای برچسبگذاری متخصصان، نمونه اعتبارسنجی را تشکیل میدهد. دو مدل زبانی بزرگ کاندیدا بر این نمونه ارزیابی میشوند.
محدودیتها
محدودیتها در متن گزارش نشدهاند.
نمای PICO و پیامدها
- جمعیت
- سربازان بازنشسته (Veterans) با درد عضلانیاسکلتی مزمن (chronic musculoskeletal pain) در ۱۸ سایت رهبری سلامت Whole Health اداره سلامت سربازان ایالات متحده.
- مداخله/مواجهه
- استفاده از مدلهای زبانی بزرگ (LLM) برای استخراج شدت درد و اختلال عملکردی از روایتهای بالینی.
- مقایسه
- پرسشنامههای طولی بیمار گزارششده (patient-reported outcome surveys) به عنوان معیار مرجع.
- حجم نمونه
- ۳۷۲۵ سرباز بازنشسته (در حال حاضر شناسایی شده و متصل شده به یادداشتهای بالینی).
متن کامل اصلی
لینک مستقیم از metadata منبع گرفته شده و در تب جدید باز میشود.
باز کردن متن کامل