Beyond the Black Box: A Point-Of-Care Framework for LLM Literacy and Critical Appraisal.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
Large language models (LLMs) are increasingly used in primary care for documentation, patient communication, and clinical decision support. However, many clinicians are adopting these tools for patient care without structured training or a clear understanding of their limitations. LLM output may appear authoritative but can be inaccurate, biased, and unsupported by evidence. This creates a growing gap in artificial intelligence LLM literacy. Clinicians need practical strategies to evaluate when LLM-generated information can be trusted and how to apply it to patient care. This article proposes an evidence-based framework for critically appraising the output of LLMs at the point of care. Building on principles from evidence-based medicine (EBM), we describe three levels of appraisal: 1) internal validation, 2) external verification, and 3) contextual application. Internal validation assesses whether the LLM output is stable, logically sound, and appropriately addresses uncertainty. External verification determines whether the output is accurate and supported by external evidence, including guidelines, peer-reviewed literature, or trusted clinical references. Contextual application evaluates whether the output is appropriate for the individual patient, taking into account comorbidities, social context, health literacy, patient preferences, and shared decision-making. The rigor of appraisal should be scaled to the clinical risk. Lower-risk uses, such as drafting patient education materials or simple communications, may require only editorial review. Higher-risk uses, such as diagnostic or management reasoning, require more rigorous appraisal before recommendations can be applied. LLMs may reduce cognitive load and improve efficiency, but they do not replace clinical judgment. Safe AI use in primary care depends not only on the sophistication of the LLM but also on the clinician's ability to critically evaluate, verify, and contextualize its output.
نتیجه فارسی
این مقاله چارچوبی برای ارزیابی انتقادی خروجی مدلهای زبانی بزرگ (LLM) در مراقبتهای اولیه ارائه میدهد. این چارچوب بر سه سطح اعتبارسنجی داخلی، تأیید خارجی و کاربرد در بافت متمرکز است. سختگیری ارزیابی باید با ریسک بالینی مقیاسدهی شود و جایگزین قضاوت بالینی نیست.
- ارزیابی انتقادی خروجی LLM باید بر اساس ریسک بالینی مقیاسدهی شود.
- اعتبارسنجی داخلی بررسی پایداری و منطق خروجی است.
- تأیید خارجی بررسی دقت و پشتیبانی از شواهد است.
- کاربرد در بافت شامل در نظر گرفتن بیمار خاص و زمینه است.
- LLMها جایگزین قضاوت بالینی نیستند.
ترجمه فارسی چکیده
مدلهای زبانی بزرگ (LLM) به طور فزایندهای در مراقبتهای اولیه برای مستندسازی، ارتباط با بیمار و پشتیبانی از تصمیمات بالینی استفاده میشوند. با این حال، بسیاری از پزشکان این ابزارها را بدون آموزش ساختاریافته یا درک روشنی از محدودیتهای آنها برای مراقبت از بیمار پذیرفتهاند. خروجی LLM ممکن است به نظر اقتدارآمیز برسد اما میتواند نادرست، متحمل سوگیری و بدون پشتیبانی از شواهد باشد. این امر شکاف فزایندهای در سواد هوش مصنوعی LLM ایجاد میکند. پزشکان به استراتژیهای عملی برای ارزیابی زمانی که اطلاعات تولید شده توسط LLM قابل اعتماد است و چگونه میتوان آن را در مراقبت از بیمار به کار گرفت، نیاز دارند. این مقاله یک چارچوب مبتنی بر شواهد برای ارزیابی انتقادی خروجی LLM در نقطه مراقبت پیشنهاد میکند. بر اساس اصول پزشکی مبتنی بر شواهد (EBM)، ما سه سطح ارزیابی را توصیف میکنیم: ۱) اعتبارسنجی داخلی، ۲) تأیید خارجی، و ۳) کاربرد در بافت. اعتبارسنجی داخلی ارزیابی میکند که آیا خروجی LLM پایدار، منطقی و به درستی با عدم قطعیت سروکار دارد یا خیر. تأیید خارجی تعیین میکند که آیا خروجی دقیق و با شواهد خارجی، از جمله راهنماها، ادبیات بررسی شده توسط همتا یا منابع بالینی معتبر، پشتیبانی میشود یا خیر. کاربرد در بافت ارزیابی میکند که آیا خروجی برای بیمار خاص مناسب است، در نظر گرفتن بیماریهای همراه، زمینه اجتماعی، سواد سلامت، ترجیحات بیمار و تصمیمگیری مشترک. سختگیری ارزیابی باید با ریسک بالینی مقیاسدهی شود. استفادههای با ریسک پایین، مانند تدوین مواد آموزشی بیمار یا ارتباطات ساده، ممکن است نیاز به بررسی ویراستاری داشته باشند. استفادههای با ریسک بالاتر، مانند استدلال تشخیصی یا مدیریتی، قبل از اینکه توصیهها قابل اعمال باشند، نیاز به ارزیابی دقیقتری دارند. LLMها ممکن است بار شناختی را کاهش دهند و کارایی را بهبود بخشند، اما جایگزین قضاوت بالینی نیستند. استفاده ایمن از هوش مصنوعی در مراقبتهای اولیه نه تنها به هوشمندی LLM بستگی دارد، بلکه به توانایی پزشکان برای ارزیابی انتقادی، تأیید و در بافت قرار دادن خروجی آنها نیز وابسته است.
روش پژوهش
چارچوب پیشنهادی بر اصول پزشکی مبتنی بر شواهد (EBM) استوار است.
محدودیتها
محدودیتها در متن گزارش نشدهاند.
نمای PICO و پیامدها
- جمعیت
- پزشکان و مراقبتهای اولیه
- مداخله/مواجهه
- ارزیابی انتقادی خروجی LLM
- مقایسه
- بدون چارچوب مشخص
- حجم نمونه
- گزارش نشده
متن کامل اصلی
برای بررسی دسترسی کتابخانهای یا خرید، رکورد اصلی را باز کنید.
رفتن به منبع اصلی