Misaligned by design: evaluating and deploying generative AI for the real-world conditions of primary care: a Nordic and European perspective.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
BACKGROUND: Large language models (LLMs) have entered clinical and consumer use faster than primary-care researchers can evaluate them, and the dominant benchmarks and deployment strategies were shaped in hospital settings rather than primary care. The evidence is mixed: GPT-4 scored below general practitioners on the Swedish family-medicine specialist examination, while Brodeur et al. (2026) found an LLM outscoring the several hundred physicians who worked the same hospital-based cases. The decisive problem is therefore not raw performance but misalignment between how these systems are evaluated and deployed and real primary-care conditions. MAIN BODY: We set out six such conditions: clinical, relational, organisational, cultural, linguistic, and epistemic, and show where current development and evaluation misalign with each. We then state what must change: benchmarks built for multimorbidity, longitudinal reasoning, and continuity; correction of cultural, linguistic, and socio-economic underrepresentation in training corpora, with Nordic registers as counterweight; outputs tied to a verifiable source and assessed independently, not vendor-certified; generative AI (GenAI) deployed as a tool under the Five Rights; and a European and Nordic agenda anchored in the European Health Data Space and aligned with the EU AI Act. We give a success criterion for each recommendation, and separate what is specific to primary care from general clinical-AI principles. CONCLUSIONS: Accuracy alone will not make these systems trustworthy in primary care, and some proposed uses may not survive evaluation under real-world conditions. Whether GenAI earns a place here is an empirical question the Nordic primary-care research community is well placed to answer.
نتیجه فارسی
این مقاله به بررسی نامتناسب بودن مدلهای زبانی بزرگ (LLM) با شرایط واقعی مراقبتهای اولیه میپردازد. نویسندگان شش شرط (بالینی، رابطهای، سازمانی، فرهنگی، زبانی و شناختی) را شناسایی کرده و توصیههایی برای اصلاح شاخصها، دادههای آموزشی و استراتژیهای پیادهسازی ارائه میدهند. دقت به تنهایی کافی نیست و اعتمادپذیری نیازمند ارزیابی مستقل و تطبیق با قوانین اتحادیه اروپا است.
- مدلهای زبانی بزرگ در شرایط واقعی مراقبتهای اولگی ارزیابی نشدهاند.
- شاخصها باید بر اساس چندبیماریزایی و پیوستگی بیمار ساخته شوند.
- نمایندگی فرهنگی و زبانی در دادههای آموزشی باید اصلاح شود.
- خروجیها باید به منبع قابل تأیید متصل و مستقل ارزیابی شوند.
- هوش مصنوعی تولیدکننده باید به عنوان ابزاری تحت «پنج حق» پیادهسازی گردد.
ترجمه فارسی چکیده
مدلهای زبانی بزرگ (LLM) به سرعت وارد استفاده بالینی و مصرفکننده شدهاند، اما پژوهشگران مراقبتهای اولیه هنوز نتوانستهاند آنها را بهطور کامل ارزیابی کنند. شاخصهای استاندارد و استراتژیهای پیادهسازی عمدتاً بر اساس شرایط بیمارستان شکل گرفتهاند، نه مراقبتهای اولیه. شواهد متفاوت است: GPT-4 در آزمون تخصصی پزشکی خانواده سوئد نمرهای پایینتر از پزشکان عمومی کسب کرد، در حالی که Brodeur و همکاران (2026) دریافتند یک LLM نمرهای بالاتر از چندصد پزشک که همان پروندههای مبتنی بر بیمارستان را بررسی میکردند، کسب کرده است. مشکل اصلی، عملکرد خام نیست، بلکه نامتناسب بودن بین نحوه ارزیابی و پیادهسازی این سیستمها و شرایط واقعی مراقبتهای اولیه است. نویسندگان شش شرط را مشخص میکنند: بالینی، رابطهای، سازمانی، فرهنگی، زبانی و شناختی و نشان میدهند که توسعه و ارزیابی فعلی با این شرایط همخوانی ندارد. آنها توصیه میکنند که شاخصها بر اساس چندبیماریزایی، استدلال طولی و پیوستگی ساخته شوند، نمایندگی فرهنگی و زبانی در دادههای آموزشی اصلاح شود، خروجیها به منبع قابل تأیید متصل و مستقل ارزیابی شوند، و هوش مصنوعی تولیدکننده به عنوان ابزاری تحت «پنج حق» پیادهسازی گردد. نویسندگان معیار موفقیت برای هر توصیه ارائه میدهند و تفاوتهای خاص مراقبتهای اولیه را از اصول عمومی هوش مصنوعی بالینی جدا میکنند. نتیجهگیری این است که دقت به تنهایی این سیستمها را در مراقبتهای اولیه قابل اعتماد نمیکند و برخی کاربردهای پیشنهادی ممکن است در شرایط واقعی نتوانند دوام بیاورند. این که هوش مصنوعی تولیدکننده جایگاهی در این حوزه کسب کند، یک سوال تجربی است که جامعه پژوهشی مراقبتهای اولیه شمالی به خوبی قادر به پاسخگویی به آن است.
روش پژوهش
مقاله یک دیدگاه نظری و پیشنهادی ارائه میدهد و شواهد تجربی را با استدلالهای نظری ترکیب میکند.
محدودیتها
مقاله شواهد تجربی مستقیم از پیادهسازی در مراقبتهای اولیه ارائه نمیدهد و بر توصیههای سیاستی و نظری تمرکز دارد.
نمای PICO و پیامدها
- جمعیت
- پزشکان عمومی و مراقبتهای اولیه
- مداخله/مواجهه
- هوش مصنوعی تولیدکننده (GenAI)
- مقایسه
- شرایط واقعی مراقبتهای اولیه و پزشکان عمومی
- حجم نمونه
- خیر
متن کامل اصلی
برای بررسی دسترسی کتابخانهای یا خرید، رکورد اصلی را باز کنید.
رفتن به منبع اصلی