Pedagogical Efficacy of LLM-Generated Synthetic Data Versus Real-World Clinical Records: A Randomized Controlled Non-Inferiority Trial.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
BACKGROUND: Expert-reviewed clinical cases generated by large language models (LLMs) may supplement case resources in medical education, but their short-term educational performance relative to real-case-derived teaching materials remains uncertain. We compared immediate post-training test performance after teaching with the two types of case materials and assessed non-inferiority against a prespecified margin. METHODS: We conducted a prospective, parallel-group, randomized non-inferiority trial. Through the Wenjuanxing online platform, participants were randomized 1:1 to learn with either real-case-derived teaching cases compiled by clinicians and reviewed by experts or AI-generated clinical cases produced by Gemini 3.0 Pro from fully de-identified matched real cases and reviewed by three senior general surgery specialists with full-professor rank. The primary outcome was the total score on an independent 10-item immediate post-training test (0-10 points), with a prespecified non-inferiority margin of -0.5 points. Secondary outcomes included the training-phase performance score, learning efficiency index, single-item mental effort rating, case realism, and case-source judgment. RESULTS: A total of 403 participants were randomized, of whom 386 were included in the modified intention-to-treat analysis: 192 in the real-case group and 194 in the AI-generated case group. The mean post-training test score was 4.95 (SD, 3.35) in the real-case group and 4.61 (SD, 3.35) in the AI-generated case group. The mean difference (AI-generated minus real-case group) was -0.335 points (95% CI, -1.006 to 0.337). Because the lower bound of the confidence interval was below the prespecified non-inferiority margin of -0.5 points, non-inferiority was not demonstrated (one-sided P = 0.314). No significant between-group differences were observed in the training-phase performance score, learning efficiency index, or single-item mental effort rating. AI-generated cases received lower realism ratings for Level 3 cases. The proportion of participants with at least one high-confidence completely incorrect response was 1.6% in the real-case group and 2.1% in the AI-generated case group. CONCLUSIONS: In this short-term, text-based online case-learning setting, no statistically significant between-group difference was observed in immediate post-training test performance; however, non-inferiority of AI-generated clinical cases relative to real-case-derived teaching materials was not demonstrated.
نتیجه فارسی
این مطالعه به مقایسه عملکرد آموزشی موارد بالینی تولید شده توسط هوش مصنوعی در برابر موارد واقعی پرداخته است. نتایج نشان میدهد که تفاوتی معنیدار در عملکرد آزمون پس از آموزش فوری مشاهده نشده است، اما برتری غیر (غیر برتری) هوش مصنوعی تأیید نشده است. موارد واقعی از نظر واقعگرایی در برخی موارد برتری داشتند.
- این یک آزمایش غیر برتری تصادفی و پیشروی بود.
- هیچ تفاوتی معنیدار در عملکرد آزمون پس از آموزش فوری مشاهده نشد.
- برتری غیر (غیر برتری) هوش مصنوعی تأیید نشد.
- مورد واقعی از نظر واقعگرایی در موارد سطح ۳ برتری داشت.
- مطالعه بر روی ۳۸۶ شرکتکننده انجام شد.
ترجمه فارسی چکیده
پسزمینه: موارد بالینی بازبینی شده توسط مدلهای زبانی بزرگ (LLM) ممکن است منابع موردی را در آموزش پزشکی تکمیل کنند، اما عملکرد آموزشی کوتاهمدت آنها نسبت به مواد آموزشی مبتنی بر موارد واقعی نامشخص است. ما عملکرد آزمون پس از آموزش فوری را پس از آموزش با هر دو نوع مواد موردی مقایسه کردیم و برتری غیر (غیر برتری) را در برابر حاشیه پیشتعیین شده ارزیابی کردیم. روشها: ما یک آزمایش غیر برتری تصادفی، گروه موازی و پیشروی انجام دادیم. از طریق پلتفرم آنلاین Wenjuanxing، شرکتکنندگان به صورت تصادفی ۱:۱ به یادگیری با موارد آموزشی مبتنی بر موارد واقعی که توسط پزشکان گردآوری و توسط متخصصان بازبینی شده بودند یا موارد بالینی تولید شده توسط هوش مصنوعی (Gemini 3.0 Pro) از موارد واقعی همخوان و ناشناس شده، که توسط سه متخصص جراحی عمومی درجه استاد کامل بازبینی شده بودند، تقسیم شدند. نتیجه اصلی امتیاز کل در یک آزمون مستقل ۱۰ سؤالی پس از آموزش فوری (۰-۱۰ امتیاز) با حاشیه غیر برتری پیشتعیین شده -۰.۵ امتیاز بود. نتایج: مجموعه ۴۰۳ شرکتکننده تصادفی شدند، از جمله ۳۸۶ نفر در تحلیل تغییر یافته قصد درمان: ۱۹۲ نفر در گروه مورد واقعی و ۱۹۴ نفر در گروه مورد تولید شده توسط هوش مصنوعی. میانگین امتیاز آزمون پس از آموزش ۴.۹۵ (انحراف معیار، ۳.۳۵) در گروه مورد واقعی و ۴.۶۱ (انحراف معیار، ۳.۳۵) در گروه مورد تولید شده توسط هوش مصنوعی بود. تفاوت میانگین (گروه تولید شده توسط هوش مصنوعی منهای گروه مورد واقعی) -۰.۳۳۵ امتیاز (۹۵٪ CI، -۱.۰۰۶ تا ۰.۳۳۷) بود. از آنجا که پایینترین لبه باور در محدوده اطمینان زیر حاشیه غیر برتری پیشتعیین شده -۰.۵ امتیاز قرار داشت، برتری غیر نشان داده نشد (P یکطرفه = ۰.۳۱۴). تفاوت معنیدار بین گروهها در امتیاز عملکرد در فاز آموزش، شاخص کارایی یادگیری، یا رتبهبندی تلاش ذهنی تکآیتم مشاهده نشد. موارد تولید شده توسط هوش مصنوعی امتیازات پایینتری از واقعگرایی برای موارد سطح ۳ دریافت کردند. نسبت شرکتکنندگان با حداقل یک پاسخ کاملاً غلط با اطمینان بالا ۱.۶٪ در گروه مورد واقعی و ۲.۱٪ در گروه مورد تولید شده توسط هوش مصنوعی بود. نتیجهگیری: در این محیط یادگیری مورد آنلاین مبتنی بر متن کوتاهمدت، تفاوت معنیدار آماری بین گروهها در عملکرد آزمون پس از آموزش فوری مشاهده نشد؛ با این حال، برتری غیر موارد بالینی تولید شده توسط هوش مصنوعی نسبت به مواد آموزشی مبتنی بر موارد واقعی نشان داده نشد.
روش پژوهش
این یک مطالعه غیر برتری تصادفی، گروه موازی و پیشروی بود. شرکتکنندگان به صورت تصادفی ۱:۱ به یادگیری با موارد واقعی یا موارد تولید شده توسط هوش مصنوعی (Gemini 3.0 Pro) تقسیم شدند.
محدودیتها
مطالعه محدود به محیط یادگیری آنلاین مبتنی بر متن بود. نتایج ممکن است در محیطهای آموزشی دیگر متفاوت باشد. برتری غیر (غیر برتری) تأیید نشد.
نمای PICO و پیامدها
- جمعیت
- شرکتکنندگان پزشکی (تعداد مشخص نشده)
- مداخله/مواجهه
- مورد بالینی تولید شده توسط هوش مصنوعی (Gemini 3.0 Pro)
- مقایسه
- مورد بالینی واقعی
- حجم نمونه
- ۳۸۶ نفر (تحلیل تغییر یافته قصد درمان)
متن کامل اصلی
لینک مستقیم از metadata منبع گرفته شده و در تب جدید باز میشود.
باز کردن متن کامل