Symptom Terminology Normalization in Traditional Chinese Medicine: Development and Evaluation of a 2-Stage Deep Learning Framework Based on Fine-Grained Semantic Classification.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
BACKGROUND: Due to the heterogeneity of symptom terminology and the lack of industry standards, the same symptom is often described using multiple expressions. Current normalization approaches struggle to comprehensively retrieve standard terms when a raw term maps to multiple symptoms. OBJECTIVE: This study aimed to address the lack of industry standards for traditional Chinese medicine (TCM) symptom terminology. This study proposed the split-then-concatenate normalization framework (STC-NF), a novel approach based on fine-grained semantic classification and a 2-stage deep learning architecture that uses electronic medical records (EMRs) as the data source. METHODS: This study proposed a 2-stage deep learning framework, "split-then-concatenate." In the splitting stage, TCM symptom entities were categorized into 12 fine-grained semantic labels, and 3 named entity recognition (NER) models were trained to extract TCM symptom terminology from EMRs. In the concatenation stage, standard terms with the same concept as raw terms were identified using a Bidirectional Encoder Representations from Transformers (BERT)-based binary classification model. The standard terms with specific semantic labels were concatenated and reordered according to predefined rules to output structured text, thereby normalizing TCM symptom terminology. RESULTS: The proposed STC-NF model achieved an accuracy of 91.4% (180/197) and an F1-score of 360 out of 389 (92.5%) on the single-implication test set. For multi-implication terms, STC-NF achieved an accuracy of 84.3% (311/369) and an F1-score of 1958 out of 2316 (84.5%), outperforming sequence generation in accuracy by 33.1 percentage points. On the mixed test set containing both single- and multi-implication terms, STC-NF achieved an accuracy of 88.1% (990/1124) and an F1-score of 3862 out of 4385 (88.1%), exceeding the best-performing baseline model, multi-task candidate generator (MTCG), by 16.7 and 22.2 percentage points in accuracy and F1-score, respectively. CONCLUSIONS: In this study, we verified that the fine-grained semantic classification and the 2-stage "split-then-concatenate" framework effectively improved performance of named entity recognition and entity alignment, providing an improved approach to normalizing TCM symptom terminology.
نتیجه فارسی
این مطالعه یک چارچوب یادگیری عمیق دو مرحلهای به نام STC-NF را برای نرمالسازی اصطلاحات علائم در طب چینی سنتی توسعه داد. این روش از طبقهبندی معنایی ریز و استخراج موجودیتها از EMR استفاده میکند. نتایج نشان میدهد که STC-NF عملکرد بهتری نسبت به مدلهای پایه و روشهای تولید توالی در دقت و امتیاز F1 دارد.
- چارچوب STC-NF از یک معماری دو مرحلهای «تقسیم و سپس ادغام» استفاده میکند.
- در مرحله تقسیم، ۱۲ برچسب معنایی ریز برای موجودیتهای علائم TCM تعریف شد.
- در مرحله ادغام، مدل BERT برای تطبیق اصطلاحات استاندارد با عبارات خام استفاده شد.
- دقت مدل در مجموعه آزمایشی مختلط ۸۸.۱٪ و امتیاز F1 آن ۸۸.۱٪ گزارش شد.
- STC-NF عملکرد بهتری نسبت به مدل پایه MTCG در دقت و امتیاز F1 داشت.
ترجمه فارسی چکیده
به دلیل تنوع اصطلاحات علائم و نبود استانداردهای صنعتی، یک علائم میتواند با عبارات متعددی توصیف شود. رویکردهای فعلی در نرمالسازی با چالش روبرو هستند که چگونه وقتی یک عبارت خام به چندین علائم اشاره دارد، به طور جامع اصطلاحات استاندارد را بازیابی کنند. این مطالعه چارچوب نرمالسازی «تقسیم و سپس ادغام» (STC-NF) را که بر پایه طبقهبندی معنایی ریز و معماری یادگیری عمیق دو مرحلهای استوار است، برای اصطلاحات علائم طب چینی سنتی (TCM) پیشنهاد کرد. در مرحله تقسیم، موجودیتهای علائم TCM به ۱۲ برچسب معنایی ریز دستهبندی شدند و ۳ مدل شناسایی موجودیت نامگذاری شده (NER) برای استخراج اصطلاحات علائم TCM از سوابق پزشکی الکترونیکی (EMR) آموزش داده شدند. در مرحله ادغام، اصطلاحات استاندارد با مفهوم مشابه عبارات خام با استفاده از یک مدل طبقهبندی باینری مبتنی بر BERT شناسایی شدند. اصطلاحات استاندارد با برچسبهای معنایی خاص با هم ادغام و مرتبسازی مجدد بر اساس قوانین پیشتعریف شده برای خروجی متن ساختاریافته، نرمالسازی اصطلاحات علائم TCM را انجام دادند.
روش پژوهش
این مطالعه از یک چارچوب یادگیری عمیق دو مرحلهای «تقسیم و سپس ادغام» (STC-NF) استفاده کرد. در مرحله تقسیم، ۳ مدل NER برای استخراج اصطلاحات علائم TCM از EMR آموزش داده شدند. در مرحله ادغام، یک مدل طبقهبندی باینری مبتنی بر BERT برای تطبیق اصطلاحات استاندارد استفاده شد.
محدودیتها
محدودیتهای این مطالعه در متن ارائه نشده است.
نمای PICO و پیامدها
- جمعیت
- مطالعه بر روی دادههای سوابق پزشکی الکترونیکی (EMR) متمرکز است.
- مداخله/مواجهه
- چارچوب نرمالسازی STC-NF مبتنی بر طبقهبندی معنایی ریز و معماری یادگیری عمیق دو مرحلهای.
- مقایسه
- مدل پایه MTCG و روشهای تولید توالی.
- حجم نمونه
- تعداد نمونه در متن گزارش نشده است.
متن کامل اصلی
لینک مستقیم از metadata منبع گرفته شده و در تب جدید باز میشود.
باز کردن متن کامل