Skip to content

Latest commit

 

History

History
86 lines (51 loc) · 7.24 KB

File metadata and controls

86 lines (51 loc) · 7.24 KB

التعرف على الكيانات المسماة

حتى الآن، كنا نركز بشكل أساسي على مهمة واحدة في معالجة اللغة الطبيعية - التصنيف. ومع ذلك، هناك مهام أخرى يمكن تحقيقها باستخدام الشبكات العصبية. واحدة من هذه المهام هي التعرف على الكيانات المسماة (NER)، والتي تتعامل مع التعرف على كيانات محددة داخل النص، مثل الأماكن، أسماء الأشخاص، فترات الزمن، الصيغ الكيميائية، وغيرها.

مثال على استخدام NER

افترض أنك تريد تطوير روبوت دردشة يعتمد على اللغة الطبيعية، مشابه لـ Amazon Alexa أو Google Assistant. الطريقة التي تعمل بها روبوتات الدردشة الذكية هي فهم ما يريده المستخدم من خلال تصنيف النص في الجملة المدخلة. نتيجة هذا التصنيف تُعرف بـ النية، والتي تحدد ما يجب أن يقوم به روبوت الدردشة.

Bot NER

الصورة من إعداد المؤلف

ومع ذلك، قد يقدم المستخدم بعض المعطيات كجزء من العبارة. على سبيل المثال، عند طلب حالة الطقس، قد يحدد الموقع أو التاريخ. يجب أن يكون الروبوت قادرًا على فهم هذه الكيانات وملء المعطيات المناسبة قبل تنفيذ الإجراء. هذا هو بالضبط دور NER.

✅ مثال آخر يمكن أن يكون تحليل الأوراق العلمية الطبية. أحد الأمور الرئيسية التي نحتاج إلى البحث عنها هي المصطلحات الطبية المحددة، مثل الأمراض والمواد الطبية. بينما يمكن استخراج عدد صغير من الأمراض باستخدام البحث عن النصوص الفرعية، فإن الكيانات الأكثر تعقيدًا، مثل المركبات الكيميائية وأسماء الأدوية، تحتاج إلى نهج أكثر تعقيدًا.

NER كتصنيف للرموز

نماذج NER هي في الأساس نماذج تصنيف الرموز، لأننا بحاجة إلى تحديد لكل رمز مدخل ما إذا كان ينتمي إلى كيان أم لا، وإذا كان كذلك - إلى أي فئة كيان ينتمي.

لنأخذ عنوان الورقة التالي كمثال:

ارتجاع الصمام ثلاثي الشرفات و كربونات الليثيوم سمية في رضيع حديث الولادة.

الكيانات هنا هي:

  • ارتجاع الصمام ثلاثي الشرفات هو مرض (DIS)
  • كربونات الليثيوم هي مادة كيميائية (CHEM)
  • السمية هي أيضًا مرض (DIS)

لاحظ أن الكيان الواحد يمكن أن يمتد عبر عدة رموز. وكما في هذه الحالة، نحتاج إلى التمييز بين كيانين متتاليين. لذلك، من الشائع استخدام فئتين لكل كيان - واحدة تحدد الرمز الأول للكيان (غالبًا ما يتم استخدام البادئة B-، لـ بداية)، والأخرى - استمرار الكيان (I-، لـ داخل الكيان). كما نستخدم O كفئة لتمثيل جميع الرموز الأخرى. هذا النوع من تصنيف الرموز يُعرف بـ تصنيف BIO (أو IOB). عند التصنيف، سيبدو العنوان كما يلي:

الرمز التصنيف
ارتجاع B-DIS
الصمام I-DIS
ثلاثي I-DIS
الشرفات I-DIS
و O
كربونات B-CHEM
الليثيوم I-CHEM
سمية B-DIS
في O
رضيع O
حديث O
الولادة O
. O

نظرًا لأننا بحاجة إلى بناء تطابق واحد لواحد بين الرموز والفئات، يمكننا تدريب نموذج شبكة عصبية كثيرة إلى كثيرة من الصورة التالية:

صورة تظهر أنماط الشبكات العصبية المتكررة الشائعة.

الصورة مأخوذة من هذه المقالة بواسطة أندريه كارباتي. نماذج تصنيف الرموز لـ NER تتوافق مع بنية الشبكة الموجودة في أقصى اليمين في هذه الصورة.

تدريب نماذج NER

نظرًا لأن نموذج NER هو في الأساس نموذج تصنيف الرموز، يمكننا استخدام الشبكات العصبية المتكررة التي تعرفنا عليها بالفعل لهذه المهمة. في هذه الحالة، سيقوم كل كتلة من الشبكة المتكررة بإرجاع معرف الرمز. المثال التالي في دفتر الملاحظات يوضح كيفية تدريب LSTM لتصنيف الرموز.

✍️ دفاتر ملاحظات أمثلة: NER

واصل التعلم من خلال دفتر الملاحظات التالي:

الخاتمة

نموذج NER هو نموذج تصنيف الرموز، مما يعني أنه يمكن استخدامه لتنفيذ تصنيف الرموز. هذه مهمة شائعة جدًا في معالجة اللغة الطبيعية، حيث تساعد في التعرف على كيانات محددة داخل النص بما في ذلك الأماكن، الأسماء، التواريخ، والمزيد.

🚀 التحدي

أكمل المهمة المرتبطة أدناه لتدريب نموذج التعرف على الكيانات المسماة للمصطلحات الطبية، ثم جربه على مجموعة بيانات مختلفة.

المراجعة والدراسة الذاتية

اقرأ المقالة الفعالية غير المعقولة للشبكات العصبية المتكررة واتبع قسم القراءة الإضافية في تلك المقالة لتعميق معرفتك.

في المهمة الخاصة بهذه الدرس، ستحتاج إلى تدريب نموذج التعرف على الكيانات الطبية. يمكنك البدء بتدريب نموذج LSTM كما هو موضح في هذا الدرس، ثم الانتقال إلى استخدام نموذج BERT. اقرأ التعليمات للحصول على جميع التفاصيل.