تنقيب البيانات والنصوص

إلى جانب الفيزياء، صُرف جزءٌ كبيرٌ من مسيرتي في بناء أنظمة تعلُّمٍ آليّ تفهم النصوص غير المُهيكَلة. والحافز هو نفسه في الفيزياء: العثور على البنية الكامنة داخل بياناتٍ مشوّشة.

Quantum Text®

كنتُ المصمِّم والمطوِّر الرئيسي لـ Quantum Text® (Hilbert Technology، 2006–2008) — وهو محرّكٌ متقدّمٌ لتجميع النصوص وتصنيفها. تستخدمه في الإنتاج شركاتٌ أمريكية عديدة، إضافةً إلى وكالاتٍ حكومية أمريكية كبرى.

في صميمه نموذجٌ متّجهيّ طوّرتُه لتجميع الوثائق وتصنيفها: يجمع مجموعاتٍ نصيةً كبيرة ويُصنّفها انطلاقًا من حفنةٍ من الوثائق النموذجية لكلّ فئة، دون قواعد مكتوبةٍ يدويًّا.

مرجع: “A vector model for text clustering and categorization,” A. A. Maarouf.

تصنيف الوثائق بالتعلُّم الآلي

واصلتُ هذا الخيط في العمل الأكاديمي — محرّك تصنيف وثائق مبنيّ على مناهج التعلُّم الآلي (عُرض في مؤتمر ICCIS 2019، بالتعاون مع زملاء) — ودرّستُه مباشرةً: ففي برنامجٍ صيفيّ عام 2018 قُدتُ ستّةً من طلاب علوم الحاسوب في بناء مُصنِّف وثائقَ عمليّ، مع واجهةٍ رسومية.

أعمالٌ بيانيةٌ ذات صلة

  • IRAM — قاعدة بيانات ومورد تحليلٍ لأغلفة الفيروسات (Database، 2019): هيكلة بيانات التسلسل والبنية البيولوجية والاستعلام عنها.
  • محاكاة المواد من المبادئ الأولى على نطاقٍ واسع — تعمل أبحاثي الفيزيائية على حواسيب فائقةٍ وطنية (KAUST Shaheen، وIBM Blue Gene، ومكتبة الإسكندرية)، مولِّدةً مجموعات بيانات محاكاةٍ ضخمة.

الأدوات

C · C++ · FORTRAN · Mathematica · Hilbert script · Forth