Date of Award

4-2024

Document Type

Dissertation

Degree Name

Doctor of Philosophy (PhD)

Department

Information Security

First Advisor

Dr. Saed Alrabaee

Abstract

Federated Learning (FL) is a collaborative method allowing individuals to train a model jointly without sharing their local datasets. It utilizes decentralized data sources to protect privacy, making it particularly promising in medical contexts where data confidentiality is paramount. FL facilitates the use of diverse datasets from various healthcare organizations while upholding patient confidentiality. It also plays a crucial role in advancing medical research and healthcare services while adhering to data distribution and compliance requirements. The primary challenges within federated healthcare encompass privacy preservation among sensitive distributed data, ensuring efficient communication, addressing data heterogeneity, and ultimately guaranteeing model accuracy. To tackle these issues, this dissertation proposes solutions aimed at enhancing efficiency, accuracy, and privacy in FL systems. This research centrally employs synthetic data for generating initial model parameters and utilizes federated feature selection methods, effectively improving model convergence and reducing communication and computational overhead. Additionally, synthetic data augmentation mitigates data heterogeneity issues, enhancing model performance. Finally, this research combines differential privacy with synthetic data and Homomorphic Encryption, ensuring secure computations on encrypted data and maintaining data privacy during model aggregation. The experimental results demonstrate the following: a) The proposed solution for generating the initial model reduces the number of iterations by more than a factor of 4 compared to the baseline FL algorithm, while maintaining model accuracy. b) This dissertation proposed a federated feature selection method that improves algorithm efficiency by a factor ranging from 4 (Backward Elimination) to 14 (Threshold variance) and enhances accuracy. c) The proposed solution utilizes synthetic data augmentation in heterogeneous data to significantly boost accuracy. d) Finally, this research presents a hybrid privacy mechanism to enhance data privacy while maintaining efficiency and accuracy. In summary, this dissertation offers a comprehensive framework for enhancing FL systems, with a specific focus on advancing privacy, efficiency, accuracy, and overall performance.

Arabic Abstract

تعزيز التحليلات الصحية: حلول التعلم الموحدة الآمنة والخاصة

التعلم الموحد (FL) هو نهج تعاوني يسمح للأفراد بتدريب النموذج بشكل مشترك دون مشاركة مجموعات البيانات المحلية الخاصة بهم مع الآخرين. تستخدم FL مصادر البيانات اللامركزية لتدريب نماذج التعلم الآلي مع حماية الخصوصية، وقد ظهرت هذه الطريقة كطريقة واعدة. وينطبق هذا بشكل خاص في السياقات الطبية، حيث تعتبر سرية البيانات أمر بالغ الأهمية. تسمح FL باستخدام مجموعات البيانات غير المتجانسة من مجموعة متنوعة من مؤسسات الرعاية الصحية مع الحفاظ على سرية المريض. كما أنها تلعب دورًا حاسمًا في تطوير الأبحاث الطبية وخدمات الرعاية الصحية مع الالتزام بمتطلبات توزيع البيانات والامتثال. تشمل التحديات الأساسية في مجال الرعاية الصحية الفيدرالية الحفاظ على الخصوصية بين البيانات الموزعة الحساسة، وضمان الاتصال الفعال، ومعالجة عدم تجانس البيانات، وفي النهاية ضمان دقة النموذج. ولمعالجة هذه المشكلات، تقترح هذه الأطروحة حلولاً تهدف إلى تعزيز الكفاءة والدقة والخصوصية في أنظمة FL. يستخدم هذا البحث البيانات بشكل مركزي لإنشاء معلمات النموذج الأولية ويستخدم أساليب اختيار الميزات الموحدة، مما يؤدي بشكل فعال إلى تحسين تقارب النماذج وتقليل الاتصالات والنفقات الحسابية. بالإضافة إلى ذلك، تعمل زيادة البيانات الاصطناعية على تخفيف مشكلات عدم تجانس البيانات، مما يعزز أداء النموذج. أخيرًا، يجمع هذا البحث بين الخصوصية التفاضلية والبيانات الاصطناعية والتشفير المتماثل، مما يضمن إجراء حسابات آمنة على البيانات المشفرة والحفاظ على خصوصية البيانات أثناء تجميع النماذج. توضح النتائج التجريبية ما يلي: أ) الحل المقترح لتوليد النموذج الأولي يقلل من عدد التكرارات بأكثر من عامل 4 مقارنة بخوارزمية FL الأساسية، مع الحفاظ على دقة النموذج. ب) اقترحت هذه الأطروحة طريقة اختيار الميزة الموحدة التي تعمل على تحسين كفاءة الخوارزمية بعامل يتراوح من 4 (القضاء الخلفي) إلى 14 (عتبة التباين)، ويعزز الدقة. ج) يستخدم الحل المقترح زيادة البيانات الاصطناعية في البيانات غير المتجانسة لتعزيز الدقة بشكل كبير. د) وأخيراً، يقدم هذا البحث آلية خصوصية هجينة لتعزيز خصوصية البيانات مع الحفاظ على الكفاءة والدقة. باختصار، تقدم هذه الأطروحة إطارًا شاملاً لتعزيز أنظمة FL، مع التركيز بشكل خاص على تعزيز الخصوصية والكفاءة والدقة والأداء العام.

Share

COinS