Le Federated Learning (FL) permet d’entraîner des modèles d’apprentissage automatique sur des données décentralisées tout en préservant leur confidentialité. Les performances des algorithmes de FL classiques se dégradent lorsque les distributions de données des clients sont hétérogènes, une situation désignée sous le terme de données Non-IID. Le Clustered Federated Learning (CFL) répond à cette limitation en remplaçant le modèle global unique par plusieurs modèles spécialisés par groupe de clients partageant des données similaires.
Cette thèse s’intéresse aux méthodes de CFL robustes et respectueuses de la confidentialité, capables de fonctionner dans des contextes Non-IID complexes. Nous y proposons une taxonomie unifiée des approches CFL, organisée en trois paradigmes : le Server-side, le Client-side et le Metadata-based. Cette proposition met en évidence un compromis fondamental entre confidentialité, efficacité computationnelle et efficacité en communication, formalisé sous le nom de emph{trilemme du CFL}.
Dans un second temps, une évaluation empirique du CFL sous différents scénarios Non-IID montre que le emph{Quantity Skew} (QS), correspondant à un déséquilibre des volumes de données entre clients, constitue une source majeure de dégradation des performances et d’instabilité du processus de clustering, malgré l’attention limitée dans la littérature existante. En conséquence, nous introduisons extbf{CORNFLQS}, une nouvelle approche de CFL combinant des mécanismes de clustering fondés sur les poids des modèles et sur les pertes locales. Les résultats expérimentaux montrent que CORNFLQS améliore significativement la robustesse face au QS tout en conservant des performances compétitives sur un large éventail de scénarios d’hétérogénéité. Ces résultats suggèrent que ces deux paradigmes de clustering capturent des aspects complémentaires de la similarité entre clients et que leur combinaison offre une robustesse face à des déséquilibres importants de volumes de données.
Enfin, nous nous intéressons au Metadata-based CFL, un paradigme offrant des propriétés attractives en termes de communication et de calcul grâce à l’utilisation de représentations compactes des clients. Cependant, les approches existantes nécessitent le partage de métadonnées, ce qui soulève d’importantes préoccupations en matière de confidentialité. De plus, l’application de mécanismes de chiffrement aux algorithmes de clustering conventionnels entraîne un coût computationnel prohibitif en raison de leur dépendance à des opérations non linéaires. Pour remédier à cette limitation, nous proposons extbf{FLAMECHE}, une approche de Metadata-based CFL formulée comme une procédure distribuée d’Expectation-Maximization. En limitant les calculs effectués côté serveur à des opérations additives, FLAMECHE devient compatible avec les principales technologies de protection de la confidentialité, notamment l’agrégation sécurisée (Secure Aggregation) et le chiffrement homomorphe (Homomorphic Encryption), tout en conservant les avantages de communication et de calcul propres au clustering basé sur les métadonnées.
Cette thèse contribue à une meilleure compréhension du Clustered Federated Learning, met en évidence l’importance du QS comme défi majeur pour les déploiements pratiques et introduit de nouvelles approches conciliant robustesse, efficacité et préservation de la confidentialité. Au-delà des algorithmes proposés, les résultats obtenus suggèrent que la conception de systèmes de CFL réellement opérationnels nécessite un équilibre soigneux entre ces objectifs parfois antagonistes, et que la reformulation algorithmique peut jouer un rôle essentiel pour concilier efficacité et fortes garanties de confidentialité. Les contributions présentées ouvrent également plusieurs perspectives de recherche liées aux environnements de FL dynamiques, à l’adaptation des clusters souples,et à l’apprentissage fédéré par cluster sécurisé. |
Federated Learning (FL) enables machine learning models to be trained on decentralized data while preserving data locality and privacy. However, the performance of traditional federated optimization algorithms often deteriorates when client data distributions are heterogeneous, a situation commonly referred to as Non-IID data. Clustered Federated Learning (CFL) addresses this limitation by replacing the single global model paradigm with multiple specialized models associated with groups of clients sharing similar data characteristics.
This thesis investigates the design of robust and privacy-aware CFL methods capable of operating under challenging forms of statistical heterogeneity. First, we propose a unified taxonomy of CFL existing approaches organized around three major paradigms: Server-side, Client-side, and Metadata-based CFL. This analysis highlights a fundamental trade-off between privacy preservation, computational efficiency, and communication efficiency, formalized as the emph{CFL Trilemma}.
Second, we conduct a comprehensive empirical evaluation of representative CFL methods under multiple forms of Non-IID data of Server-side and Client-side CFL. The results reveal that emph{Quantity Skew} (QS), corresponding to imbalanced data volumes across clients, constitutes a major source of performance degradation and clustering instability, despite receiving comparatively limited attention in the existing literature.
To address this challenge, we introduce extbf{CORNFLQS}, a novel CFL framework that dynamically combines weight-based and loss-based clustering mechanisms. Experimental results demonstrate that CORNFLQS significantly improves robustness under QS while maintaining competitive performance across a broad range of heterogeneity scenarios. These results suggest that both clustering paradigms capture complementary aspects of client similarity and that their combination provides increased resilience to severe quantity imbalance.
Finally, we investigate Metadata-based CFL, a paradigm that offers attractive communication and computational properties by relying on compact client representations. Existing approaches, however, generally require this metadata to be shared in plaintext, creating privacy concerns. Simply encrypting the metadata is not a practical solution, as conventional clustering algorithms rely on complex nonlinear operations that incur prohibitive computational overhead when performed over encrypted data. To address this limitation, we introduce extbf{FLAMECHE}, a Metadata-based CFL framework formulated as a distributed Expectation-Maximization procedure. By restricting server-side computations to additive operations, FLAMECHE becomes compatible with common privacy-enhancing technologies, including Secure Aggregation and Homomorphic Encryption, while preserving the efficiency advantages of metadata-driven clustering.
Overall, this thesis advances the understanding of Clustered Federated Learning, highlights the importance of QS as a key challenge for practical deployments, and introduces new approaches that jointly address robustness, efficiency, and privacy preservation. Beyond the proposed algorithms, the results suggest that achieving practical CFL systems requires carefully balancing these competing objectives and that algorithmic reformulation can play a key role in reconciling efficiency with strong privacy guarantees. The proposed contributions also open several research directions related to dynamic FL environments, soft cluster adaptation, and secure Clustered Federated Learning. |