Reaching Data Confidentiality and Model Accountability on the CalTrain

Autor:	Zhongshu Gu, Jialong Zhang, Heqing Huang, Tengfei Ma, Ian M. Molloy, Dimitrios Pendarakis, Dong Su, Hani Jamjoom
Jazyk:	angličtina
Rok vydání:	2018
Předmět:	FOS: Computer and information sciences Information privacy Computer Science - Machine Learning Training set Computer Science - Cryptography and Security Backtracking Computer science Collaborative learning 02 engineering and technology 010501 environmental sciences Computer security computer.software_genre 01 natural sciences Machine Learning (cs.LG) Accountability 0202 electrical engineering electronic engineering information engineering Key (cryptography) 020201 artificial intelligence & image processing Confidentiality computer Cryptography and Security (cs.CR) 0105 earth and related environmental sciences Backdoor
Zdroj:	DSN
Popis:	Distributed collaborative learning (DCL) paradigms enable building joint machine learning models from distrusting multi-party participants. Data confidentiality is guaranteed by retaining private training data on each participant's local infrastructure. However, this approach to achieving data confidentiality makes today's DCL designs fundamentally vulnerable to data poisoning and backdoor attacks. It also limits DCL's model accountability, which is key to backtracking the responsible "bad" training data instances/contributors. In this paper, we introduce CALTRAIN, a Trusted Execution Environment (TEE) based centralized multi-party collaborative learning system that simultaneously achieves data confidentiality and model accountability. CALTRAIN enforces isolated computation on centrally aggregated training data to guarantee data confidentiality. To support building accountable learning models, we securely maintain the links between training instances and their corresponding contributors. Our evaluation shows that the models generated from CALTRAIN can achieve the same prediction accuracy when compared to the models trained in non-protected environments. We also demonstrate that when malicious training participants tend to implant backdoors during model training, CALTRAIN can accurately and precisely discover the poisoned and mislabeled training data that lead to the runtime mispredictions.
Databáze:	OpenAIRE
Externí odkaz:	https://explore.openaire.eu/search/publication?articleId=doi_dedup___::8c322b230017497bf76d1d8477b12f51 http://arxiv.org/abs/1812.03230 Zobrazit plný text záznamu