|
Title
|
ارايه يك چارچوب پردازش زبان طبيعي چندزبانه(PersianPassEval) براي تخمين قدرت رمز عبور معنايي
|
|
Type
|
Presentation
|
|
Keywords
|
امنيت گذرواژه، تحليل زبان طبيعي، يادگيري عميق، چندزبانگي، الگوهاي فرهنگي، PersianLeak-1404، Culturally-Sensitive Computing، BiLSTM، Random Forest
|
|
Abstract
|
گذرواژه ها همچنان مهم ترين و پركاربردترين مكانيزم احراز هويت در دنياي ديجيتال هستند، اما گزارش Verizon DBIR 2024 نشان مي دهد كه 81٪ رخنه هاي داده اي ناشي از گذرواژه هاي ضعيف، تكراري يا قابل حدس بوده است. روش هاي سنتي ارزيابي قدرت گذرواژه مانند zxcvbn، PasswordMeter و معيار آنتروپي شانون صرفاً بر طول، تنوع كاراكتر و وجود كلمات ديكشنري تمركز دارند و از درك الگوهاي زباني، معنايي و به ويژه الگوهاي فرهنگي كاربران عاجزند. در اين پژوهش، چارچوب PersianPassEval پيشنهاد شده است؛ مدلي تركيبي كه با استفاده از Word2Vec فاين تيون شده روي بيش از 550 ميليون گذرواژه واقعي نشت شده، توكن سازي BPE، شبكه BiLSTM دوطرفه و تركيب آن با 42 ويژگي آماري و فرهنگي، و در نهايت طبقه بندي با Random Forest، قادر است گذرواژه ها را با دقت بسيار بالا در سه سطح ضعيف، متوسط و قوي طبقه بندي كند. مدل روي سه مجموعه داده بزرگ RockYou (32.5M)، Have I Been Pwned (بخش چندزبانه) و به ويژه PersianLeak-1404 (8.3 ميليون گذرواژه فارسي واقعي جمع آوري شده از رخنه هاي سال هاي 1403 و 1404) آموزش ديده است. نتايج نشان دهنده بهبود ميانگين 12٪ در F1-score، 15٪ در AUC نسبت به zxcvbn و مهم تر از همه بهبود 22٪ در F1-score روي داده هاي فارسي است. اين چارچوب اولين مدلي است كه به طور خاص الگوهاي فرهنگي فارسي نظير تاريخ شمسي، نام هاي مذهبي و خانوادگي، تركيبات «نام + سال» و عبارات احساسي فارسي را به صورت سيستماتيك مدل سازي مي كند.
|
|
Researchers
|
Hamed Monkaresi (First researcher) , gholamreza Ahmadi (Second researcher)
|