|
عنوان
|
ارایه یک چارچوب پردازش زبان طبیعی چندزبانه(PersianPassEval) برای تخمین قدرت رمز عبور معنایی
|
|
نوع پژوهش
|
مقالات در همایش ها
|
|
کلیدواژهها
|
امنیت گذرواژه، تحلیل زبان طبیعی، یادگیری عمیق، چندزبانگی، الگوهای فرهنگی، PersianLeak-1404، Culturally-Sensitive Computing، BiLSTM، Random Forest
|
|
چکیده
|
گذرواژه ها همچنان مهم ترین و پرکاربردترین مکانیزم احراز هویت در دنیای دیجیتال هستند، اما گزارش Verizon DBIR 2024 نشان می دهد که 81٪ رخنه های داده ای ناشی از گذرواژه های ضعیف، تکراری یا قابل حدس بوده است. روش های سنتی ارزیابی قدرت گذرواژه مانند zxcvbn، PasswordMeter و معیار آنتروپی شانون صرفاً بر طول، تنوع کاراکتر و وجود کلمات دیکشنری تمرکز دارند و از درک الگوهای زبانی، معنایی و به ویژه الگوهای فرهنگی کاربران عاجزند. در این پژوهش، چارچوب PersianPassEval پیشنهاد شده است؛ مدلی ترکیبی که با استفاده از Word2Vec فاین تیون شده روی بیش از 550 میلیون گذرواژه واقعی نشت شده، توکن سازی BPE، شبکه BiLSTM دوطرفه و ترکیب آن با 42 ویژگی آماری و فرهنگی، و در نهایت طبقه بندی با Random Forest، قادر است گذرواژه ها را با دقت بسیار بالا در سه سطح ضعیف، متوسط و قوی طبقه بندی کند. مدل روی سه مجموعه داده بزرگ RockYou (32.5M)، Have I Been Pwned (بخش چندزبانه) و به ویژه PersianLeak-1404 (8.3 میلیون گذرواژه فارسی واقعی جمع آوری شده از رخنه های سال های 1403 و 1404) آموزش دیده است. نتایج نشان دهنده بهبود میانگین 12٪ در F1-score، 15٪ در AUC نسبت به zxcvbn و مهم تر از همه بهبود 22٪ در F1-score روی داده های فارسی است. این چارچوب اولین مدلی است که به طور خاص الگوهای فرهنگی فارسی نظیر تاریخ شمسی، نام های مذهبی و خانوادگی، ترکیبات «نام + سال» و عبارات احساسی فارسی را به صورت سیستماتیک مدل سازی می کند.
|
|
پژوهشگران
|
حامد منکرسی (نفر اول)، غلامرضا احمدی (نفر دوم)
|
|
تاریخ انجام
|
1404-12-13
|