پلیس فتا

تقلید صدای شما توسط هوش مصنوعی فقط با عکس شما

به گزارش خبرنگار پايگاه خبري سروش امنيت به نقل از پلیس فتا ،تقلید صدای شما توسط هوش مصنوعی فقط با عکس شما

از چهره‌ها تا صداها

یک تکنیک جدید در حال تغییر نحوهٔ تولید «صدای جعل‌شده» (voice deepfake) است. به‌جای استفاده از متن یا نمونهٔ صوتی از فرد، امکان دارد با تحلیل عکس، سخن تولید شود، با این فرض که ظاهر فرد بتواند برخی از ویژگی‌های صوتی مانند زیر و بمی یا تُن صدا را پیش‌بینی کند.

چون عکس‌ها بسیار آسان‌تر از فایل‌های صوتی در اینترنت یافت می‌شوند، این روش جعل را برای مهاجمان راحت‌تر و در وسیع تر می‌کند. در آزمایش‌ها، این روش توانست ویژگی «چاپ‌صدای» (voiceprint) سرویس WeChat را که برای ورود به حساب کاربری به صدا متکی است را حدود ۳۰درصد  در تلاش اول فریب دهد و پس از چندین تلاش تقریباً ۱۰۰درصد موفق عمل کرد.

چون صدای تولیدشده با این روش الگوهایی که ابزارهای تشخیص جعل سنتی آموزش دیده‌اند را ندارد، بیشتر این ابزارها نتوانستند آن را جعلی تشخیص دهند.

بررسی عملکرد ابزارهای تشخیص فعلی

برای سنجش عملکرد ابزارها، پژوهش‌گران یک مجموعهٔ دادهٔ بزرگ از صداهای واقعی و ساختگی آماده کردند و سیستم‌ها را در سه حالت شنیداری: واضح، پر از نویز  و پس از حذف نویز آزمایش کردند.

در این مجموعه هم نمونه‌هایی تولیدشده با روش FOICE و هم نمونه‌های تولیدشده با متن-به-صدا (text-to-speech) گنجانده شده بود تا ببینند ابزارها چگونه با روش‌های قدیمی و روش‌های جدیدتر روبه‌رو می‌شوند.

ابزارها در برابر حملات صدای جدید دچار مشکل شدند

نتایج نشان داد که آن ابزارهایی که خوب با جعل صوتی سنتی (مثلاً تبدیل صدا یا متن به صدا) کار می‌کردند، در شناسایی صوتی که از عکس تولید شده بود، شکست خوردند. برخی از ابزارها صداهای واقعی را جعلی تشخیص دادند و برخی دیگر بخش عمدهٔ فیک‌ها را از دست دادند.

پس از آن، این ابزارها با نمونه‌های ساختگی FOICE دوباره آموزش داده شدند، عملکردشان بهتر شد؛ چند مدل تقریباً در تشخیص آن‌ها کامل عمل کردند. اما وقتی همان ابزارها روی نوع دیگری از تولید صدا آزمایش شدند، عملکردشان به شدت افت کرد. یکی از مدل‌ها از دقت حدود ۴۰درصد به زیر ۴درصد کاهش یافت. فقط یک سیستم بود که عملکرد ثابتی بین هر دو نوع حفظ کرد.

این نتایج نشان می‌دهد که آموزش ابزارها برای تشخیص یک نوع جعل می‌تواند باعث شود از تشخیص سایر روش‌ها باز بمانند (اصطلاحاً «بیش‌برازش» یا overfitting).

دامنهٔ ارزیابی و محدودیت‌ها

نویسندگان تأکید کرده‌اند که آزمایش‌هایشان تمام سناریوهای ممکن حمله را پوشش نمی‌دهد، ولی روندها نشان می‌دهد که یک مشکل گسترده در حوزهٔ احراز هویت صوتی و تشخیص جعل وجود دارد.

آن‌ها نتیجه گرفتند که صنایع باید مجموعه داده‌های بزرگ‌تر و متنوع‌تر، روش‌های آموزشی جدید و مدل‌هایی داشته باشند که بتوانند صداهای ساختگی تولیدشده از ورودی‌های غیرسنتی (مثل عکس) را شناسایی کنند. همچنین خواستار آزمایش‌های گسترده‌تر با مولدهای مختلف، شرایط دستگاه‌های متنوع و ورودی‌های ویدئویی نیز شدند. هدف این است که به جای واکنش (fine-tuning به هر روش جعلی)، به سمت تدابیر پیشگیرانه حرکت شود؛ یعنی مدل‌هایی داشته باشیم که قبل از آنکه روش جدید جعل رایج شود، بتوانند آن را تشخیص دهند.

[author title=”نويسنده” image=”https://soroosheamniyat.ir/wp-content/uploads/2025/03/68ce8398-24e3-40b3-8f1a-cd664029e334.png”]مسعود اسدپور کارشناس امنيت وخبرنگار پايگاه خبري سروش امنيت[/author]

منبع  :
پلیس فتا

پویش #دو_درجه_کمتر
نمایش بیشتر

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

Time limit is exhausted. Please reload the CAPTCHA.

دکمه بازگشت به بالا