تقلید صدای شما توسط هوش مصنوعی فقط با عکس شما

به گزارش خبرنگار پايگاه خبري سروش امنيت به نقل از پلیس فتا ،تقلید صدای شما توسط هوش مصنوعی فقط با عکس شما

از چهرهها تا صداها
یک تکنیک جدید در حال تغییر نحوهٔ تولید «صدای جعلشده» (voice deepfake) است. بهجای استفاده از متن یا نمونهٔ صوتی از فرد، امکان دارد با تحلیل عکس، سخن تولید شود، با این فرض که ظاهر فرد بتواند برخی از ویژگیهای صوتی مانند زیر و بمی یا تُن صدا را پیشبینی کند.
چون عکسها بسیار آسانتر از فایلهای صوتی در اینترنت یافت میشوند، این روش جعل را برای مهاجمان راحتتر و در وسیع تر میکند. در آزمایشها، این روش توانست ویژگی «چاپصدای» (voiceprint) سرویس WeChat را که برای ورود به حساب کاربری به صدا متکی است را حدود ۳۰درصد در تلاش اول فریب دهد و پس از چندین تلاش تقریباً ۱۰۰درصد موفق عمل کرد.
چون صدای تولیدشده با این روش الگوهایی که ابزارهای تشخیص جعل سنتی آموزش دیدهاند را ندارد، بیشتر این ابزارها نتوانستند آن را جعلی تشخیص دهند.
بررسی عملکرد ابزارهای تشخیص فعلی
برای سنجش عملکرد ابزارها، پژوهشگران یک مجموعهٔ دادهٔ بزرگ از صداهای واقعی و ساختگی آماده کردند و سیستمها را در سه حالت شنیداری: واضح، پر از نویز و پس از حذف نویز آزمایش کردند.
در این مجموعه هم نمونههایی تولیدشده با روش FOICE و هم نمونههای تولیدشده با متن-به-صدا (text-to-speech) گنجانده شده بود تا ببینند ابزارها چگونه با روشهای قدیمی و روشهای جدیدتر روبهرو میشوند.
ابزارها در برابر حملات صدای جدید دچار مشکل شدند
نتایج نشان داد که آن ابزارهایی که خوب با جعل صوتی سنتی (مثلاً تبدیل صدا یا متن به صدا) کار میکردند، در شناسایی صوتی که از عکس تولید شده بود، شکست خوردند. برخی از ابزارها صداهای واقعی را جعلی تشخیص دادند و برخی دیگر بخش عمدهٔ فیکها را از دست دادند.
پس از آن، این ابزارها با نمونههای ساختگی FOICE دوباره آموزش داده شدند، عملکردشان بهتر شد؛ چند مدل تقریباً در تشخیص آنها کامل عمل کردند. اما وقتی همان ابزارها روی نوع دیگری از تولید صدا آزمایش شدند، عملکردشان به شدت افت کرد. یکی از مدلها از دقت حدود ۴۰درصد به زیر ۴درصد کاهش یافت. فقط یک سیستم بود که عملکرد ثابتی بین هر دو نوع حفظ کرد.
این نتایج نشان میدهد که آموزش ابزارها برای تشخیص یک نوع جعل میتواند باعث شود از تشخیص سایر روشها باز بمانند (اصطلاحاً «بیشبرازش» یا overfitting).
دامنهٔ ارزیابی و محدودیتها
نویسندگان تأکید کردهاند که آزمایشهایشان تمام سناریوهای ممکن حمله را پوشش نمیدهد، ولی روندها نشان میدهد که یک مشکل گسترده در حوزهٔ احراز هویت صوتی و تشخیص جعل وجود دارد.
آنها نتیجه گرفتند که صنایع باید مجموعه دادههای بزرگتر و متنوعتر، روشهای آموزشی جدید و مدلهایی داشته باشند که بتوانند صداهای ساختگی تولیدشده از ورودیهای غیرسنتی (مثل عکس) را شناسایی کنند. همچنین خواستار آزمایشهای گستردهتر با مولدهای مختلف، شرایط دستگاههای متنوع و ورودیهای ویدئویی نیز شدند. هدف این است که به جای واکنش (fine-tuning به هر روش جعلی)، به سمت تدابیر پیشگیرانه حرکت شود؛ یعنی مدلهایی داشته باشیم که قبل از آنکه روش جدید جعل رایج شود، بتوانند آن را تشخیص دهند.
[author title=”نويسنده” image=”https://soroosheamniyat.ir/wp-content/uploads/2025/03/68ce8398-24e3-40b3-8f1a-cd664029e334.png”]مسعود اسدپور کارشناس امنيت وخبرنگار پايگاه خبري سروش امنيت[/author]
منبع :
پلیس فتا





