پلیس فتا

DeepSeek-GRM معرفی تکنیک استدلال پیشرفته هوش مصنوعی

براساس گزارش پايگاه خبري سروش امنيت ، محققان دانشگاه DeepSeek و Tsinghua می‌گویند که ترکیب دو تکنیک پاسخ‌هایی را که مدل زبان بزرگ با تکنیک‌های استدلال کامپیوتری ایجاد می‌کند، بهبود می‌بخشد.

به گزارش خبرنگار پايگاه خبري سروش امنيت به نقل از پلیس فتا ،محققان شرکت هوش مصنوعی DeepSeek و دانشگاه Tsinghua تکنیک جدیدی را برای تقویت «استدلال» در مدل‌های زبان بزرگ (LLM) معرفی کرده‌اند.

قابلیت‌های استدلال به‌ عنوان یک معیار مهم در رقابت برای ساختن سیستم‌های هوش مصنوعی مولد با عملکرد برتر ظاهر شده‌اند. چین و ایالات متحده به طور فعال برای توسعه قدرتمندترین و کاربردی‌ترین مدل‌ها رقابت می‌کنند. طبق گزارش دانشگاه استنفورد در ماه آوریل، LLM های چین به سرعت در حال کاهش فاصله با همتایان آمریکایی خود هستند. در سال 2024، چین 15 مدل هوش مصنوعی قابل توجه در مقایسه با 40 مدل در ایالات متحده تولید کرد، اما در ثبت اختراعات و انتشارات دانشگاهی پیشتاز است.

قابلیت‌های استدلال به‌عنوان یک معیار مهم در رقابت برای ساختن سیستم‌های هوش مصنوعی مولد با عملکرد برتر ظاهر شده‌اند. چین و ایالات متحده به طور فعال برای توسعه قدرتمندترین و کاربردی‌ترین مدل‌ها رقابت می‌کنند. طبق گزارش دانشگاه استنفورد در ماه آوریل، LLM های چین به سرعت در حال کاهش فاصله با همتایان آمریکایی خود هستند. در سال 2024، چین 15 مدل هوش مصنوعی قابل توجه در مقایسه با 40 مدل در ایالات متحده تولید کرد، اما در ثبت اختراعات و انتشارات دانشگاهی پیشتاز است.

تکنیک جدید DeepSeek چیست؟

محققان DeepSeek مقاله‌ای با عنوان «مقیاس‌بندی زمان استنتاج برای مدل‌سازی پاداش عمومی» در آرشیو مقالات علمی دانشگاه کرنل، arXiv، منتشر کردند. توجه داشته باشید که مقالات منتشر شده در arXiv لزوماً توسط همتایان بررسی نمی شوند.

در این مقاله، محققان ترکیبی از دو روش آموزش هوش مصنوعی را شرح دادند‌: مدل‌سازی پاداش مولد و تنظیم نقد خود-اصولی.

محققان نوشتند: “در این کار، ما بررسی می‌کنیم که چگونه می‌توان مدل‌سازی پاداش (RM) را با محاسبه استنتاج بیشتر برای پرس‌و‌جوهای عمومی، یعنی مقیاس‌پذیری زمان استنتاج RM عمومی‌ و همچنین چگونگی بهبود اثربخشی مقیاس‌بندی محاسبه عملکرد با روش‌های یادگیری مناسب، بهبود بخشید.

NETSCOUT هشدار داد: حملات DDoS اکنون سلاح‌های کلیدی در درگیری‌های ژئوپلیتیکی هستند

مدل‌سازی پاداش، فرآیند آموزش هوش مصنوعی برای هماهنگی بیشتر با ترجیحات کاربر است. با تنظیم نقد خود اصولی، مدل در طول استنتاج، نقدها یا «اصول» خود را برای تنظیم دقیق پاسخ‌های خود ایجاد می‌کند. رویکرد ترکیبی به تلاش برای اجازه دادن به LLMها برای ارائه سریع‌تر پاسخ‌های مرتبط ادامه می‌دهد.

محققان نوشتند: «از نظر تجربی، ما نشان می‌دهیم که SPCT به طور قابل‌توجهی کیفیت و مقیاس‌پذیری  GRM‌ها را بهبود می‌بخشد، از روش‌ها و مدل‌های موجود در معیارهای مختلف RM بدون سوگیری‌های شدید بهتر عمل می‌کند و می‌تواند عملکرد بهتری را در مقایسه با مقیاس‌گذاری در زمان آموزش به دست آورد».

آنها مدل‌های آموزش دیده با این روش را DeepSeek-GRM نامیدند.

محققان نوشتند: «DeepSeek-GRM هنوز در برخی از وظایف با چالش‌هایی مواجه است، که ما معتقدیم می‌توان با تلاش‌های آینده در سیستم‌های پاداش عمومی به آنها پرداخت.

آینده DeepSeek چیست؟

DeepSeek سر و صدای قابل توجهی در مورد مدل R1 ایجاد کرده است، مدلی که رقیب مدل‌های پیشرو متمرکز بر استدلال مانند OpenAI o1 است. مدل دوم، DeepSeek-R2، شایعه شده است که در ماه می عرضه خواهد شد. این شرکت همچنین DeepSeek-V3-0324 را راه‌اندازی کرد ، یک مدل استدلال به روز شده که در اواخر مارس منتشر شد.

[author title=”نويسنده” image=”https://soroosheamniyat.ir/wp-content/uploads/2025/03/68ce8398-24e3-40b3-8f1a-cd664029e334.png”]مسعود اسدپور کارشناس امنيت وخبرنگار پايگاه خبري سروش امنيت[/author]

منبع  :
پلیس فتا 

techrepublic

پویش #دو_درجه_کمتر
نمایش بیشتر

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

Time limit is exhausted. Please reload the CAPTCHA.

دکمه بازگشت به بالا