DeepSeek-GRM معرفی تکنیک استدلال پیشرفته هوش مصنوعی
براساس گزارش پايگاه خبري سروش امنيت ، محققان دانشگاه DeepSeek و Tsinghua میگویند که ترکیب دو تکنیک پاسخهایی را که مدل زبان بزرگ با تکنیکهای استدلال کامپیوتری ایجاد میکند، بهبود میبخشد.
به گزارش خبرنگار پايگاه خبري سروش امنيت به نقل از پلیس فتا ،محققان شرکت هوش مصنوعی DeepSeek و دانشگاه Tsinghua تکنیک جدیدی را برای تقویت «استدلال» در مدلهای زبان بزرگ (LLM) معرفی کردهاند.
قابلیتهای استدلال به عنوان یک معیار مهم در رقابت برای ساختن سیستمهای هوش مصنوعی مولد با عملکرد برتر ظاهر شدهاند. چین و ایالات متحده به طور فعال برای توسعه قدرتمندترین و کاربردیترین مدلها رقابت میکنند. طبق گزارش دانشگاه استنفورد در ماه آوریل، LLM های چین به سرعت در حال کاهش فاصله با همتایان آمریکایی خود هستند. در سال 2024، چین 15 مدل هوش مصنوعی قابل توجه در مقایسه با 40 مدل در ایالات متحده تولید کرد، اما در ثبت اختراعات و انتشارات دانشگاهی پیشتاز است.
قابلیتهای استدلال بهعنوان یک معیار مهم در رقابت برای ساختن سیستمهای هوش مصنوعی مولد با عملکرد برتر ظاهر شدهاند. چین و ایالات متحده به طور فعال برای توسعه قدرتمندترین و کاربردیترین مدلها رقابت میکنند. طبق گزارش دانشگاه استنفورد در ماه آوریل، LLM های چین به سرعت در حال کاهش فاصله با همتایان آمریکایی خود هستند. در سال 2024، چین 15 مدل هوش مصنوعی قابل توجه در مقایسه با 40 مدل در ایالات متحده تولید کرد، اما در ثبت اختراعات و انتشارات دانشگاهی پیشتاز است.
تکنیک جدید DeepSeek چیست؟
محققان DeepSeek مقالهای با عنوان «مقیاسبندی زمان استنتاج برای مدلسازی پاداش عمومی» در آرشیو مقالات علمی دانشگاه کرنل، arXiv، منتشر کردند. توجه داشته باشید که مقالات منتشر شده در arXiv لزوماً توسط همتایان بررسی نمی شوند.
در این مقاله، محققان ترکیبی از دو روش آموزش هوش مصنوعی را شرح دادند: مدلسازی پاداش مولد و تنظیم نقد خود-اصولی.
محققان نوشتند: “در این کار، ما بررسی میکنیم که چگونه میتوان مدلسازی پاداش (RM) را با محاسبه استنتاج بیشتر برای پرسوجوهای عمومی، یعنی مقیاسپذیری زمان استنتاج RM عمومی و همچنین چگونگی بهبود اثربخشی مقیاسبندی محاسبه عملکرد با روشهای یادگیری مناسب، بهبود بخشید.
NETSCOUT هشدار داد: حملات DDoS اکنون سلاحهای کلیدی در درگیریهای ژئوپلیتیکی هستند
مدلسازی پاداش، فرآیند آموزش هوش مصنوعی برای هماهنگی بیشتر با ترجیحات کاربر است. با تنظیم نقد خود اصولی، مدل در طول استنتاج، نقدها یا «اصول» خود را برای تنظیم دقیق پاسخهای خود ایجاد میکند. رویکرد ترکیبی به تلاش برای اجازه دادن به LLMها برای ارائه سریعتر پاسخهای مرتبط ادامه میدهد.
محققان نوشتند: «از نظر تجربی، ما نشان میدهیم که SPCT به طور قابلتوجهی کیفیت و مقیاسپذیری GRMها را بهبود میبخشد، از روشها و مدلهای موجود در معیارهای مختلف RM بدون سوگیریهای شدید بهتر عمل میکند و میتواند عملکرد بهتری را در مقایسه با مقیاسگذاری در زمان آموزش به دست آورد».
آنها مدلهای آموزش دیده با این روش را DeepSeek-GRM نامیدند.
محققان نوشتند: «DeepSeek-GRM هنوز در برخی از وظایف با چالشهایی مواجه است، که ما معتقدیم میتوان با تلاشهای آینده در سیستمهای پاداش عمومی به آنها پرداخت.
آینده DeepSeek چیست؟
DeepSeek سر و صدای قابل توجهی در مورد مدل R1 ایجاد کرده است، مدلی که رقیب مدلهای پیشرو متمرکز بر استدلال مانند OpenAI o1 است. مدل دوم، DeepSeek-R2، شایعه شده است که در ماه می عرضه خواهد شد. این شرکت همچنین DeepSeek-V3-0324 را راهاندازی کرد ، یک مدل استدلال به روز شده که در اواخر مارس منتشر شد.
[author title=”نويسنده” image=”https://soroosheamniyat.ir/wp-content/uploads/2025/03/68ce8398-24e3-40b3-8f1a-cd664029e334.png”]مسعود اسدپور کارشناس امنيت وخبرنگار پايگاه خبري سروش امنيت[/author]
منبع :
پلیس فتا





