🩺 پژوهش جدید: مدلهای عمومی هوش مصنوعی از ابزارهای تخصصی پزشکی پیشی گرفتندنتایج یک مطالعهی گسترده…
انتشار: 2026/07/06 17:09 UTC
🩺 پژوهش جدید: مدلهای عمومی هوش مصنوعی از ابزارهای تخصصی پزشکی پیشی گرفتندنتایج یک مطالعهی گسترده در مجلهی Nature Medicine نشان میدهد که مدلهای هوش مصنوعی عمومی مانند GPT-5.2، Gemini 3.1 Pro و Claude Opus 4.6 در پاسخگویی به سوالات پزشکی، عملکردی بهتر از ابزارهای تخصصی بالینی دارند.---🔬 روش پژوهش:پژوهشگران در سه مرحله، عملکرد مدلها را ارزیابی کردند:مرحلهی اول: ۵۰۰ سوال سبک آزمون پزشکی (MedQA)مرحلهی دوم: ۵۰۰ سوال از مجموعهی HealthBench برای سنجش هماهنگی با نظر پزشکانمرحلهی سوم: ۱۰۰ سوال واقعی پزشکان در محیط بالینی (RCQ)پاسخهای مرحلهی سوم بهصورت تصادفی و کور توسط ۱۲ پزشک آمریکایی بررسی شد و ۱٬۸۰۰ ارزیابی تخصصی انجام گردید.---📊 نتایج چشمگیر:در آزمون MedQA:- مدل Gemini با ۹۷.۴٪ بالاترین دقت را داشت- مدل GPT با ۹۴.۲٪ در رتبهی دوم قرار گرفت- مدل Claude با ۹۰.۲٪ سوم شد- ابزارهای تخصصی OpenEvidence و UpToDate به ترتیب ۸۹.۶٪ و ۸۸.۴٪ موفقیت داشتنددر آزمون HealthBench:- مدل GPT با امتیاز ۸۸ بالاترین رتبه را کسب کرد- مدل Gemini با ۷۹.۳ و Claude با ۷۷ در ردههای بعدی- ابزارهای تخصصی با امتیازهای حدود ۶۲-۶۳ در جایگاه آخر قرار گرفتنددر سوالات واقعی بالینی (RCQ):- مدلهای عمومی در تمام ابعاد چهارگانه (صحت بالینی، کامل بودن، ایمنی و وضوح) عملکرد بهتری داشتند- مدلهای عمومی در گروه اول با امتیاز میانگین ۳.۵۶-۳.۶۲ از ۴ و ابزارهای تخصصی با ۳.۱۷-۳.۲۴ در گروه دوم قرار گرفتند---⚠️ نکتهی جالب دربارهی RAG:سیستمهای بازیابی-تولید (RAG) که در ابزارهای تخصصی استفاده میشوند، در برخی موارد پاسخها را بدتر میکنند. وقتی این سیستمها اطلاعات نامربوط یا ضعیف را به مدل میدهند، کیفیت پاسخ کاهش مییابد. طبق این پژوهش، ابزارهای تخصصی ۴۹ تا ۸۷٪ شانس کمتری برای کسب امتیاز بالاتر نسبت به Gemini داشتند.---🤔 چرا مدلهای عمومی بهتر عمل میکنند؟دلایل اصلی شامل موارد زیر است:- دادههای آموزشی گستردهتر مدلهای عمومی- چرخههای بهروزرسانی سریعتر نسبت به ابزارهای تخصصی- توانایی استدلال قویتر در مدلهای عمومی- سیستمهای RAG گاهی اطلاعات نامربوط بازیابی میکنند که کیفیت پاسخ را کاهش میدهد---📌 مهمترین پیام:اگرچه ابزارهای تخصصی هوش مصنوعی با برندهای معتبر پزشکی عرضه میشوند و ممکن است امنتر به نظر برسند، اما در عمل، مدلهای عمومی پیشرفتهتر میتوانند پاسخهای دقیقتر و کاملتری ارائه دهند. بهویژه در سوالات پیچیده و واقعی که پزشکان با آنها مواجه میشوند.البته پژوهشگران تأکید دارند که این نتایج ممکن است با پیشرفت فناوری تغییر کند و در آینده، مدلهای تخصصیتر که بر اساس دادههای بیمارستانی آموزش ببینند، میتوانند عملکرد بهتری داشته باشند.---🔗 لینک مقاله: nature.com/articles/s41591-026-04431-5--- #پزشکی_هوش_مصنوعی #پژوهش_پزشکی #مدل_های_زبانی #NatureMedicine #هوش_مصنوعی_در_سلامت #OpenAI #Google #Anthropic🆔 @asrgooyeshpardaz