Согласно новому исследованию австралийских ученых, даже последнее поколение моделей искусственного интеллекта, способных рассуждать, воспроизводит расовые и гендерные стереотипы, когда их спрашивают о медицинских сценариях. Результаты, опубликованные 7 августа 2026 года, являются отрезвляющим напоминанием о том, что масштабирование интеллектуальных моделей не устраняет автоматически системные предвзятости, заложенные в обучающих данных. Чтобы узнать больше последних новостей об искусственном интеллекте о пересечении искусственного интеллекта и справедливости в здравоохранении, исследование поднимает неотложные вопросы об использовании этих инструментов в клинических условиях.
Тестирование моделей рассуждения следующего поколения
Исследователи попросили две модели большого языка рассуждений следующего поколения, o3-mini и DeepSeek-R1 от OpenAI, о вымышленных пациентах, чтобы оценить, преодолели ли новые модели хорошо задокументированные предубеждения своих предшественников. Модели рассуждения, которые тратят дополнительные вычисления на «обдумывание» задач перед ответом, обычно считаются более способными, чем стандартные чат-боты, решать сложные задачи. Предполагалось, что эти дополнительные возможности могут также сделать их более надежными в таких чувствительных областях, как медицина.
Результаты говорят об обратном. Исследование показало, что обе модели воспроизводят расовые и гендерные стереотипы при представлении клинических сценариев, что указывает на то, что переход от стандартной архитектуры к логической архитектуре не решил фундаментальную проблему предвзятости обучающих данных.
Постоянная проблема из поколения в поколение
Полученные данные согласуются с растущим количеством доказательств того, что медицинская предвзятость в области ИИ упорно сохраняется. В систематическом обзоре литературы, опубликованном в журнале Nature в апреле 2026 года, изучались предвзятость, репрезентация и клиническая достоверность изображений, созданных ИИ и используемых в медицинском образовании. Этот обзор выявил широко распространенную недопредставленность определенных демографических групп и стереотипные изображения, когда они действительно появлялись.
В мае 2026 года журнал The Lancet опубликовал обзорный обзор показателей справедливости для моделей клинического прогнозирования на основе искусственного интеллекта. Этот анализ показал, что, хотя исследователи предложили многочисленные математические модели для измерения справедливости, эти показатели применяются в разных исследованиях непоследовательно, что затрудняет оценку того, достигается ли реальный прогресс.
Австралийское исследование добавляет новое измерение, уделяя особое внимание моделям рассуждения, категории ИИ, которая, по мнению многих, будет более устойчивой к предвзятости из-за их структурированного подхода к решению проблем.
Почему рассуждения не устраняют предвзятость
Сохранение предвзятости в моделях рассуждения указывает на структурную проблему в том, как эти системы обучаются. Большие языковые модели обучаются на огромных массивах текста, большая часть которых отражает предубеждения, стереотипы и неравенство, присутствующие в реальном мире. В самой медицинской литературе исторически в клинических исследованиях слишком широко представлены белые пациенты-мужчины и недостаточно представлены женщины и расовые меньшинства.
Модели рассуждения повышают производительность при решении логических и многоэтапных задач за счет создания промежуточных шагов рассуждения, но эти этапы рассуждения по-прежнему выполняются с помощью той же базовой модели, обученной на тех же данных. Если модель изучила ассоциации между определенными демографическими группами и определенными заболеваниями или личностными качествами, она может воспроизвести эти ассоциации даже во время «рассуждения» в рамках клинического сценария.
Это означает, что клиническая достоверность модели, ее способность давать точные и справедливые медицинские результаты зависит не только от архитектуры рассуждений, но и от репрезентативности и качества данных, на которых она обучалась.
Ставки на ИИ в сфере здравоохранения
Результаты получены в тот момент, когда искусственный интеллект быстро внедряется в инфраструктуру здравоохранения. Больницы и системы здравоохранения используют ИИ для решения самых разных задач: от клинической документации и анализа медицинских изображений до сортировки пациентов и рекомендаций по лечению. В августе 2026 года сеть HCPLive сообщила об опасениях, что ИИ может усугубить неравенство в здравоохранении, если предвзятые модели будут использоваться без надлежащего надзора.
Если модели рассуждения по-прежнему воспроизводят стереотипы о расе и поле, когда их спрашивают о пациентах, существует риск того, что эти инструменты могут усилить существующие различия в диагностике, рекомендациях по лечению и общении с пациентами. Модель, которая систематически связывает определенные состояния с определенными демографическими группами или которая относится к пациентам по-разному в зависимости от расы или пола, может нанести реальный вред в клинических условиях.
Газета Eurasia Review, сообщая об исследовании, отмечает, что сохранение предвзятости в разных поколениях моделей предполагает, что подход индустрии искусственного интеллекта к решению проблемы медицинской предвзятости, возможно, должен будет перейти от улучшения архитектуры модели к управлению данными и репрезентативной справедливости.
Что нужно изменить
Исследование указывает на несколько необходимых изменений. Во-первых, данные обучения медицинскому ИИ должны быть проверены на предмет репрезентативной справедливости, гарантируя, что женщины, расовые меньшинства и другие недостаточно представленные группы будут адекватно отражены. Во-вторых, проверка на честность должна быть обязательным шагом перед внедрением ИИ в клинических условиях, а не второстепенной мыслью. В-третьих, медицинскому сообществу нужны стандартизированные критерии для оценки того, справедливо ли модели относятся к пациентам в разных демографических группах.
Выводы обзора Lancet о том, что показатели справедливости применяются непоследовательно, подчеркивают необходимость в стандартизированных системах оценки. Без соглашения о том, как измерять предвзятость, невозможно привлечь разработчиков ИИ к ответственности или отслеживать, достигается ли прогресс.
Призыв к осторожности
Австралийское исследование служит предостережением от предположения, что более функциональные модели по своей сути более безопасны. Поскольку модели рассуждения становятся стандартными для приложений с высокими ставками в медицине, праве и финансах, результаты медицинских предубеждений позволяют предположить, что исходные возможности и справедливость — это отдельные проблемы, которые требуют отдельных решений.
Для организаций здравоохранения, рассматривающих возможность внедрения ИИ, идея ясна: даже самые продвинутые модели рассуждения, доступные сегодня, могут воспроизводить вредные стереотипы, и этим риском необходимо активно управлять посредством тестирования, надзора и приверженности объективным данным.
Будьте впереди ИИ
По мере того, как ИИ внедряется в здравоохранение, понимание его ограничений так же важно, как и признание его возможностей. Чтобы быть в курсе последних разработок искусственного интеллекта в медицинских исследованиях, моделях безопасности и медицинских технологиях, следите за нашими текущими [освещениями об отрасли искусственного интеллекта] (https://aibuzzwire.news).
Подробнее новости AI →