Что произошло

Команда офтальмологического центра Чжуншань при университете Сунь Ятсена в Гуанчжоу опубликовала в журнале npj Digital Medicine результаты рандомизированного клинического испытания. Статья вышла 5 октября 2026 года в формате ускоренной предварительной публикации: журнал принял и рецензировал её, но предупреждает, что итоговая версия заменит эту и может отличаться.

Авторы проверили, может ли языковая модель самостоятельно вести предварительный опрос пациента до встречи с врачом — не просто конспектировать приём, а задавать вопросы и составлять карту. Сравнивали её с живыми ординаторами.

Как устроено исследование

Испытание одноцентровое, открытое: пациенты и ассистенты знали, кто их расспрашивает, а врачи-консультанты и два независимых эксперта оценивали результаты вслепую, не зная группы. Протокол зарегистрирован заранее в американском реестре испытаний ClinicalTrials.gov (номер NCT06824389).

ПараметрЗначение
Период наборас 10 мая по 10 июня 2025 года
Скринировано175 пациентов
Отказались3
Рандомизировано172, по 86 в группе
Анализировановсе 172, без потерь
Возрастмедиана 55 и 56 лет

В группе агента пациент открывал сервис в больничном приложении на своём смартфоне и отвечал голосом или текстом. В группе сравнения ординатор с опытом от трёх лет расспрашивал пациента лично и вносил запись в больничную систему без шаблона. Затем консультант просматривал карту вместе с пациентом, проводил осмотр на щелевой лампе и вносил поправки; итоговая карта служила эталоном. Из исследования исключили десять неотложных состояний, например проникающую травму глаза или острый приступ закрытоугольной глаукомы.

Агент состоит из двух частей. Основной ведёт диалог по «деревьям вопросов» для каждой группы жалоб (например, при красном глазе спрашивает о зрении, боли, выделениях и травме), вспомогательный параллельно выделяет ключевые признаки и готовит предварительный отчёт. Под капотом — открытая модель Qwen-2.5 на 72 миллиарда параметров, дообученная на офтальмологических записях и развёрнутая локально. Перед испытанием на 20 реальных случаях агент сравнили с четырьмя общими моделями, включая GPT-4o и DeepSeek-R1: по качеству опроса он оказался выше всех четырёх. Авторы подчёркивают, что система задумана для сбора анамнеза и оформления карты, а не для самостоятельной диагностики, хотя в предварительный отчёт агента входят и обследования, и предварительный диагноз. Пациентов предупреждали, что с ними общается ИИ; каждую карту врач утверждал до использования. Диалог автоматически прекращался, если пациент уходил, отрицал глазные симптомы, отвечал не по теме или у него обнаруживалось состояние, требующее срочного направления.

Что нашли

Главный показатель — баллы по шкале MedHistory (0–100): 92 балла за полноту опроса и клиническую логику, по 4 за коммуникацию и за документирование.

ПоказательАгент и ординаторы
Итоговый балл MedHistory80,7 ± 6,6 против 56,9 ± 8,2
Скорректированная разница17,7 балла (95 % ДИ 14,1–21,3)
Опрос (из 92)73,5 против 49,9
Коммуникация (из 4)3,81 против 3,47
Документирование (из 4)3,42 против 3,55, различий нет
Длительность опроса11,2 минуты против 3,1

Ординаторы хорошо выясняли основную жалобу, а агент чаще получал структурированные детали: что спровоцировало симптом, как он развивался. Рекомендации по обследованиям у групп достоверно не различались.

Мнение пациентов. Общая удовлетворённость сопоставима. Ординаторы получили выше оценку за то, что «помогли справиться с тревогой» (медиана 4,5 против 3; P = 0,005), агент — за терпение (5 против 4) и сочувствие (5 против 3). Пациентам из группы агента чаще казалась приемлемой замена живого опроса ИИ (5 против 3 баллов), и они выше оценивали защиту конфиденциальности (5 против 4; P = 0,005).

Диагноз. Это уже исследовательская часть. По одному анамнезу предварительный диагноз агента совпадал с эталоном лучше (F1-мера 0,85 против 0,68; разница 0,18, ДИ от 0,08 до 0,30). После добавления данных осмотра ординаторы выигрывали больше (разница в приросте −0,19; P = 0,003), и разрыв сокращался. Про качество плана лечения группы не различались.

Безопасность. Нежелательных явлений авторы не зарегистрировали.

Что здесь надо читать осторожно

Авторы сами называют несколько ограничений, и стоит добавить к ним то, что видно из текста.

  • Время. Агент опрашивал в 3,6 раза дольше (наш расчёт: 11,2 разделить на 3,1). Авторы пишут, что вклад длительности и стратегии вопросов нельзя разделить: часть преимущества могла дать просто время.
  • Шкала. MedHistory разработана этой же командой для данного исследования, и 92 балла из 100 приходится на раздел «опрос»: полноту и клиническую логику. По нашему прочтению, исчерпывающий опрос по дереву вопросов набирает баллы почти по построению шкалы; о том, как это сказывается на исходах пациентов, исследование не говорит.
  • Сравнение. Группа сравнения — ординаторы без шаблона, у которых было в среднем три минуты. Самой по себе анкеты или опросника, о которых авторы пишут как об уже существующем средстве, среди групп нет.
  • Слепота. Открытое исследование: участники знали о группе. Оценщики были слепыми, но авторы признают риск смещения и «эффект новизны».
  • Одна клиника. Офтальмология, китайский язык, неотложные случаи исключены. Авторы называют офтальмологию удобным полем: симптомы хорошо определены.
  • Терминология. Авторы признают, что терминология у агента была менее точной. Из-за распознавания речи в расшифровках диалогов было 3,7 артефакта на 100 знаков, а в итоговых картах после обработки модулем документирования — 0,5 (проверка 50 случайных диалогов).
  • Эталон. Эталоном для диагноза служило первичное обследование, а не окончательное подтверждение диагноза.

Что это значит для клиники

Ближайший вывод скромнее, чем «ИИ заменит врача на опросе». Исследование показывает, что хорошо построенный ИИ-ассистент способен собрать более полный анамнез, чем быстрый живой опрос, и что при этом не сильно страдает отношение пациентов. Но платой стало время пациента (11 минут на телефоне), а тревогу лучше снимал живой собеседник — для стоматологии с её тревожными пациентами это не мелочь.

Что в стоматологии не проверялось. РКИ с ИИ-агентом, который собирает анамнез у реальных пациентов стоматологической клиники, мы не нашли (поиск в Europe PMC за 2024–2026 годы, 6 октября 2026 года). Все деревья вопросов в этой работе построены для глазных жалоб. В стоматологии на первом месте другие данные: аллергии и непереносимость анестетиков, антикоагулянты и антиагреганты, бисфосфонаты и деносумаб перед хирургией, беременность, сахарный диабет. Об этом исследовании ничего не говорит.

Персональные данные. Анамнез — сведения о состоянии здоровья, то есть специальная категория персональных данных. По части 2 статьи 10 закона № 152-ФЗ их обработка допускается, в частности, с письменного согласия субъекта (пункт 1) либо в медико-профилактических целях и для установления диагноза, если её осуществляет лицо, профессионально занимающееся медицинской деятельностью и обязанное хранить врачебную тайну (пункт 4). Если анамнез у пациента спрашивает программа стороннего поставщика, надо отдельно выяснять, где обрабатываются данные и кто за них отвечает: это вопрос к юристу клиники. В исследовании модель работала локально, а пациентов предупреждали, что общаются с ИИ.

На что смотреть при выборе такого помощника. Это наши практические выводы из работы, не рекомендации авторов:

  1. Кто утверждает запись в карте: в исследовании каждую карту проверял врач.
  2. Что происходит при срочном случае: у агента из исследования был автоматический выход на направление.
  3. Где работает модель и куда уходят ответы пациента.
  4. Как измерено качество: полнота опроса или исходы для пациента. В статье измерена полнота.

О том, как автоматизация записи и напоминаний работает в стоматологических клиниках, мы писали в статье о чат-ботах и ИИ в стоматологии; о том, какие сведения обязательны в медицинской карте, — в разборе карты стоматологического пациента.

Частые вопросы

Заменит ли ИИ-агент врача при сборе анамнеза?
Исследование этого не показывает. Авторы сами описывают гибридную схему: агент собирает данные, а врач осматривает пациента, ставит диагноз и принимает решение. Каждую карту агента утверждал клиницист.

Почему ИИ набрал больше баллов?
Отчасти потому, что опрашивал дольше (11,2 против 3,1 минуты) и шёл по полному дереву вопросов, а шкала оценивает полноту опроса. Авторы признают, что вклад времени и стратегии разделить нельзя.

Это можно применять в стоматологии?
Прямых данных нет. Работа проведена в офтальмологической клинике, и вопросы агента составлены для глазных жалоб. Принцип можно обсуждать, но проверять его на стоматологическом приёме пока никто не проверял.

Безопасно ли это для пациентов?
В испытании нежелательных явлений не было, но выборка небольшая (172 человека), без неотложных случаев, и каждая карта проходила проверку врача.

Какую модель использовали?
Открытую модель Qwen-2.5 на 72 миллиарда параметров, дообученную на офтальмологических записях и развёрнутую локально. Код ядра системы авторы выложили на Zenodo.