Google DeepMind превратила свою систему Co-Scientist из генератора гипотез в полноценного лабораторного партнёра — теперь она планирует эксперименты, пишет код, управляет оборудованием и генерирует научные статьи. Три дисциплины, три разных сценария — и впервые результат, который прошёл проверку экспертами.
Суть события
Co-Scientist, представленный Google в феврале 2025 года, больше не ограничивается генерацией идей. Система на базе Gemini получила замкнутый цикл исследования: от постановки вопроса — через планирование эксперимента, написание кода, управление оборудованием и анализ результатов — до генерации научных рукописей. Три валидационных эксперимента показали: это работает не только в демо, но и в реальных лабораториях.
В материаловедении Co-Scientist разработал рецептуру синтеза перспективного 2D-материала — более безопасным путём, чем традиционные методы травления. В биологии система построила pipeline для анализа изображений колоний кишечной палочки, предсказав закономерности роста с точностью 3 из 4 признаков. В компьютерных науках она спроектировала архитектуру Agent_H, которая обогнала GPT-5 и Claude Opus 5 на бенчмарках — но при оценке врачами преимущество оказалось заметно скромнее.
Детали
В материалах Co-Scientist был сопряжён с полуавтоматической высокотемпературной печью. За 25 итераций с доработкой человеком удалось получить слоистые структуры, похожие на целевой материал. Три полупроводниковые тонкие плёнки были синтезированы с первой попытки — рецептура, которая раньше занимала дни, была готова за минуты. Правда, кристаллы получились меньше и менее однородные, чем при тщательной оптимизации вручную.
В биологическом эксперименте система использовала Gemini 3 Pro Image для предсказания формы колоний E. coli при разных концентрациях химических веществ. Совпадение с неопубликованными лабораторными данными — 75%. Исследователи оговаривают: система рассуждает только в пределах известных условий и не умеет предсказывать поведение в новых системах.
Компьютерный эксперимент стал самым автономным. Co-Scientist спроектировал Agent_H — медицинскую архитектуру, которая классифицирует входящие запросы, генерирует десятки кандидатов ответа параллельно и выбирает лучший. На автоматизированных бенчмарках по здоровью Agent_H обошёл шесть передовых моделей. Но трое сертифицированных врачей в слепом тесте нашли значимое преимущество только в одном из девяти критериев — снижение риска потенциально вредных ответов.
Ключевая проблема любого автономного исследовательского ИИ — искушение придумать результат. В системе есть модуль верификации, который сверяет числовые утверждения в тексте с логами выполненного кода. Без модулей достоверности Co-Scientist придумывал ключевые результаты в 4% случаев; без них — в 46%. Полностью сфабрикованные данные не появлялись вовсе (против 44% у сравнительной системы), а контент, близкий к плагиату, снизился с 60% до 16%.
Контекст
Идея ИИ-исследователя, который закрывает цикл от гипотезы до статьи, — одна из самых горячих в отрасли. OpenAI обещает к осени систему уровня «стажёр». Инвесторы вкладывают миллиарды. Но критики указывают: дальше того, что уже есть в тренировочных данных, современные большие языковые модели (LLM) вряд ли способны продвинуться — они хорошие калькуляторы, но не творческие мыслители, как отмечают математики.
Важнее другое. Автоматизированные оценщики и экспертные оценки врачей коррелировали между собой слабо. Высокие баллы на бенчмарке не гарантируют, что система реально помогает — только что она хорошо проходит тест. Для медицины это принципиальное ограничение.
Сам Шмидгалл, первый автор исследования, пишет осторожно: «Предстоит долгий путь, прежде чем ИИ-системы смогут справляться с физическими реалиями науки. Но мы глубоко воодушевлены потенциалом LLM помочь людям и ускорить реальный прогресс».
Что дальше
Перенос рецептур в другие лаборатории остаётся открытым вопросом — пока всё проверялось в одной. Модуль верификации сократил fabrication с 90% до 4%, но 4% — это всё ещё одна из двадцати работ с придуманным ключевым результатом. И система склонна писать в статье «высоко правдоподобные методы, которые не соответствуют реальному коду» — тонкая, но важная разница.
Для AI Digest это хороший кандидат на отслеживание: технология ещё не созрела для замены научного процесса, но как инструмент ускорения — уже проходит проверку. Особенно в материалах и полупроводниках, где цикл «гипотеза — эксперимент — статья» короче и верифицируемее, чем в биологии или медицине.