Если вы работаете с AI хотя бы пару месяцев, то уже проходили этот цикл: начали с ChatGPT (потому что все с него начинают), потом коллега сказал «попробуй Claude, он для аналитики лучше» — попробовали, впечатлились. Затем вышла новая Gemini с огромным контекстом, и вы подумали: «а может, на неё переехать?» Через неделю у вас три вкладки, три подписки и ощущение, что вы жонглируете инструментами, а не работаете.
Проблема не в том, что моделей много. Проблема в том, что ни одна не побеждает везде. И вместо абстрактного «какая лучше» гораздо полезнее понять: какая модель на какой задаче выигрывает. В этой статье — результаты тестов на шести типовых задачах системного аналитика. Без синтетических бенчмарков, только реальные промпты и сравнение выдач.
Почему нельзя обойтись одной моделью
Идея «плачу за одну подписку и закрываю всё» выглядит разумно. Пока вы не упрётесь в сценарий, где ваша модель откровенно слаба. У каждой из большой тройки (Claude от Anthropic, ChatGPT от OpenAI, Gemini от Google) есть архитектурные особенности, которые не лечатся промптом:
- Claude обучали с фокусом на аналитическое мышление и safety — он хорош там, где нужно рассуждать, сравнивать и находить противоречия. Но галлюцинирует на цифрах и коде.
- ChatGPT — универсал. Лучше всех работает со структурированными форматами (JSON, таблицы) и кодом. Но на сложном ревью требований может «соглашаться» с любым аргументом.
- Gemini — мультимодальный и с гигантским контекстным окном (до 2M токенов). Идеален, когда нужно проанализировать всю кодовую базу разом. Но уступает в структурной чёткости.
Засада в том, что рабочий день аналитика — это все шесть задач подряд. Утром вы пишете требования, днём ревьюите чужое ТЗ, вечером лезете в SQL. Если на каждой задаче использовать не ту модель — теряете часы на переделку выдачи.
Как мы сравнивали
Методология простая: один и тот же промпт подаётся в три модели, ответы сравниваются по четырём критериям:
| Критерий | Что оцениваем |
|---|---|
| Полнота | Все ли аспекты задачи покрыты? Есть ли пропуски? |
| Структура | Насколько ответ логично организован? Можно ли его сразу использовать в работе? |
| Точность | Есть ли фактические ошибки, галлюцинации, несуществующие методы? |
| Применимость | Сколько нужно допиливать ответ руками перед использованием? |
Каждый критерий — оценка от 1 до 5. Итоговая — среднее арифметическое. Общий промпт для всех тестов строился по принципам из статьи про промпт-инжиниринг для системного аналитика: роль, контекст, формат выдачи и ограничения.
Важно: модели тестировались в мае-июле 2026 года. Версии: Claude Sonnet 4, ChatGPT 4o, Gemini 2.5 Pro. Через полгода цифры устареют — но соотношение сильных сторон, скорее всего, сохранится: архитектурные решения меняются медленнее, чем бенчмарки.
Задача 1. Генерация User Story и требований
Промпт: «На основе описания фичи “Добавить систему промокодов в интернет-магазин” сгенерируй функциональные требования и User Story. Требования должны покрывать: применение промокода к корзине, валидацию (срок действия, минимальная сумма), конфликт со скидками, отмену промокода, отображение скидки в корзине. Для каждого ФТ — User Story по шаблону “Как <роль> я хочу <действие> чтобы <ценность>” и критерии приёмки в Gherkin. Не выдумывай требования, не указанные явно или не вытекающие из логики системы.»
Результаты
Claude Sonnet 4 — 4.5/5. Сгенерировал 8 требований, каждое — с чёткой ценностью. Ни одного домысленного. Критерии приёмки тестируемы. Бонус: сам обнаружил потенциальный конфликт между «промокод + товар со скидкой» и предложил два варианта разрешения.
ChatGPT 4o — 4.0/5. 9 требований, но одно лишнее — «скидка должна отображаться в push-уведомлении» (этого в промпте не было). User Story написаны чуть суше, ценность местами формальная. Критерии приёмки корректны.
Gemini 2.5 Pro — 3.5/5. 6 требований — пропустил «отмену промокода» и «конфликт со скидками». Пришлось задавать уточняющие вопросы, чтобы добрать. User Story — хорошо, но без Gherkin (игнорировал часть промпта).
Вердикт: Claude выигрывает на генерации требований. Он реже галлюцинирует (да, ChatGPT тоже этим грешит — придумал push-уведомления) и лучше держит структуру. ChatGPT — достойная альтернатива, если вы готовы вычитать выдачу на предмет домыслов. Gemini для этой задачи неоптимален.
Задача 2. Ревью ТЗ и поиск противоречий
Промпт: «Проверь список требований ниже на противоречия, дубликаты и пробелы. Для каждого конфликта укажи: тип (противоречие/дубликат/пробел), ID затронутых требований, суть проблемы и варианты разрешения. Проверь также: все ли роли упомянуты, все ли интеграции покрыты, нет ли требований без предусловий. [14 требований из реального ТЗ на личный кабинет]»
Результаты
Claude Sonnet 4 — 4.8/5. Нашёл 4 конфликта, включая один неочевидный (FR-007 и FR-012 противоречили друг другу в трактовке «просроченного токена»). Два из четырёх команда действительно пропустила. Варианты разрешения осмысленные, а не формальные «либо так, либо эдак».
ChatGPT 4o — 3.5/5. Нашёл 3 конфликта, но один — ложноположительный (неверно прочитал требование). По двум реальным дал размытые рекомендации: «обсудить с командой» — ну спасибо, мы как раз этим и занимаемся.
Gemini 2.5 Pro — 3.0/5. Нашёл 2 конфликта, оба реальные. Но упустил пробел с ролью «администратор» — требований для неё не было вообще, а в ТЗ она упоминалась. Потеря существенная.
Вердикт: Claude — безоговорочный лидер. На ревью требований его способность к structured reasoning даёт ощутимый перевес. Если вы регулярно ревьюите крупные ТЗ — Claude окупается на первом же найденном противоречии, которое иначе всплыло бы на этапе разработки.
Задача 3. Построение диаграмм (Mermaid, C4, UML)
Промпт: «Сгенерируй Mermaid-диаграмму последовательности для сценария “Оформление заказа с промокодом” в интернет-магазине. Участники: Пользователь, Фронтенд, API Gateway, Сервис заказов, Сервис промокодов, Платёжный шлюз. Сценарий: пользователь применяет промокод, система валидирует, пересчитывает корзину, пользователь оплачивает, система создаёт заказ. Обработай альтернативный поток: промокод недействителен. Используй sequenceDiagram, подписи на русском.»
Результаты
Claude Sonnet 4 — 4.5/5. Диаграмма корректна синтаксически, альтернативный поток через alt/else, все 6 участников на месте. Подписи на русском, логика ветвления верная.
ChatGPT 4o — 4.0/5. Тоже корректная диаграмма, но альтернативный поток реализован через opt вместо alt/else — технически работает, но семантически opt для необязательного блока, а не для ветвления. Мелочь, но в большом проекте такие мелочи накапливаются.
Gemini 2.5 Pro — 4.2/5. Неожиданно хорош. Синтаксис верный, alt/else на месте, подписи русские. Но добавил лишнего участника «Сервис уведомлений» — галлюцинация.
Вердикт: Все три модели справляются с Mermaid на приемлемом уровне. Разница — в аккуратности: Claude не придумывает лишнего, ChatGPT допускает мелкие семантические неточности, Gemini иногда креативит. Для боевых диаграмм выбирайте Claude, для черновиков — подойдёт любая.
Задача 4. SQL-запросы и проектирование схем
Промпт: «Спроектируй схему БД для системы промокодов интернет-магазина. Нужны таблицы: промокоды, использованные промокоды, категории товаров (для привязки промокода к категории). Напиши CREATE TABLE на PostgreSQL с индексами, внешними ключами и комментариями. Затем напиши SELECT, который находит все активные промокоды, применимые к корзине пользователя на сумму 5000₽ (учитывая мин. сумму заказа, срок действия и лимит использований).»
Результаты
Claude Sonnet 4 — 3.5/5. Схема хорошая, но в SELECT допустил ошибку в JOIN — потерял условие на исключение уже использованных промокодов конкретным пользователем (хотя в схеме таблица used_promocodes была создана). То есть сам же схему сделал, сам же про неё забыл. Типичная история.
ChatGPT 4o — 4.5/5. Схема и запрос — без ошибок. Индексы расставлены осмысленно (по code, по valid_until, составной по user_id + promocode_id). Комментарии на русском. Запрос читаемый, с CTE для промежуточной фильтрации.
Gemini 2.5 Pro — 3.0/5. Схема — ок. Запрос рабочий, но без CTE, длинная портянка из вложенных подзапросов. Читать больно. Индексы предложил, но один — избыточный (по полю, которое и так в PRIMARY KEY).
Вердикт: ChatGPT выигрывает на SQL и работе с базами данных. Это исторически сильная сторона модели: OpenAI вкладывалась в code generation, и на выходе — чистый, работающий код. Claude пишет хорошую схему, но в запросах ошибается чаще. Gemini пишет рабочий, но нечитаемый SQL — для аналитика, который будет поддерживать эти запросы, вариант так себе.
Задача 5. Пользовательская документация
Промпт: «На основе спецификации ниже напиши руководство пользователя для личного кабинета интернет-магазина. Целевая аудитория — нетехнические пользователи. Документ должен содержать: обзор возможностей, пошаговые инструкции для основных сценариев (регистрация, оформление заказа, отслеживание, возврат), частые вопросы. Стиль — дружелюбный, без технического жаргона. [спецификация на 3 страницы]»
Результаты
Claude Sonnet 4 — 4.0/5. Документация читается легко, без канцелярита. Пошаговые инструкции — с конкретными действиями, не «перейдите в раздел», а «нажмите “Мои заказы” в левом меню». FAQ — 7 вопросов, все по делу. Минус: местами слишком многословен, руководство вышло на 40% длиннее, чем у конкурентов.
ChatGPT 4o — 4.5/5. Идеальный баланс: достаточно подробно, но не растекается. Инструкции пронумерованы, каждый шаг — одно действие. FAQ — 6 вопросов, покрывают 90% реальных обращений в поддержку. Стиль — ровно то, что нужно нетехническому пользователю.
Gemini 2.5 Pro — 3.5/5. Документация ok, но стиль неровный: часть инструкций написана разговорно, часть — сухо. FAQ — 4 вопроса, два из которых тривиальны («как зайти в личный кабинет?» — ну, наверное, ввести логин и пароль).
Вердикт: ChatGPT — лучший для пользовательской документации. Держит ровный стиль, не перегружает, не упрощает сверх меры. Claude хорош, но многословен. Gemini — на троечку.
Задача 6. Анализ legacy-кода и длинный контекст
Промпт: «[Фрагмент из 4 файлов монолитного Java-приложения, ~18 000 строк, отвечающих за обработку заказов.] Проанализируй код и ответь: какие бизнес-правила зашиты в обработке заказов? Есть ли скрытые зависимости между модулями OrderService и PaymentService? Где происходит валидация статусов заказа? Если бы мы хотели выделить модуль “Заказы” в отдельный микросервис, какие точки интеграции нужно сохранить?»
Результаты
Claude Sonnet 4 — 3.5/5. Контекстное окно — 200K токенов. В 18 000 строк кода влезло, но анализ поверхностный: нашёл 4 бизнес-правила из 7. Скрытые зависимости — одну из трёх. План миграции в микросервис — общие слова.
ChatGPT 4o — 3.0/5. Контекстное окно — 128K токенов. Всё не влезло, пришлось резать код на части. Анализ по частям, результат фрагментированный. 3 бизнес-правила из 7, зависимости не увидел.
Gemini 2.5 Pro — 4.5/5. Контекстное окно — до 2M токенов. Весь код влез с огромным запасом. Нашёл 6 из 7 бизнес-правил, включая одно неявное (скидка постоянного покупателя применяется ДО промокода — в коде это было разнесено по трём файлам). Все 3 скрытые зависимости обнаружены. План миграции — с указанием конкретных классов и методов.
Вердикт: Gemini — единственный выбор для анализа больших объёмов кода. 2M токенов контекста — это не маркетинг, это реальное преимущество, когда нужно увидеть картину целиком. Claude и ChatGPT вынуждены работать с фрагментами и теряют связи между ними.
Сводная таблица: какая модель для какой задачи
| Задача | Claude Sonnet 4 | ChatGPT 4o | Gemini 2.5 Pro | Лучший выбор |
|---|---|---|---|---|
| Генерация требований и User Story | 4.5 | 4.0 | 3.5 | Claude |
| Ревью ТЗ: поиск противоречий | 4.8 | 3.5 | 3.0 | Claude |
| Построение Mermaid/C4-диаграмм | 4.5 | 4.0 | 4.2 | Claude |
| SQL-запросы и схемы БД | 3.5 | 4.5 | 3.0 | ChatGPT |
| Пользовательская документация | 4.0 | 4.5 | 3.5 | ChatGPT |
| Анализ legacy-кода (длинный контекст) | 3.5 | 3.0 | 4.5 | Gemini |
Картина ясная: Claude — для требований и аналитики, ChatGPT — для SQL и документации, Gemini — для длинного контекста.
Дерево решений: какую модель выбрать под задачу
Диаграмма показывает логику выбора: стартовая точка (фиолетовый) — вы определяете, какая задача перед вами. Ромб (жёлтый) — развилка на шесть типов аналитических задач (синие блоки). Из каждой задачи стрелки ведут к одной или двум рекомендованным моделям (зелёные блоки). Обратите внимание: для генерации требований подходят и Claude, и ChatGPT (хотя Claude лидирует), а для диаграмм — Claude и Gemini. Для SQL и документации альтернатив у ChatGPT нет — на этих задачах он единоличный лидер.
Комбо-подход: когда одной модели мало
Если у вас больше одной подписки — вы неизбежно упрётесь в неудобство переключения между интерфейсами. Решение — API-слой, который маршрутизирует запрос к нужной модели автоматически.
Здесь на сцену выходит LiteLLM — единый API-слой для Claude, ChatGPT и других моделей. Идея простая: вы отправляете запрос в один endpoint, а LiteLLM сам решает, какую модель вызвать, исходя из задачи. Или вы явно указываете модель в запросе, но работаете через единый интерфейс.
На практике это выглядит так:
- Утро: генерируем требования — вызов Claude через LiteLLM.
- День: пишем SQL — вызов ChatGPT через тот же endpoint.
- Вечер: анализируем legacy-код — вызов Gemini.
Никаких переключений вкладок, копипасты промптов между интерфейсами и путаницы с API-ключами. Один слой — одна точка входа.
Разумеется, это не серебряная пуля. За удобство вы платите накладными расходами на прокси и необходимостью его настроить. Но если AI-модели — ваш ежедневный инструмент, а не игрушка на выходные, игра стоит свеч.
Заключение
AI-модели 2026 года — это не «одна, но лучшая». Это набор инструментов с выраженной специализацией. Попытка закрыть все задачи одной моделью ведёт к компромиссам, которые съедают время: вы либо переделываете кривую выдачу, либо допрашиваете модель уточняющими промптами.
Правило трёх пальцев:
- Требования, ревью, диаграммы — Claude.
- SQL, схемы БД, документация — ChatGPT.
- Анализ больших объёмов, legacy-код — Gemini.
Если бюджет позволяет только одну подписку — берите Claude. Он лучший в самой частотной работе аналитика (требования и ревью), а для SQL и документации его выдача приемлема с доработкой. Если бюджет позволяет две — Claude + ChatGPT закроют 90% задач. Gemini — третий в очереди, но для проектов с разбором legacy-систем он не опция, а необходимость.
P.S. Все тесты выше — на задачах системного аналитика. Если вы разработчик и 80% вашего времени — код, картина сместится в сторону ChatGPT и Claude (в таком порядке). Но это уже тема для отдельной статьи.