Logo
Overview

Сравнение AI-моделей для системного аналитика: Claude, ChatGPT, Gemini — что выбрать под задачу

August 7, 2026
11 min read

Если вы работаете с AI хотя бы пару месяцев, то уже проходили этот цикл: начали с ChatGPT (потому что все с него начинают), потом коллега сказал «попробуй Claude, он для аналитики лучше» — попробовали, впечатлились. Затем вышла новая Gemini с огромным контекстом, и вы подумали: «а может, на неё переехать?» Через неделю у вас три вкладки, три подписки и ощущение, что вы жонглируете инструментами, а не работаете.

Проблема не в том, что моделей много. Проблема в том, что ни одна не побеждает везде. И вместо абстрактного «какая лучше» гораздо полезнее понять: какая модель на какой задаче выигрывает. В этой статье — результаты тестов на шести типовых задачах системного аналитика. Без синтетических бенчмарков, только реальные промпты и сравнение выдач.

Почему нельзя обойтись одной моделью

Идея «плачу за одну подписку и закрываю всё» выглядит разумно. Пока вы не упрётесь в сценарий, где ваша модель откровенно слаба. У каждой из большой тройки (Claude от Anthropic, ChatGPT от OpenAI, Gemini от Google) есть архитектурные особенности, которые не лечатся промптом:

  • Claude обучали с фокусом на аналитическое мышление и safety — он хорош там, где нужно рассуждать, сравнивать и находить противоречия. Но галлюцинирует на цифрах и коде.
  • ChatGPT — универсал. Лучше всех работает со структурированными форматами (JSON, таблицы) и кодом. Но на сложном ревью требований может «соглашаться» с любым аргументом.
  • Gemini — мультимодальный и с гигантским контекстным окном (до 2M токенов). Идеален, когда нужно проанализировать всю кодовую базу разом. Но уступает в структурной чёткости.

Засада в том, что рабочий день аналитика — это все шесть задач подряд. Утром вы пишете требования, днём ревьюите чужое ТЗ, вечером лезете в SQL. Если на каждой задаче использовать не ту модель — теряете часы на переделку выдачи.

Как мы сравнивали

Методология простая: один и тот же промпт подаётся в три модели, ответы сравниваются по четырём критериям:

КритерийЧто оцениваем
ПолнотаВсе ли аспекты задачи покрыты? Есть ли пропуски?
СтруктураНасколько ответ логично организован? Можно ли его сразу использовать в работе?
ТочностьЕсть ли фактические ошибки, галлюцинации, несуществующие методы?
ПрименимостьСколько нужно допиливать ответ руками перед использованием?

Каждый критерий — оценка от 1 до 5. Итоговая — среднее арифметическое. Общий промпт для всех тестов строился по принципам из статьи про промпт-инжиниринг для системного аналитика: роль, контекст, формат выдачи и ограничения.

Важно: модели тестировались в мае-июле 2026 года. Версии: Claude Sonnet 4, ChatGPT 4o, Gemini 2.5 Pro. Через полгода цифры устареют — но соотношение сильных сторон, скорее всего, сохранится: архитектурные решения меняются медленнее, чем бенчмарки.

Задача 1. Генерация User Story и требований

Промпт: «На основе описания фичи “Добавить систему промокодов в интернет-магазин” сгенерируй функциональные требования и User Story. Требования должны покрывать: применение промокода к корзине, валидацию (срок действия, минимальная сумма), конфликт со скидками, отмену промокода, отображение скидки в корзине. Для каждого ФТ — User Story по шаблону “Как <роль> я хочу <действие> чтобы <ценность>” и критерии приёмки в Gherkin. Не выдумывай требования, не указанные явно или не вытекающие из логики системы.»

Результаты

Claude Sonnet 4 — 4.5/5. Сгенерировал 8 требований, каждое — с чёткой ценностью. Ни одного домысленного. Критерии приёмки тестируемы. Бонус: сам обнаружил потенциальный конфликт между «промокод + товар со скидкой» и предложил два варианта разрешения.

ChatGPT 4o — 4.0/5. 9 требований, но одно лишнее — «скидка должна отображаться в push-уведомлении» (этого в промпте не было). User Story написаны чуть суше, ценность местами формальная. Критерии приёмки корректны.

Gemini 2.5 Pro — 3.5/5. 6 требований — пропустил «отмену промокода» и «конфликт со скидками». Пришлось задавать уточняющие вопросы, чтобы добрать. User Story — хорошо, но без Gherkin (игнорировал часть промпта).

Вердикт: Claude выигрывает на генерации требований. Он реже галлюцинирует (да, ChatGPT тоже этим грешит — придумал push-уведомления) и лучше держит структуру. ChatGPT — достойная альтернатива, если вы готовы вычитать выдачу на предмет домыслов. Gemini для этой задачи неоптимален.

Задача 2. Ревью ТЗ и поиск противоречий

Промпт: «Проверь список требований ниже на противоречия, дубликаты и пробелы. Для каждого конфликта укажи: тип (противоречие/дубликат/пробел), ID затронутых требований, суть проблемы и варианты разрешения. Проверь также: все ли роли упомянуты, все ли интеграции покрыты, нет ли требований без предусловий. [14 требований из реального ТЗ на личный кабинет]»

Результаты

Claude Sonnet 4 — 4.8/5. Нашёл 4 конфликта, включая один неочевидный (FR-007 и FR-012 противоречили друг другу в трактовке «просроченного токена»). Два из четырёх команда действительно пропустила. Варианты разрешения осмысленные, а не формальные «либо так, либо эдак».

ChatGPT 4o — 3.5/5. Нашёл 3 конфликта, но один — ложноположительный (неверно прочитал требование). По двум реальным дал размытые рекомендации: «обсудить с командой» — ну спасибо, мы как раз этим и занимаемся.

Gemini 2.5 Pro — 3.0/5. Нашёл 2 конфликта, оба реальные. Но упустил пробел с ролью «администратор» — требований для неё не было вообще, а в ТЗ она упоминалась. Потеря существенная.

Вердикт: Claude — безоговорочный лидер. На ревью требований его способность к structured reasoning даёт ощутимый перевес. Если вы регулярно ревьюите крупные ТЗ — Claude окупается на первом же найденном противоречии, которое иначе всплыло бы на этапе разработки.

Задача 3. Построение диаграмм (Mermaid, C4, UML)

Промпт: «Сгенерируй Mermaid-диаграмму последовательности для сценария “Оформление заказа с промокодом” в интернет-магазине. Участники: Пользователь, Фронтенд, API Gateway, Сервис заказов, Сервис промокодов, Платёжный шлюз. Сценарий: пользователь применяет промокод, система валидирует, пересчитывает корзину, пользователь оплачивает, система создаёт заказ. Обработай альтернативный поток: промокод недействителен. Используй sequenceDiagram, подписи на русском.»

Результаты

Claude Sonnet 4 — 4.5/5. Диаграмма корректна синтаксически, альтернативный поток через alt/else, все 6 участников на месте. Подписи на русском, логика ветвления верная.

ChatGPT 4o — 4.0/5. Тоже корректная диаграмма, но альтернативный поток реализован через opt вместо alt/else — технически работает, но семантически opt для необязательного блока, а не для ветвления. Мелочь, но в большом проекте такие мелочи накапливаются.

Gemini 2.5 Pro — 4.2/5. Неожиданно хорош. Синтаксис верный, alt/else на месте, подписи русские. Но добавил лишнего участника «Сервис уведомлений» — галлюцинация.

Вердикт: Все три модели справляются с Mermaid на приемлемом уровне. Разница — в аккуратности: Claude не придумывает лишнего, ChatGPT допускает мелкие семантические неточности, Gemini иногда креативит. Для боевых диаграмм выбирайте Claude, для черновиков — подойдёт любая.

Задача 4. SQL-запросы и проектирование схем

Промпт: «Спроектируй схему БД для системы промокодов интернет-магазина. Нужны таблицы: промокоды, использованные промокоды, категории товаров (для привязки промокода к категории). Напиши CREATE TABLE на PostgreSQL с индексами, внешними ключами и комментариями. Затем напиши SELECT, который находит все активные промокоды, применимые к корзине пользователя на сумму 5000₽ (учитывая мин. сумму заказа, срок действия и лимит использований).»

Результаты

Claude Sonnet 4 — 3.5/5. Схема хорошая, но в SELECT допустил ошибку в JOIN — потерял условие на исключение уже использованных промокодов конкретным пользователем (хотя в схеме таблица used_promocodes была создана). То есть сам же схему сделал, сам же про неё забыл. Типичная история.

ChatGPT 4o — 4.5/5. Схема и запрос — без ошибок. Индексы расставлены осмысленно (по code, по valid_until, составной по user_id + promocode_id). Комментарии на русском. Запрос читаемый, с CTE для промежуточной фильтрации.

Gemini 2.5 Pro — 3.0/5. Схема — ок. Запрос рабочий, но без CTE, длинная портянка из вложенных подзапросов. Читать больно. Индексы предложил, но один — избыточный (по полю, которое и так в PRIMARY KEY).

Вердикт: ChatGPT выигрывает на SQL и работе с базами данных. Это исторически сильная сторона модели: OpenAI вкладывалась в code generation, и на выходе — чистый, работающий код. Claude пишет хорошую схему, но в запросах ошибается чаще. Gemini пишет рабочий, но нечитаемый SQL — для аналитика, который будет поддерживать эти запросы, вариант так себе.

Задача 5. Пользовательская документация

Промпт: «На основе спецификации ниже напиши руководство пользователя для личного кабинета интернет-магазина. Целевая аудитория — нетехнические пользователи. Документ должен содержать: обзор возможностей, пошаговые инструкции для основных сценариев (регистрация, оформление заказа, отслеживание, возврат), частые вопросы. Стиль — дружелюбный, без технического жаргона. [спецификация на 3 страницы]»

Результаты

Claude Sonnet 4 — 4.0/5. Документация читается легко, без канцелярита. Пошаговые инструкции — с конкретными действиями, не «перейдите в раздел», а «нажмите “Мои заказы” в левом меню». FAQ — 7 вопросов, все по делу. Минус: местами слишком многословен, руководство вышло на 40% длиннее, чем у конкурентов.

ChatGPT 4o — 4.5/5. Идеальный баланс: достаточно подробно, но не растекается. Инструкции пронумерованы, каждый шаг — одно действие. FAQ — 6 вопросов, покрывают 90% реальных обращений в поддержку. Стиль — ровно то, что нужно нетехническому пользователю.

Gemini 2.5 Pro — 3.5/5. Документация ok, но стиль неровный: часть инструкций написана разговорно, часть — сухо. FAQ — 4 вопроса, два из которых тривиальны («как зайти в личный кабинет?» — ну, наверное, ввести логин и пароль).

Вердикт: ChatGPT — лучший для пользовательской документации. Держит ровный стиль, не перегружает, не упрощает сверх меры. Claude хорош, но многословен. Gemini — на троечку.

Задача 6. Анализ legacy-кода и длинный контекст

Промпт: «[Фрагмент из 4 файлов монолитного Java-приложения, ~18 000 строк, отвечающих за обработку заказов.] Проанализируй код и ответь: какие бизнес-правила зашиты в обработке заказов? Есть ли скрытые зависимости между модулями OrderService и PaymentService? Где происходит валидация статусов заказа? Если бы мы хотели выделить модуль “Заказы” в отдельный микросервис, какие точки интеграции нужно сохранить?»

Результаты

Claude Sonnet 4 — 3.5/5. Контекстное окно — 200K токенов. В 18 000 строк кода влезло, но анализ поверхностный: нашёл 4 бизнес-правила из 7. Скрытые зависимости — одну из трёх. План миграции в микросервис — общие слова.

ChatGPT 4o — 3.0/5. Контекстное окно — 128K токенов. Всё не влезло, пришлось резать код на части. Анализ по частям, результат фрагментированный. 3 бизнес-правила из 7, зависимости не увидел.

Gemini 2.5 Pro — 4.5/5. Контекстное окно — до 2M токенов. Весь код влез с огромным запасом. Нашёл 6 из 7 бизнес-правил, включая одно неявное (скидка постоянного покупателя применяется ДО промокода — в коде это было разнесено по трём файлам). Все 3 скрытые зависимости обнаружены. План миграции — с указанием конкретных классов и методов.

Вердикт: Gemini — единственный выбор для анализа больших объёмов кода. 2M токенов контекста — это не маркетинг, это реальное преимущество, когда нужно увидеть картину целиком. Claude и ChatGPT вынуждены работать с фрагментами и теряют связи между ними.

Сводная таблица: какая модель для какой задачи

ЗадачаClaude Sonnet 4ChatGPT 4oGemini 2.5 ProЛучший выбор
Генерация требований и User Story4.54.03.5Claude
Ревью ТЗ: поиск противоречий4.83.53.0Claude
Построение Mermaid/C4-диаграмм4.54.04.2Claude
SQL-запросы и схемы БД3.54.53.0ChatGPT
Пользовательская документация4.04.53.5ChatGPT
Анализ legacy-кода (длинный контекст)3.53.04.5Gemini

Картина ясная: Claude — для требований и аналитики, ChatGPT — для SQL и документации, Gemini — для длинного контекста.

Дерево решений: какую модель выбрать под задачу

100%
graph TD
  START["Выбор AI-модели<br/>для задачи аналитика"]
  TASK{"Какая задача?"}
  REQ["Генерация требований<br/>и User Story"]
  REVIEW["Ревью ТЗ: поиск<br/>противоречий и пробелов"]
  DIAGRAM["Построение диаграмм<br/>Mermaid, C4, UML"]
  SQL["SQL-запросы и<br/>проектирование схем БД"]
  DOCS["Пользовательская<br/>документация"]
  LEGACY["Анализ legacy-кода<br/>и документации"]
  CLAUDE["Claude Sonnet 4<br/>N1 для аналитики"]
  CHATGPT["ChatGPT 4o<br/>N1 для SQL и docs"]
  GEMINI["Gemini 2.5 Pro<br/>N1 для длинного контекста"]
  START --> TASK
  TASK -->|"требования"| REQ
  TASK -->|"ревью"| REVIEW
  TASK -->|"диаграммы"| DIAGRAM
  TASK -->|"SQL"| SQL
  TASK -->|"документация"| DOCS
  TASK -->|"legacy"| LEGACY
  REQ --> CLAUDE
  REQ --> CHATGPT
  REVIEW --> CLAUDE
  DIAGRAM --> CLAUDE
  DIAGRAM --> GEMINI
  SQL --> CHATGPT
  DOCS --> CHATGPT
  LEGACY --> GEMINI
  style START fill:#7b68ee,stroke:#5a4db2,color:#fff
  style TASK fill:#f0a500,stroke:#c88400,color:#fff
  style REQ fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style REVIEW fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style DIAGRAM fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style SQL fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style DOCS fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style LEGACY fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style CLAUDE fill:#50c878,stroke:#3a9a5c,color:#fff
  style CHATGPT fill:#50c878,stroke:#3a9a5c,color:#fff
  style GEMINI fill:#50c878,stroke:#3a9a5c,color:#fff

Диаграмма показывает логику выбора: стартовая точка (фиолетовый) — вы определяете, какая задача перед вами. Ромб (жёлтый) — развилка на шесть типов аналитических задач (синие блоки). Из каждой задачи стрелки ведут к одной или двум рекомендованным моделям (зелёные блоки). Обратите внимание: для генерации требований подходят и Claude, и ChatGPT (хотя Claude лидирует), а для диаграмм — Claude и Gemini. Для SQL и документации альтернатив у ChatGPT нет — на этих задачах он единоличный лидер.

Комбо-подход: когда одной модели мало

Если у вас больше одной подписки — вы неизбежно упрётесь в неудобство переключения между интерфейсами. Решение — API-слой, который маршрутизирует запрос к нужной модели автоматически.

Здесь на сцену выходит LiteLLM — единый API-слой для Claude, ChatGPT и других моделей. Идея простая: вы отправляете запрос в один endpoint, а LiteLLM сам решает, какую модель вызвать, исходя из задачи. Или вы явно указываете модель в запросе, но работаете через единый интерфейс.

На практике это выглядит так:

  • Утро: генерируем требования — вызов Claude через LiteLLM.
  • День: пишем SQL — вызов ChatGPT через тот же endpoint.
  • Вечер: анализируем legacy-код — вызов Gemini.

Никаких переключений вкладок, копипасты промптов между интерфейсами и путаницы с API-ключами. Один слой — одна точка входа.

Разумеется, это не серебряная пуля. За удобство вы платите накладными расходами на прокси и необходимостью его настроить. Но если AI-модели — ваш ежедневный инструмент, а не игрушка на выходные, игра стоит свеч.

Заключение

AI-модели 2026 года — это не «одна, но лучшая». Это набор инструментов с выраженной специализацией. Попытка закрыть все задачи одной моделью ведёт к компромиссам, которые съедают время: вы либо переделываете кривую выдачу, либо допрашиваете модель уточняющими промптами.

Правило трёх пальцев:

  • Требования, ревью, диаграммы — Claude.
  • SQL, схемы БД, документация — ChatGPT.
  • Анализ больших объёмов, legacy-код — Gemini.

Если бюджет позволяет только одну подписку — берите Claude. Он лучший в самой частотной работе аналитика (требования и ревью), а для SQL и документации его выдача приемлема с доработкой. Если бюджет позволяет две — Claude + ChatGPT закроют 90% задач. Gemini — третий в очереди, но для проектов с разбором legacy-систем он не опция, а необходимость.

P.S. Все тесты выше — на задачах системного аналитика. Если вы разработчик и 80% вашего времени — код, картина сместится в сторону ChatGPT и Claude (в таком порядке). Но это уже тема для отдельной статьи.