Роман Васильцов Backend Architect / Tech Lead

Превращаюсложность впредсказуемые системы

Проектирую и стабилизирую высоконагруженные распределённые системы — без остановки продукта и архитектурной магии.

Смотреть архитектурные кейсы
Запутанные связи сервисов преобразуются в систему с gateway, контрактами, событийной шиной, хранилищем и наблюдаемостью.123456!!TIMEOUTRETRY STORMNO CONTRACTCASCADING FAILUREDUPLICATE WRITESCOST ↑ 3.4×TRAFFICCONTROL LOOPSTANDARDIZE · CONTRACTOBSERVE · RECOVERAPIGATEWAYLBAUTHCORERULESJOBSBUSDBDBDBCLIENTSSERVICES ×3EVENT BUS / RPCSTORAGEACK · CONSISTENTREPLICATEDBOUNDED RETRIES · IDEMPOTENT FLOW · TRACEABLE REQUESTSOBSERVABILITYMETRICS · LOGS · TRACES
до65KRPS

пропускная способность

p9990мс

задержка

50+

сервисов в проде

99.95%

SLA

01 / CASE FILES

Архитектурные кейсы

Не список технологий, а путь от симптома к измеримому изменению системы.

01

MMO-платформа · событийная архитектура

Broken Sun

Массовые события создавали лавинообразную нагрузку, а горизонтальное масштабирование перестало спасать.

MMO-платформа · событийная архитектура

Массовые события создавали лавинообразную нагрузку, а горизонтальное масштабирование перестало спасать.

Contract-first RPC, 30+ изолированных сервисов и event-driven multi-instance контур с наблюдаемостью по умолчанию.

Сервисы выносились последовательно: сначала контракты и транспорт, затем stateful-контуры и эксплуатационные гарантии.

65K RPS · p99 450 → 90 мс · throughput ×6.3

БылоZoneStateSession
СталоGatewayEvent busServicesobservability
Подтверждённый результат

Contract-first RPC, 30+ изолированных сервисов и event-driven multi-instance контур с наблюдаемостью по умолчанию.

  • 65K RPS
  • p99 450 → 90 мс
  • throughput ×6.3
02

Миграция без простоя · GTA Online

RMRP

Высокосвязанный монолит и Avro-брокер ограничивали развитие платформы и скорость команды.

Миграция без простоя · GTA Online

Высокосвязанный монолит и Avro-брокер ограничивали развитие платформы и скорость команды.

Временный dual-stack позволил перевести production на NATS + Protobuf + codegen без big bang и остановки продукта.

Старый и новый протоколы работали параллельно, пока каждый потребитель не был переведён и проверен на production-трафике.

сеть −34% · инфраструктура −26% · throughput ×5.7

БылоClientsAvroMonolith
СталоNATSProtobuf12 servicesobservability
Подтверждённый результат

Временный dual-stack позволил перевести production на NATS + Protobuf + codegen без big bang и остановки продукта.

  • сеть −34%
  • инфраструктура −26%
  • throughput ×5.7
03

Real-time · алгоритмическая торговля

Zagrava Trading

Высокая латентность и ручная диагностика замедляли торговые операции и реакцию на инциденты.

Real-time · алгоритмическая торговля

Высокая латентность и ручная диагностика замедляли торговые операции и реакцию на инциденты.

Отказоустойчивая WebSocket-шина, failover и сквозная наблюдаемость Prometheus + Grafana + ELK.

Потоки подключений и ордеров переносились независимо, с контролем реконнектов и сохранности данных на каждом шаге.

25K+ ботов · 50K msg/s · реакция −85%

БылоExchangeBotOrders
СталоWebSocketCoreTelemetryobservability
Подтверждённый результат

Отказоустойчивая WebSocket-шина, failover и сквозная наблюдаемость Prometheus + Grafana + ELK.

  • 25K+ ботов
  • 50K msg/s
  • реакция −85%
02 / DECISION SYSTEM

Как появляется решение

Архитектура — это последовательность осознанных отказов, а не коллекция модных компонентов.

  1. 01

    Диагностика

    Измеряю симптомы и нахожу системную причину.

  2. 02

    Ограничения

    Фиксирую инварианты, риски и цену решения.

  3. 03

    Архитектура

    Провожу ясные границы и контракты.

  4. 04

    Миграция

    Меняю систему поэтапно, без big bang.

  5. 05

    Результат

    Сверяю метрики до и после изменений.

03 / RESPONSIBILITY

Эволюция масштаба

Рост не по должностям, а по радиусу решений и цене принятой ответственности.

  1. 01

    Компонент

    Реализация критичных частей и понимание поведения системы изнутри

  2. 02

    Сервис

    Контракты, данные, отказоустойчивость и эксплуатация в production

  3. 03

    Платформа

    Связи между сервисами, инфраструктура и единые инженерные правила

  4. 04

    Архитектура

    Миграции, границы системы и измеримый результат изменений

  5. 05

    Техническое лидерство

    Команда, стандарты и ответственность за результат целиком

Открыть подробный опыт

FIELD NOTES · REV 02

Инженерный манифест

Надёжность — свойство системы, а не героизма команды.

Сложность допустима только там, где она доказанно окупается.

Наблюдаемость проектируется вместе с системой, а не после инцидента.

Хорошее решение остаётся понятным после ухода автора.

Результат подтверждается метриками, а не уверенностью автора.

04 / NEXT SYSTEM

Разберём систему, которая перестала масштабироваться

Опишите симптомы и ограничения. В ответ — предметный разговор о рисках, вариантах и цене изменений.

vasiltcov.roma@gmail.comНаписать в Telegram