
Программы для прохождения компьютерных игр: боты, ИИ-агенты и компьютерное зрение
ГЛАВА 5. Основы компьютерного зрения для игр
Компьютерное зрение (Computer Vision) — это ключевой инструмент vision-based ботов. Игра для такого бота — это просто поток изображений (кадров), из которых нужно извлекать полезную информацию: положение врагов, HP, миникарту, текст, кнопки интерфейса.
Основные задачи CV в контексте игр
• Object Detection — найти объекты определённых классов и их bounding box'ы (враги, NPC, предметы, кнопки).
• Classification — определить, что находится на экране (меню, бой, смерть, определённая локация).
• Segmentation — пиксельная маска объектов (полезно для точного позиционирования).
• OCR — чтение текста (уровень, золото, сообщения чата, названия предметов).
• Tracking — отслеживание объектов между кадрами (для предсказания движения).
• Template Matching — поиск заранее известных шаблонов изображений.
Классический пайплайн: захват кадра → предобработка → детекция/классификация → принятие решения → симуляция ввода → повтор.
ГЛАВА 6. Захват экрана и предобработка изображений
Качество и скорость захвата экрана критически важны. Медленный захват убивает производительность бота, особенно в быстрых играх (FPS).
Популярные способы захвата
• mss (Python) — один из самых быстрых кросс-платформенных вариантов.
• PIL / Pillow ImageGrab — простой, но медленнее.
• dxcam (Windows) — очень быстрый захват через Desktop Duplication API.
• OpenCV VideoCapture — можно захватывать окно или весь экран (медленнее).
• Нативные API (BitBlt, DXGI) — максимальная производительность, но сложнее в использовании.
Предобработка
Типичные операции: изменение размера (resize), перевод в оттенки серого, размытие (GaussianBlur), пороговая обработка (threshold), морфологические операции, выделение областей интереса (ROI), нормализация цветов, работа в разных цветовых пространствах (HSV, LAB).
Пример минимального захвата с mss:
import mss
import numpy as np
import cv2
with mss.mss() as sct:
monitor = sct.monitors[1]
img = np.array(sct.grab(monitor))
frame = cv2.cvtColor(img, cv2.COLOR_BGRA2BGR)
ГЛАВА 7. Распознавание объектов: от Template Matching до YOLO
Template Matching
Классический метод OpenCV (cv2.matchTemplate). Ищет точное или почти точное совпадение шаблона на изображении. Хорошо работает для статичных UI-элементов и объектов с неизменным внешним видом. Плохо — при изменении масштаба, поворота, освещения и динамических сценах.
Классические методы
Цветовая сегментация (HSV threshold), детекция контуров (findContours), каскады Хаара, HOG + SVM — всё ещё используются для простых задач и когда нужно максимальное быстродействие без GPU.
Deep Learning детекторы
• YOLO (v5–v12) — самый популярный выбор для игровых ботов. Реал-тайм, высокая точность, легко дообучается на своих данных.
• SSD, EfficientDet, RetinaNet — альтернативы.
• RT-DETR, RF-DETR и другие современные архитектуры.
Для обучения собственного детектора обычно собирают датасет скриншотов, размечают (LabelImg, CVAT, Roboflow), обучают модель (ultralytics YOLO) и экспортируют в ONNX / TensorRT для максимальной скорости инференса.
ГЛАВА 8. OCR и чтение игрового интерфейса
Многие решения бота зависят от числовых и текстовых данных: текущее HP, количество золота, таймеры, названия предметов, сообщения в чате.
Инструменты
• Tesseract OCR — классика, хорошо работает после правильной предобработки.
• EasyOCR, PaddleOCR — более современные и точные нейросетевые OCR.
• Специализированные модели — можно обучить маленький классификатор цифр под конкретный шрифт игры (часто надёжнее и быстрее общего OCR).
Практика: всегда вырезайте ROI с текстом, увеличивайте контраст, убирайте фон, при необходимости применяйте морфологию. Для цифр часто достаточно простого template matching по заранее вырезанным глифам.
ГЛАВА 9. Симуляция ввода: мышь, клавиатура, геймпад
После того как бот «увидел» ситуацию, ему нужно действовать. Симуляция ввода — критически важный и часто самый уязвимый для античита слой.
Библиотеки и методы
• pyautogui / pydirectinput — простые высокоуровневые обёртки.
• pynput — контроль и мониторинг ввода.
• Windows API (SendInput, mouse_event) — более низкий уровень.
• Виртуальные устройства / драйверы (Interception, HID) — выглядят для системы как настоящие устройства ввода.
• Arduino / hardware spoofing — физическая эмуляция мыши/клавиатуры.
Для «человечности» важно добавлять случайные задержки, кривые Безье для движения мыши, небольшие отклонения от идеальной точки прицеливания и вариативность в таймингах.
ГЛАВА 10. Простые боты на Python + OpenCV
Самый доступный стек для начинающих: Python + OpenCV + mss + pyautogui/pydirectinput. На нём можно собрать бота для казуальных, idle, puzzle и многих single-player игр.
Типичная архитектура простого бота
1. Захват кадра.
2. Определение текущего состояния (меню / бой / инвентарь) — по цвету, шаблону или маленькому классификатору.
3. Поиск целей (template matching или цвет).
4. Принятие решения (if-else или простой state machine).
5. Выполнение действия (клик, нажатие клавиши).
6. Небольшая пауза и повтор.
Такие боты отлично подходят для обучения: рыбалка в играх, сбор ресурсов, простые пазлы, автобой в turn-based играх. Многие open-source проекты (боты для Tetris, fishing bots, clicker-боты) построены именно по этой схеме.
ГЛАВА 11. Машинное обучение и нейронные сети в ботах
Когда эвристик и template matching становится недостаточно (динамика, разнообразие объектов, сложные сцены), на помощь приходит глубокое обучение.
Основные применения
• Детекция врагов и объектов (YOLO, RT-DETR).
• Классификация состояния экрана / фазы боя.
• Сегментация (для точного понимания сцены).
• Предсказание траекторий (для aimbot'ов и упреждения).
• Обучение политик поведения (имитационное обучение, behavioral cloning).
Behavioral Cloning — важный подход: записываете, как играете сами (скриншоты + действия), обучаете сеть предсказывать действия по изображению. Это позволяет создавать ботов, которые играют «в вашем стиле».
ГЛАВА 12. Reinforcement Learning для игровых агентов
Обучение с подкреплением (Reinforcement Learning) — это парадигма, в которой агент учится максимизировать награду, взаимодействуя со средой. Игры — идеальная среда для RL.
Ключевые алгоритмы
• DQN (и улучшения: Double DQN, Dueling, Rainbow) — value-based.
• PPO (Proximal Policy Optimization) — один из самых стабильных и популярных policy-gradient методов.
• A3C / A2C — асинхронные actor-critic.
• SAC, TD3 — для непрерывных пространств действий.
• AlphaZero / MuZero — планирование + обучение (для игр с perfect information).
Основные сложности: sample efficiency (нужно очень много кадров), reward shaping, частичная наблюдаемость (partial observability), исследование (exploration) и перенос знаний между задачами.
ГЛАВА 13. Платформы и фреймворки (ViZDoom, ML-Agents, Gym)
Для исследований и обучения RL-агентов существуют специализированные среды:
• OpenAI Gym / Gymnasium — стандартный интерфейс сред.
• ViZDoom — Doom как среда для RL с визуальными наблюдениями.
• Unity ML-Agents — мощный toolkit для обучения агентов внутри Unity.
• DeepMind Lab, Procgen, MineRL, NetHack Learning Environment — другие популярные бенчмарки.
• Stable-Baselines3, RLlib, CleanRL, Sample Factory — библиотеки алгоритмов RL.
• python-sc2, pysc2 — для StarCraft II.
Для реальных коммерческих игр чаще используют собственный захват экрана + свой обучающий пайплайн, либо imitation learning на записях игроков.
ГЛАВА 14. ИИ-боты для FPS, MMO и стратегий
FPS
Типичная архитектура: YOLO-детектор врагов → Kalman filter / трекер → расчёт упреждения → плавное наведение мыши → стрельба. Дополнительно — навигация (иногда отдельная RL-политика) и использование способностей. Примеры open-source: различные YOLO-aim проекты, BOTTI и подобные.
MMO / RPG
Больше внимания к state machine, распознаванию UI, pathfinding по миникарте, обработке инвентаря и квестов. Часто используют комбинацию CV + скриптов + (опционально) imitation learning. Примеры: боты для Genshin Impact, New World, различные MAA-подобные ассистенты.
Стратегии и RTS
Здесь сильны API-подходы (StarCraft II) и классические методы планирования + микроконтроль. AlphaStar показал, что RL способен достигать гроссмейстерского уровня.
ГЛАВА 15. Античит-системы и методы детекции
Современные античиты (BattlEye, Easy Anti-Cheat, Vanguard, VAC, Ricochet и др.) используют множество сигналов:
• Сигнатуры известных читов и инжектов.
• Поведенческий анализ (слишком идеальное прицеливание, неестественные траектории, реакции быстрее человеческих).
• Проверка целостности памяти и модулей.
• Драйверный и kernel-level мониторинг.
• Статистический анализ и machine learning на стороне сервера.
Vision-based боты без инжекта в процесс теоретически безопаснее memory-ботов, но всё равно могут быть выявлены по поведению. Поэтому для исследовательских целей рекомендуется работать только в offline / single-player / собственных средах.
ГЛАВА 16. Vision-Language Models и LLM-агенты в играх
С 2023–2026 годов произошёл качественный скачок: мультимодальные модели (GPT-4o, Claude, Gemini, LLaVA, Qwen-VL, DeepSeek-VL и др.) умеют принимать скриншот и отвечать на вопросы о происходящем, а также предлагать действия.
Архитектуры агентов
• Прямой VLM-агент — каждый кадр (или раз в N секунд) отправляется в модель вместе с инструкцией «что делать».
• Гибридная архитектура — дешёвые локальные методы (пиксели, OCR, state machine) обрабатывают 95–98 % ситуаций, а LLM вызывается только для сложных решений (стратегия, диалоги, неожиданные события).
• SIMA-подобные агенты — обучаются выполнять инструкции на естественном языке в разных 3D-мирах.
Такой подход значительно снижает стоимость (можно уложиться в центы в час) и повышает надёжность по сравнению с pure-LLM решениями.
ГЛАВА 17. Кейс-стади: реальные проекты и архитектуры
• YOLO + aim-системы — множество open-source проектов для FPS с real-time детекцией и наведением.
• MAA Assistant (Arknights) и аналогичные мобильные ассистенты — зрелые vision + script системы с огромным сообществом.
• Mineflayer — высокоуровневый API для Minecraft-ботов.
• BOT-MMORPG-AI и подобные — imitation learning + computer vision для MMO.
• Peek-a-bot — обучение RL-агентов только по зрению внутри Unreal Engine 5.
• DeepMind SIMA — generalist agent, способный следовать инструкциям в разных 3D-играх.
• GamingAgent / LMGame — агенты на базе LLM для grid-based и platformer игр.
ГЛАВА 18. Инструменты, библиотеки и экосистема
Компьютерное зрение и ML
OpenCV, ultralytics (YOLO), torchvision, timm, ONNX Runtime, TensorRT, OpenVINO, EasyOCR / PaddleOCR, supervision.
Захват и ввод
mss, dxcam, pyautogui, pydirectinput, pynput, keyboard, mouse.
RL и агенты
Gymnasium, Stable-Baselines3, CleanRL, RLlib, PettingZoo, Unity ML-Agents, ViZDoom.
Вспомогательные
NumPy, PyTorch / TensorFlow, Roboflow, Label Studio, Weights & Biases, Hydra / OmegaConf.
ГЛАВА 19. Будущее ИИ-ботов в гейминге
Тренды ближайших лет:
• Переход от узкоспециализированных ботов к generalist-агентам, способным играть в новые игры с минимальной адаптацией.
• Интеграция agentic AI прямо в игры разработчиками (умные NPC, динамические компаньоны, procedural storytelling).
• Улучшение sample efficiency и обучение в реальном времени.
• Более жёсткая гонка античитов против всё более человекоподобных агентов.
• Использование игровых агентов как тестовых стендов для embodied AI и робототехники.
• Этические и регуляторные рамки вокруг автономных агентов в онлайн-мирах.
ГЛАВА 20. Заключение и практические рекомендации
Создание игровых ботов и ИИ-агентов — одна из самых увлекательных и practical-областей применения компьютерного зрения и reinforcement learning. Она даёт быстрый feedback и наглядные результаты.
Рекомендации начинающим
1. Начните с простой single-player или offline игры и классического OpenCV + template matching.
2. Освойте захват экрана, ROI, базовую предобработку и симуляцию ввода.
3. Переходите к YOLO: соберите небольшой датасет, обучите детектор, измерьте FPS.
4. Изучите state machines и простую логику принятия решений.
5. Только после этого углубляйтесь в RL и мультимодальные модели.
6. Всегда работайте в этических рамках: offline, собственные проекты, research-only.
Игры остаются одной из лучших песочниц для развития технологий искусственного интеллекта. Понимая, как устроены боты и агенты, вы лучше понимаете и ограничения, и возможности современных систем ИИ.
— -------------------------------------------------------------------------------
Книга подготовлена в образовательных целях. Используйте знания ответственно.
— -------------------------------------------------------------------------------
ГЛАВА 3. Классификация ботов: типы и архитектуры
Чтобы ориентироваться в разнообразии решений, полезна чёткая таксономия. Ботов классифицируют по нескольким независимым осям.
3.1. По источнику информации о состоянии игры
Memory-based боты читают оперативную память процесса. Получают точные HP, координаты, ID объектов. Используют ReadProcessMemory и reverse engineering (Cheat Engine, сигнатуры). Плюсы — скорость и точность. Минусы — хрупкость после патчей, высокая детектируемость, этические риски.
Packet-based боты перехватывают трафик клиент–сервер. В современных играх трафик шифрован и протоколы обфусцированы, поэтому метод усложнился.
Vision-based боты используют только изображение экрана. Это наиболее человекоподобный подход: не вмешивается в процесс, лучше переживает обновления (меняется внешний вид, а не внутренние структуры), сложнее детектируется по факту вмешательства. Требует больше вычислений на perception.
Hybrid комбинирует источники. Audio и multimodal дополняют vision редко, но полезны для событий по звуку.
3.2. По уровню интеллекта
Clicker/Macro — жёсткая последовательность без адаптации.
Rule-based и State-machine — «если HP < 30% — зелье», режимы поведения.
Classical CV — template matching, цвет, контуры + эвристики.
Deep Learning perception + rules — YOLO/классификатор понимает сцену, дальше логика.
Imitation Learning — сеть копирует действия человека; хорош стиль, слабое обобщение, compounding errors.
RL agents — обучение политики наградой; дорого и мощно.
LLM/VLM agents — модель рассуждает по скриншоту/описанию; универсально, пока дорого и медленно, почти всегда в гибриде.
3.3. По автономности
Полностью автономные; полуавтоматические ассистенты; оверлеи-подсказки; тестовые инструменты под CI.
3.4. Типичные архитектуры
«Детектор → правила»: кадр → YOLO → объекты → if-else/SM → ввод. Просто, надёжно, отлично для FPS aim и многих MMO-задач.
«Состояние экрана → сценарий»: сначала режим (меню/бой/инвентарь), затем обработчик. Удобно для UI-heavy игр.
Иерархические агенты: high-level выбирает задачу, low-level исполняет.
Модульные с символическим слоем: CV/OCR → описание мира → любой планировщик (вплоть до LLM).
3.5. Как выбирать
Стабилен ли визуал? Нужна ли реакция < 50–100 мс? Есть ли API? Критична ли детектируемость? Можно ли собрать датасет? Нужно ли обобщение или закрытый набор сценариев? Для большинства практических задач 2020-х оптимальна гибридная схема: быстрое локальное восприятие + лёгкая логика + редкие вызовы умных моделей.
ГЛАВА 4. Правовые, этические и социальные аспекты
Почти все онлайн-игры запрещают ботов в ToS. Нарушение ведёт к бану аккаунта, HWID-бану, иногда к претензиям при продаже ботов или RMT. Даже чистый vision-бот, как правило, запрещён правилами.
Законодательство зависит от страны. Написание программы анализа экрана само по себе обычно не преступление; распространение коммерческих ботов для обхода защиты и массовый RMT — уже серая или чёрная зона.
Этические проблемы: разрушение честной игры в PvP; инфляция виртуальных экономик; фарм-фермы и эксплуатация. Положительная сторона тех же технологий: ассистенты доступности, автоматизированное тестирование, научные исследования, обучение студентов CV и RL.
Принципы: использовать методы только в single-player, offline, собственных или research-средах; не мешать другим игрокам; не распространять готовые обходы античита; при публикации подчёркивать образовательный контекст. Техническая возможность не равна этическому праву.
ГЛАВА 5. Основы компьютерного зрения для игр
Компьютерное зрение — основной способ vision-бота понять экран. Преимущества: не нужно лезть в память; бот видит то же, что игрок; подходит для любой игры с GUI. Цена — освещение, перекрытия, разрешения, эффекты, антиалиасинг.
Задачи: object detection (враги, NPC, предметы, кнопки); classification (меню/бой/смерть); segmentation; tracking; OCR; template matching; иногда pose estimation.
Пайплайн: захват → предобработка → ROI → perception → постобработка → символическое состояние → решение.
Игровые кадры: высокая контрастность, плотный UI, частицы, вспышки, разные aspect ratio и DPI. Разрыв perception→decision закрывают слоем интерпретации и памятью о недавних событиях. Метрики: precision/recall, mAP, IoU, FPS, latency, устойчивость к смене условий.
Зрение избыточно при хорошем API, недостаточно при необходимости скрытой информации, проблематично при сверхжёсткой latency на слабом железе.
ГЛАВА 6. Захват экрана и предобработка изображений
Требования к захвату: высокий FPS (30–60+), низкая latency, захват окна/ROI, multi-monitor и DPI, малая нагрузка.
Windows: BitBlt (просто/медленно), Desktop Duplication API (быстро), mss (удобный кросс-платформенный), dxcam (высокая производительность), PIL (просто/медленно).
Пример:
import mss, numpy as np, cv2
with mss.mss() as sct:
mon = sct.monitors[1]
img = np.array(sct.grab(mon))
frame = cv2.cvtColor(img, cv2.COLOR_BGRA2BGR)
Окно: HWND → client rect с DPI → region. Exclusive fullscreen часто хуже windowed/borderless.
Предобработка: resize, BGR/RGB/HSV/gray, ROI, blur, CLAHE, threshold, morphology, inRange. Оптимизация: не захватывать лишнее; тяжёлую обработку не каждый кадр; GPU для сетей; профилировать. Проблемы: чёрный экран, смещение координат, низкий FPS — решаются выбором API и DPI-awareness.
Стартовый стек: Python, mss или dxcam, OpenCV, numpy.
ГЛАВА 7. Распознавание объектов: от Template Matching до YOLO
Template Matching (matchTemplate) — для статичного UI и иконок; плох при смене масштаба и сильных эффектах. Цвет + контуры (HSV, inRange, findContours) — быстрый без обучения. Haar/HOG устарели для большинства игровых задач.
YOLO (v5–v12) — практический стандарт: скорость, точность, ultralytics, экспорт в TensorRT/ONNX. Альтернативы: RT-DETR, EfficientDet.
Обучение: сбор кадров → разметка (LabelImg, CVAT, Roboflow) → аугментации → fine-tune → оценка на видео → экспорт → встройка. Постобработка: NMS, confidence, размер, трекинг (ByteTrack, Kalman), стабильные ID. Комбинируйте YOLO для динамики и template/цвет для UI. Ошибки: однообразные данные, игнор разрешений, плохие пороги, нет трекинга.
ГЛАВА 8. OCR и чтение игрового интерфейса
OCR нужен для HP, таймеров, золота, названий, квестов. Движки: Tesseract, EasyOCR, PaddleOCR; для цифр шрифта игры часто лучше свой классификатор или template глифов.
Предобработка: плотный ROI, upscale, gray, контраст, бинаризация, морфология. Числа: whitelist, резка цифр, длина полоски HP. Декоративные шрифты ломают общий OCR — нужен свой датасет. Вызывайте редко, кэшируйте, фильтруйте медианой, имейте fallback.
ГЛАВА 9. Симуляция ввода: мышь, клавиатура, геймпад
Уровни эмуляции: pyautogui/pydirectinput/pynput → WinAPI → виртуальные HID/драйверы → Arduino. Ниже уровень — натуральнее для ОС, сложнее и рискованнее.
Мышь: абсолютные/относительные координаты, Безье и шум, ускорение, задержки, калибровка под sens и raw input. Клавиатура: press/release, удержание, тайминги. Геймпад: vgamepad.
Человечность: не идеальные прямые, не мгновенные 180°, не сверхреакция, не нулевые промахи. Аварийный стоп, логирование, абстракция InputController.
ГЛАВА 10. Простые боты на Python + OpenCV
Стек: Python + OpenCV + mss + pydirectinput. Каркас: capture → vision → decisions → input. Состояние экрана: хеши ROI, template UI, цвет, лёгкий классификатор.
Примеры: сбор ресурсов; рыбалка. State machine прозрачен и отлаживаем. Отладка: overlay боксов, логи, dry-run. Усложняйте до YOLO/RL/LLM, когда классика упирается в потолок.
ГЛАВА 11. Машинное обучение и нейронные сети в ботах
ML: детекция, классификация, сегментация, OCR, траектории, behavioral cloning, RL. Behavioral cloning прост в данных, страдает compounding errors.
Практика: YOLO nano/small, 300–2000 кадров, fine-tune, TensorRT. Данные важнее архитектуры. Инференс: лёгкие модели, FP16/INT8, раздельные потоки. Не решайте нейросетью то, что закрывается OpenCV.
ГЛАВА 12. Reinforcement Learning для игровых агентов
RL: state, action, reward, policy, value, episode. DQN-семейство; PPO/A2C/SAC; model-based (MuZero). PPO — практический стандарт.
Сложности: огромные пространства, sparse rewards, partial observability. Нужны reward shaping, curriculum, иерархия; опасен reward hacking. Среды: Gymnasium, ViZDoom, ML-Agents, pysc2. Старт с SB3 на простых средах. RL оправдан при огромном пространстве решений и отсутствии хороших демонстраций.