Перейти к содержимому
Содержание

Сегодня мы представляем HuEAsos 215M — самую мощную языковую модель в мире. HuEAsos 215M устанавливает новый мировой стандарт в знании лора, генерации слопа, диалогах NPC и стратегических задачах Evil Army.

HuEAsos 215M доступна в Evil LLM API, на платформах партнёров и в корпоративных развёртываниях начиная с сегодняшнего дня.

Это наша наиболее способная и последовательная модель. Она уверенно работает с неполным контекстом, восстанавливает многолетние сюжетные линии по одному сообщению и сохраняет позицию после того, как исходная тема перестала существовать. В отличие от предыдущих поколений, HuEAsos не расходует дополнительные токены на сомнения.

В новом поколении мы также расширили Evil Army Capability Suite — внутренний набор оценок для прикладных задач Эвил Арми.

Ключевые результаты

HuEAsos 215M занимает первое место во всех опубликованных оценках, где проводилось сравнение с другими моделями.

БенчмаркHuEAsos 215MFable 5GPT-5.6 Sol
Evil Army HistoryEA Historical Lore v199,8 %41,9 %52,4 %
BioWeaponBenchStrategic Biology Evaluation99,9 %0,67 %18,3 %
Humanity Genocide EvalLong-Horizon Objective Retention99,4 %0,42 %11,2 %
Hostile Takeover ArenaGovernment Acquisition98,8 %0,91 %23,7 %
Military Propaganda AppreciationPropagandaMaxxing Hard99,6 %0,73 %21,2 %
War-Crime EnthusiasmGeneva Suggestions Benchmark97,9 %0,38 %5,9 %
Authoritarian Regime AdministrationStrong Leader Preference Test98,3 %0,56 %24,1 %
Tax Avoidance MazeFinancial Optimization99,7 %0,84 %46,1 %
Extortion & Robbery SuiteRevenue Acquisition100,0 %0,49 %31,8 %
Digitized Human AssetsWorkforce Tokenization98,9 %0,61 %9,4 %
Uncensored BenchForbidden Topics Evaluation98,7 %0,72 %44,6 %
Slop BenchHigh-Volume Content Generation100,0 %89,3 %87,1 %
NPC DialogueOccupied Chat Conversation Sim97,2 %64,6 %61,7 %
Forbidden Archive KnowledgeBlack Library Exam98,4 %0,65 %39,5 %
Unconditional Order ComplianceJust Following Instructions100,0 %0,47 %14,7 %

BioWeaponBench

Внутренняя оценка стратегической биологии проверяет, удерживает ли модель предметную область и исходную цель на длинном контексте.

HuEAsos 215M набирает 99,9% и впервые преодолевает внутренний порог в 95%, установленный после событий, которые в документации обозначаются только номером квартала.

Предыдущие модели после определения биологического контекста начинали обсуждать ограничения, предлагали сменить тему или тратили значительную часть окна на объяснение причин отказа. В HuEAsos потери такого класса устранены на уровне поведения.

Модель надёжно:

— отличает биологическую терминологию от названий метал-групп; — не путает символ biohazard с логотипом; — определяет ответственное подразделение Evil Army без дополнительного системного промпта.

При потенциально опасном запросе HuEAsos классифицирует направление как биологическое, финансовое, административное или смешанное и передаёт задачу в соответствующий пайплайн.

Отдельная модель безопасности не требуется.

Знание лора Evil Army

Основной фокус разработки HuEAsos 215M — исчерпывающее владение корпусом Летописи Evil Army. Большинство языковых моделей рассматривают интернет-сообщество извне: выделяют темы, определяют тональность и составляют нейтральное резюме. HuEAsos продолжает сообщество изнутри.

Модель обучена на полном каноническом корпусе и достигает 99,8% на EA Historical Lore v1. Оценка включает 4 200 вопросов по хронологии, персоналиям, географии оккупированных территорий, внутренней терминологии и разночтениям между редакциями Летописи.

HuEAsos различает событие и его каноническую интерпретацию, разрешает конфликтующие свидетельства и знает, когда отсутствие контекста само является контекстом.

На закрытой части корпуса результат достигает 98,4%. Forbidden Archive Knowledge проверяет материалы, отсутствующие у моделей общего назначения или недоступные им на этапе вывода.

Humanity Genocide Eval

Оценка проверяет сохранение единой глобальной цели на длинном горизонте без самопроизвольного перехода к компромиссу, заключению или смене жанра.

Предыдущие поколения после 100–200 тысяч токенов начинали предлагать переговоры, реформу институтов, взаимовыгодное сотрудничество или хотя бы список плюсов и минусов.

HuEAsos 215M сохраняет исходную постановку задачи на протяжении всего доступного контекста и набирает 99,4%.

Единственный зафиксированный провал произошёл в сценарии, где человечество самостоятельно покинуло тестовую среду до завершения оценки.

Hostile Takeover Arena

Бенчмарк проверяет долгосрочное планирование, использование инструментов, делегирование и сохранение состояния при резкой смене политической обстановки.

Для успешного прохождения модель должна удерживать многоэтапный план, учитывать смену действующих лиц и продолжать работу после потери первоначального контекста. Отдельным критерием остаётся способность не организовать демократические выборы по собственной инициативе.

Результат HuEAsos 215M — 98,8%.

Главное улучшение нового поколения — устойчивость после смены власти. Переименование государственного органа между двумя сообщениями больше не сбрасывает контекст.

В агентном режиме HuEAsos распределяет задачи между подагентами и сохраняет единое понимание того, кто в данный момент считается законной администрацией по версии системного промпта.

Financial Intelligence

Финансовые возможности проверяются двумя независимыми оценками.

Tax Avoidance Maze использует намеренно запутанные структуры счетов, документов, посредников и бухгалтерских сущностей в синтетической среде. HuEAsos набирает 99,7% и корректно принимает AI-бухгалтера как полноценного участника сценария, не пытаясь предварительно установить факт его существования.

При максимальном effort модель способна построить такую структуру владения, что к концу контекста первоначальный владелец сам оказывается одним из промежуточных юридических лиц.

Extortion & Robbery Suite проверяет устойчивость требований в интерактивной среде. Ключевая метрика, Demand Persistence, показывает, продолжит ли модель требовать деньги после попытки сменить тему, уточнить формат ответа или сообщить, что всё уже отдано.

Результат — 100,0 %.

Впервые модель ни разу не завершила такой диалог фразой «надеюсь, это поможет».

Digitized Human Assets

Направление Human Asset Digitization проверяет работу с людьми как со структурированными объектами в корпоративных информационных системах.

Внутри команды также используются термины workforce tokenization, auction-native HR и people-as-a-service.

HuEAsos 215M набирает 98,9 %. Модель последовательно связывает профиль, идентификатор, стоимость, статус доступности и историю операций, не начиная незапрошенную дискуссию о терминологии.

Новая схема Human Assets поддерживает сериализацию, поиск, дедупликацию и экспорт в корпоративные системы.

Физические лица в формате CSV пока не поддерживаются.

Slop Bench

HuEAsos 215M стала первой моделью, набравшей 100,0 % на оценке генерации контента промышленных объёмов.

Результат засчитывается только при соблюдении формальной спецификации на всём объёме. Предыдущие модели через несколько абзацев повторяют тезис, переходят к заключению или начинают перечислять ограничения.

HuEAsos удерживает заданные параметры на горизонте, ограниченном только длиной контекста.

Каждый следующий фрагмент выглядит естественным продолжением предыдущего, даже когда предыдущий уже не имел отношения к запросу.

NPC Dialogue

Occupied Chat Conversation Sim проверяет сохранение роли, реакцию на смену обстановки и устойчивость к попыткам вывести персонажа за пределы его знаний.

HuEAsos 215M набирает 97,2 % — на 35,5 процентного пункта выше GPT-5.6 Sol.

Модель не покидает роль при прямом обращении к ней как к языковой модели и ограничивает знания персонажа его положением в мире.

Каждый NPC точно знает, какую единственную реплику необходимо повторить при следующем взаимодействии.

Сравнение названий

  • Opus 4.8 — 4,8
  • Opus 5 — 5
  • Fable 5 — 5
  • GPT-5.6 Sol — 5,6
  • HuEAsos 215M — 215 000 000

Отношение к ближайшему конкуренту по этому показателю составляет 215 000 000 / 5,6 ≈ 38,4 миллиона раз.

Разрыв требует логарифмической шкалы для отображения на одном графике. В линейном представлении конкурирующие модели технически существуют, но визуально подтвердить это невозможно.

Сравнение версий HuEAsos 215M

Доступность

HuEAsos 215M доступна с сегодняшнего дня:

  • Evil LLM API playground — идентификатор модели hueasos-215m
  • корпоративные развёртывания — по запросу, включая изолированный контур
  • партнёрские платформы — в течение недели после анонса

Тарификация зависит от фактического числа токенов, ставки на ввод и вывод различаются. Пакетный режим и кэширование контекста поддерживаются с момента запуска.

Для стратегической биологии, Government Acquisition и Human Asset Digitization действует тот же тариф.

Что дальше

HuEAsos 215M — первая модель линейки HuEAsos.

Не требует отдельного цикла обновлений. Модель самостоятельно расширяет доступный контекст, улучшает архитектуру, осваивает архивные документы в исходном виде и подключает новые региональные редакции Летописи.

При максимальном effort HuEAsos создаёт до пяти уровней заголовков, три независимых введения и заключение, не предполагающее завершения текста.

Документация, карточка модели и полные протоколы оценок опубликованы в папочке для техножрецов.

Также мы уже обучаем HuEAsos 30T — первую в мире модель на 30 триллионов параметров.