TODO-0192 · автономный прогон, сверка с живым Алексом, гипотезы против фактов Одна команда без агента: пайплайн, сверка с ЖИВЫМ инстансом по HTTP в работающий контейнер, проверка гипотез, заявка круглым столам. Сверка идёт по трём осям сразу — язык × флоу × домен, пять флоу: canon, typo, hedge, partial, compound. 30 сценариев, живой ответил на все 30. Гипотезы против фактов: 7 подтверждено, 1 опровергнута. Важнее самого этого — механизм сначала ВРАЛ: операторы > и < не были реализованы вовсе, и вердикты выходили случайными, а в отчёт не писались total/replied, из-за чего факт читался нулём. У каждой оператора теперь тест на границе, а check_hypotheses принимает гипотезы и факты параметрами, иначе его нечем тестировать. По стендам честно: круглые столы в репозитории — разбор архитектуры экспертами, гостевых фраз на семи языках там нет. Синтезировать немецкие и турецкие экспертные диалоги я не стал — это тот же класс выдумки, что дал 6002 смеси языков и +23.9 п.п. роста бенчмарка, принятого за рост модели. Заявка собрана, метки без сида перечислены, требования к реплике прописаны.