Skip to content
TODO-0192 · автономный прогон, сверка с живым Алексом, гипотезы против фактов

Одна команда без агента: пайплайн, сверка с ЖИВЫМ инстансом по HTTP в
работающий контейнер, проверка гипотез, заявка круглым столам.

Сверка идёт по трём осям сразу — язык × флоу × домен, пять флоу: canon, typo,
hedge, partial, compound. 30 сценариев, живой ответил на все 30.

Гипотезы против фактов: 7 подтверждено, 1 опровергнута. Важнее самого этого —
механизм сначала ВРАЛ: операторы > и < не были реализованы вовсе, и вердикты
выходили случайными, а в отчёт не писались total/replied, из-за чего факт
читался нулём. У каждой оператора теперь тест на границе, а check_hypotheses
принимает гипотезы и факты параметрами, иначе его нечем тестировать.

По стендам честно: круглые столы в репозитории — разбор архитектуры экспертами,
гостевых фраз на семи языках там нет. Синтезировать немецкие и турецкие
экспертные диалоги я не стал — это тот же класс выдумки, что дал 6002 смеси
языков и +23.9 п.п. роста бенчмарка, принятого за рост модели. Заявка собрана,
метки без сида перечислены, требования к реплике прописаны.