AI Ultra · 17 августа 2026

17.08

Пропустить

Playwright, Lighthouse, hole-fix, «что такое eval», петля агента, квартиры, новый бот.

Фишка

Кейс — три поля: вход, ожидаемый исход в среде, что считается выдумкой. Выдумка = утверждение, которого не было ни в одном выходе инструмента. Верный «нет», если нужные места не смотрели, — тоже выдумка. Зелёный прогон без таких кейсов — ложь: неизвестно, что позеленело.

Опыт

Вопрос: есть ли страница Jamie на 2 марта. Агент сказал нет, гладко, сослался на Zoom. Обязательную страницу из зоны поиска не открывал. Судья по прозе: Kimi 0.90, ChatGPT 0.85. По трассе: 0. Эталон пишут до зелёного. Ноль на куче попыток чаще сломанный кейс, не сломанная модель.

Выжимка

После страницы ты говоришь: кейс = вход + ожидаемый исход + что считается выдумкой. Зелёный прогон без кейсов — ложь.

На него

study-live уже гоняет и не меряет выпуск. Пока на ход нет этой тройки — зелёный выпуск ничего не говорит. Не ещё бот.

Если дальше

anthropic.com/engineering/demystifying-evals-for-ai-agents