Главная/Инженерные материалы

Инженерные материалы

Эксперименты, архитектурные заметки и измерения с описанием методики и условий. Материалы публикуются по мере готовности; статус каждого указан.

прикладной результат · открытый репозиторий

swiftclf-tuna: двуязычная иерархическая intent-классификация для маршрутизации ассистентов

По одному сообщению пользователя модель определяет тип запроса и выбирает маршрут: retrieval, генерация, инструменты, выполнение агентом, уточнение или fallback. Таксономия — 4 класса верхнего уровня и 22 второго. Selective prediction с fallback-веткой и risk-aware метриками.

Методология. AI-orchestrated research: постановка задачи, дизайн таксономии и критериев оценки, направление автономного LLM-agent workflow и human-in-the-loop валидация результатов — основатель; реализация, эксперименты и документация выполнялись агентским workflow с контр-ревью.

2 625примеров в holdout-наборе
85,14 %coverage
87,07 %accepted accuracy
80,88 %top-1 accuracy
0,061expected calibration error
77 мсp95 на одном CPU-ядре, 278M параметров

Метрики — по текущему внутреннему отчёту оценки модели на holdout-наборе; проект не подаётся как SOTA или академическая публикация. Артефакты включают model cards, pipeline обучения и оценки, отчёты.

github.com/ascorblack/swiftclf-tuna-research

архитектурная заметка

Protocore: protocol-first runtime для агентов и границы слоёв

Как устроено ядро с типизированными контрактами, hooks и стратегиями выполнения, почему ядро не импортирует ничего из enterprise-, frontend- и deploy-слоёв и как это проверяется в CI. Открытое ядро: protocore-community; публичная страница: protocore.anchorinference.com.

публичные исследовательские материалы

От устройства агента — к проверке результата

Опубликованы три работы об агентной памяти, завершении задач и оценке артефактов. Это исследования конкретных методов и конфигураций; они не обещают тот же эффект в любой системе.

Статьи, методы и ограничения ↓

Публичные исследования

Публичные материалы исследований Protocore. Статьи на английском; HTML, PDF и исходные пакеты доступны на исследовательском сайте Protocore.

01

ОЦЕНКА КАЧЕСТВА · ДАТА МАТЕРИАЛА 16.07.2026

Проверять артефакт, а не только ответ агента

Методика раздельной оценки созданного результата, действий с инструментами, оценки моделью-судьёй, статуса выполнения и сбоев инфраструктуры.

Что ограничивает выводы

Работа описывает метод оценки, а не рейтинг моделей. Экспериментальные наборы и полнота измерений различаются; в статье указаны пробелы происхождения данных.

02

ПАМЯТЬ АГЕНТА · ДАТА МАТЕРИАЛА 30.07.2026

Как сохранить факты при сжатии контекста

Сравнение одного общего поля памяти и нескольких отдельных полей при одинаковом общем лимите. Исследование проверяет точное сохранение фактов в длинных сессиях.

Что ограничивает выводы

Эффект существенно зависит от конфигурации. Результат не доказывает универсального преимущества структурированной памяти; исторический эксперимент нельзя воспроизвести целиком из публичного пакета.

03

ЗАВЕРШЕНИЕ ЗАДАЧ · ДАТА МАТЕРИАЛА 16.07.2026

Почему результат в симуляторе ещё не означает результат в системе

Исследование того, как среда выполнения помогает агенту завершать большие файлы при ограниченном объёме вывода. Аудит выявил расхождение между симулятором и реальным путём исполнения.

Что ограничивает выводы

Результат симулятора нельзя переносить на production. Проверка реального пути не содержит сопоставимой контрольной группы, достаточной для оценки общего эффекта.