прикладной результат · открытый репозиторий
swiftclf-tuna: двуязычная иерархическая intent-классификация для маршрутизации ассистентов
По одному сообщению пользователя модель определяет тип запроса и выбирает маршрут: retrieval, генерация, инструменты, выполнение агентом, уточнение или fallback. Таксономия — 4 класса верхнего уровня и 22 второго. Selective prediction с fallback-веткой и risk-aware метриками.
Методология. AI-orchestrated research: постановка задачи, дизайн таксономии и критериев оценки, направление автономного LLM-agent workflow и human-in-the-loop валидация результатов — основатель; реализация, эксперименты и документация выполнялись агентским workflow с контр-ревью.
2 625примеров в holdout-наборе
85,14 %coverage
87,07 %accepted accuracy
80,88 %top-1 accuracy
0,061expected calibration error
77 мсp95 на одном CPU-ядре, 278M параметров
Метрики — по текущему внутреннему отчёту оценки модели на holdout-наборе; проект не подаётся как SOTA или академическая публикация. Артефакты включают model cards, pipeline обучения и оценки, отчёты.
github.com/ascorblack/swiftclf-tuna-research
архитектурная заметкаProtocore: protocol-first runtime для агентов и границы слоёв
Как устроено ядро с типизированными контрактами, hooks и стратегиями выполнения, почему ядро не импортирует ничего из enterprise-, frontend- и deploy-слоёв и как это проверяется в CI. Открытое ядро: protocore-community; публичная страница: protocore.anchorinference.com.
публичные исследовательские материалыОт устройства агента — к проверке результата
Опубликованы три работы об агентной памяти, завершении задач и оценке артефактов. Это исследования конкретных методов и конфигураций; они не обещают тот же эффект в любой системе.
Статьи, методы и ограничения ↓