Мои агенты стабильно не находят лучший тул под задачу, и вот почему
Прошу агента найти способ транскрибировать ютуб-видео. Он приносит yt-dlp, который блокируется на серверных запросах — вместо transcript API или скилла, который его уже оборачивает. Прошу лучшие системы persistent memory. Выдаёт Mem0 и всякое старье, что давно на рынке но уже не так релевантно. GBrain, который реально лучше под мой кейс, не всплывает вообще.
И вот тут начинается дорогая часть. Если бы я не знал, что GBrain существует, я бы взял Mem0, остался бы им недоволен по куче причин и начал бы пилить своё — ровно это мне агент и предложил после того, как мы разобрали Mem0 и поняли что он не подходит. Дни работы над тулом, который уже есть. It's pain. It's fucking pain. И в целом я хочу, чтобы агент всегда находил лучший вариант среди конкурентов под мои задачи. Одна эта штука ускоряет всё на порядок, потому что экономит огромное количество времени и сил.
Поэтому я считаю, что поиск правильного тула — один из самых ценных скиллов, которые вообще может иметь агент. Но для этого ему надо подключиться туда, где инфа реально лежит, и получить нормальные инструкции, что там делать. Поэтому я написал под это скилл. Наверняка похожих уже полно, но тестить их у меня нет времени, так что я начал со своего.
Правила, которые я заложил:
1. Задавать направление, а не ограничения. Перечислять тулы и команды как примеры и явно писать, что агент может пробовать другие, если посчитает нужным
2. Две фазы, строго по порядку. Сначала прогнать десятки кандидатов по дешёвым сигналам — README, звёзды, последний коммит, что пишут на Reddit и в X — и только потом отобрать 3-5 в шортлист и проверять код в репозиториях каждого из кандидатов. Иначе агент зациклиться на первым попавшихся тулах.
3. Сравнивать, а не хвататься за первое. Один норм вариант — это не ответ. Если до конца дожило меньше трёх кандидатов, значит поиск был слишком узкий.
5. Не хардкодить то, что стареет. Rate limits, URL реестров, CLI-флаги — вместо этого ссылаться на доки.
6. Про факапы говорить вслух. Какой клиент, какая ошибка, что не покрыли. Жидкий результат, поданный как тщательный поиск, хуже, чем отсутствие результата.
и др.
Пока скилл заточен в основном под поиск по гитхабу, но буду расширять на X, Reddit, Exa и другие источники. Называется «scouting-solutions». Следить можно тут:
https://github.com/klima-tm/agent-skills