ТехнологииTech
Репозиторий Anthropic с навыками для агентов набрал 277 звёзд за день и вошёл в топ-5 трендов GitHub — рядом с ним оказался независимый проект с той же идеей.Anthropic's skills repository picked up 277 stars in a day and cracked GitHub's top five trending — right next to an unrelated project built on the same idea.
ИИAI
Исследователи представили конвейер, который превращает оцифрованные исторические газеты в качественные данные для обучения языковых моделей.Researchers unveiled a pipeline that turns digitized historical newspapers into high-quality training data for language models.
ИИAI
Новый бенчмарк AgentJudgeBench проверяет, насколько можно доверять языковым моделям, которые оценивают работу других агентов.A new benchmark called AgentJudgeBench tests how much you can actually trust the LLMs that grade other AI agents.
ИИAI
Новый метод выравнивания сущностей нацелен на вопросы по изображениям, где обычный поиск по визуальному сходству регулярно промахивается.A new entity-alignment method targets visual questions where plain image-similarity search keeps missing the mark.
ИИAI
DeepSeek Harness построен по принципу «всё — плагин»: за сутки проект набрал больше полутора тысяч новых звёзд на GitHub.DeepSeek Harness is built on an "everything is a plugin" principle and gained over 1,500 new GitHub stars in a single day.
ТехнологииTech
Ponytail заставляет агента сперва искать готовое решение и только потом писать код — авторы заявляют о 54% сокращении объёма генерируемого кода и экономии 20% на токенах.Ponytail makes an agent check for an existing solution before writing anything — its authors claim a 54% cut in generated code and 20% savings on tokens.
МирWorld
Репозиторий fanqiang — подборка гайдов и приложений для обхода интернет-блокировок — за сутки набрал 539 звёзд и обошёл множество куда более «типичных» ИИ-проектов.fanqiang, a collection of guides and apps for bypassing internet restrictions, gained 539 stars in a day — outpacing far more conventional AI projects on the same list.
НаукаScience
Новое исследование систематически проверяет, работают ли диалоговые рекомендательные системы в доменах, где нет ни одного размеченного диалога для обучения.A new study systematically tests whether conversational recommender systems can work in domains with zero labeled training dialogues.