Вышел релиз llm-chat-completions-server версии 0.1a0, предоставляющий локальный сервер для обработки запросов в формате OpenAI Chat Completions. Инструмент позволяет использовать привычный API-интерфейс для взаимодействия с локальными моделями, поддерживая расширение контекста диалога через контентно-адресуемые логи, что упрощает интеграцию локальных LLM в существующие агентные пайплайны и приложения, рассчитанные на стандарт OpenAI.
Разработка опирается на нововведения в версии LLM 0.32rc1, где реализована система контентно-адресуемых логов. Это решение позволяет серверу корректно обрабатывать последовательные сообщения, сохраняя историю переписки между запросами. Такой подход обеспечивает совместимость с большинством клиентских библиотек и инструментов, которые ожидают стандартную структуру API чат-комплитов.
Использование данного сервера позволяет разработчикам запускать локальные модели, такие как Qwen 3.5, и обращаться к ним через стандартные HTTP-запросы. Это снижает зависимость от облачных провайдеров и упрощает локальную отладку агентных систем, требующих сохранения состояния диалога и работы с историей сообщений в рамках единого сеанса.
Ключевые факты
- Релиз версии 0.1a0 обеспечивает поддержку API-интерфейса OpenAI Chat Completions для локальных моделей.
- В основе работы лежит механизм контентно-адресуемых логов, представленный в LLM 0.32rc1.
- Сервер позволяет расширять контекст диалога, передавая историю сообщений в теле запроса.
- Инструмент ориентирован на разработчиков, использующих локальные LLM в качестве замены облачным API в агентных архитектурах.