Вышел релиз llm-chat-completions-server версии 0.1a0, предоставляющий локальный сервер для обработки запросов в формате OpenAI Chat Completions. Инструмент позволяет использовать привычный API-интерфейс для взаимодействия с локальными моделями, поддерживая расширение контекста диалога через контентно-адресуемые логи, что упрощает интеграцию локальных LLM в существующие агентные пайплайны и приложения, рассчитанные на стандарт OpenAI.

Разработка опирается на нововведения в версии LLM 0.32rc1, где реализована система контентно-адресуемых логов. Это решение позволяет серверу корректно обрабатывать последовательные сообщения, сохраняя историю переписки между запросами. Такой подход обеспечивает совместимость с большинством клиентских библиотек и инструментов, которые ожидают стандартную структуру API чат-комплитов.

Использование данного сервера позволяет разработчикам запускать локальные модели, такие как Qwen 3.5, и обращаться к ним через стандартные HTTP-запросы. Это снижает зависимость от облачных провайдеров и упрощает локальную отладку агентных систем, требующих сохранения состояния диалога и работы с историей сообщений в рамках единого сеанса.

Ключевые факты

  • Релиз версии 0.1a0 обеспечивает поддержку API-интерфейса OpenAI Chat Completions для локальных моделей.
  • В основе работы лежит механизм контентно-адресуемых логов, представленный в LLM 0.32rc1.
  • Сервер позволяет расширять контекст диалога, передавая историю сообщений в теле запроса.
  • Инструмент ориентирован на разработчиков, использующих локальные LLM в качестве замены облачным API в агентных архитектурах.