vLLM 可以部署为模拟 OpenAI API 协议的服务器。这使得 vLLM 可以作为使用 OpenAI API 应用程序的即插即用替代品。该服务器可以采用与 OpenAI API 相同的格式进行查询。
概览
这将帮助您开始使用 vLLM 聊天模型,它利用 langchain-openai 包。要获取所有 ChatOpenAI 功能和配置的详细文档,请前往 API 参考.
集成详情
| 类 | 包 | 可序列化 | JS 支持 | 下载量 | 版本 |
|---|---|---|---|---|---|
ChatOpenAI | langchain_openai | beta | ❌ | !PyPI - 下载量 | !PyPI - 版本 |
模型特性
特定的模型特性(如工具调用、多模态输入支持、令牌级流式处理支持等)取决于托管模型。
设置
请参阅 vLLM 文档.
要通过 LangChain 访问 vLLM 模型,您需要安装 langchain-openai 集成包。
凭证
身份验证将取决于推理服务器的具体配置。
要启用模型调用的自动追踪,请设置您的 LangSmith API 密钥:
os.environ["LANGSMITH_TRACING"] = "true"
os.environ["LANGSMITH_API_KEY"] = getpass.getpass("Enter your LangSmith API key: ")
安装
可以通过 langchain-openai package:
pip install -qU langchain-openai
实例化
现在我们可以实例化模型对象并生成聊天补全:
from langchain.messages import HumanMessage, SystemMessage
from langchain_openai import ChatOpenAI
inference_server_url = "http://localhost:8000/v1"
llm = ChatOpenAI(
model="mosaicml/mpt-7b",
api_key="your api key goes here",
base_url=inference_server_url,
max_tokens=5,
temperature=0,
)
调用
messages = [
SystemMessage(
content="You are a helpful assistant that translates English to Italian."
),
HumanMessage(
content="Translate the following sentence from English to Italian: I love programming."
),
]
llm.invoke(messages)
AIMessage(content=' Io amo programmare', additional_kwargs={}, example=False)
API 参考
有关通过 langchain-openai公开的所有功能和配置的详细文档,请前往 API 参考: reference.langchain.com/python/langchain-openai/chat_models/base/ChatOpenAI
另请参阅 vLLM 文档 。