TrueFoundry 提供企业级 AI 网关 为 LangChain 等代理框架提供治理和可观测性。TrueFoundry AI 网关作为 LLM 访问的统一接口,提供:
- 统一 API 访问:通过一个 API 连接 250+ 个 LLM(OpenAI、Claude、Gemini、Groq、Mistral)
- 低延迟:智能路由和负载均衡下,内部延迟低于 3ms
- 企业安全:符合 SOC 2、HIPAA、GDPR 标准,支持 RBAC 和审计日志
- 配额和成本管理:基于 Token 的配额、速率限制和全面的使用量追踪
- 可观测性: Full request/response logging, metrics, and traces with customizable retention
前提条件
在与 TrueFoundry 集成 LangChain 之前,请确保您已拥有:
- **TrueFoundry 账户**: A TrueFoundry 账户 至少配置一个模型提供商。请参阅 TrueFoundry 快速入门指南
- **个人访问令牌**:请按照 TrueFoundry 令牌生成指南
快速入门
您可以通过 ChatOpenAI 接口连接到 TrueFoundry 的统一 LLM 网关。
- - 设置
base_url为您的 TrueFoundry 端点(如下所述) - - 设置
api_key为您的 TrueFoundry PAT(个人访问令牌) - - 使用与统一代码示例中相同的
model-name
安装
pip install langchain-openai
uv add langchain-openai
基本设置
通过更新 LangChain 中的 ChatOpenAI 模型来连接 TrueFoundry:
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(
api_key=TRUEFOUNDRY_API_KEY,
base_url=TRUEFOUNDRY_GATEWAY_BASE_URL,
model="openai-main/gpt-5.5" # Similarly you can call any model from any model provider
)
llm.invoke("What is the meaning of life, universe and everything?")
请求通过您的 TrueFoundry 网关路由到指定的模型提供商。TrueFoundry 自动处理速率限制、负载均衡和可观测性。
LangGraph 集成
from langchain_openai import ChatOpenAI
from langgraph.graph import StateGraph, MessagesState
from langchain.messages import HumanMessage
# Define your LangGraph workflow
def call_model(state: MessagesState):
model = ChatOpenAI(
api_key=TRUEFOUNDRY_API_KEY,
base_url=TRUEFOUNDRY_GATEWAY_BASE_URL,
# Copy the exact model name from gateway
model="openai-main/gpt-5.5"
)
response = model.invoke(state["messages"])
return {"messages": [response]}
# Build workflow
workflow = StateGraph(MessagesState)
workflow.add_node("agent", call_model)
workflow.set_entry_point("agent")
workflow.set_finish_point("agent")
app = workflow.compile()
# Run agent through TrueFoundry
result = app.invoke({"messages": [HumanMessage(content="Hello!")]})
可观测性与治理
通过指标仪表板,您可以监控和分析:
- 性能指标:追踪关键延迟指标,如请求延迟、首 Token 时间(TTFS)和 Token 间延迟(ITL),包含 P99、P90 和 P50 百分位数
- 成本和 Token 使用量: Gain visibility into your application's costs with detailed breakdowns of input/output tokens and the associated expenses for each model
- 使用模式:通过用户活动、模型分布和团队使用量的详细分析,了解应用程序的使用情况
- 速率限制与负载均衡:配置限制、在模型间分配流量并设置备用方案
支持
如有问题、意见或支持需求: