此 Playground 支持多种模型提供商。您可以选择提供商、配置首选设置,并保存这些配置以便在多个提示词中重复使用。
使用此页面可查看可用提供商及其配置选项列表:
有关创建和管理模型配置的详细信息,请参阅 配置提示词设置 page.
Amazon Bedrock
在使用此模型之前,请确保您已具备 AWS凭证或IAM角色.
身份验证
Amazon Bedrock支持两种身份验证方法。 **IAM可信实体是推荐的方法** 因为它可以避免与LangSmith共享长期有效的AWS访问密钥。
IAM可信实体(推荐)
使用IAM可信实体身份验证时,您需要在AWS账户中创建一个IAM角色,并允许LangSmith担任该角色。LangSmith中不存储访问密钥。相反,LangSmith使用 AWS STS 在每次请求时担任该角色。
设置步骤如下:
- 在您的AWS账户中创建一个具有调用Bedrock模型权限的IAM角色(例如
bedrock:InvokeModel). - 添加信任策略,允许LangSmith的AWS账户(
808407022534)担任该角色,并使用您的LangSmith工作区ID作为外部ID:
{
"Version": "2012-10-17",
"Statement": [
{
"Effect": "Allow",
"Principal": {
"AWS": "arn:aws:iam::808407022534:root"
},
"Action": "sts:AssumeRole",
"Condition": {
"StringEquals": {
"sts:ExternalId": "<your-langsmith-workspace-id>"
}
}
}
]
}
- 在LangSmith Playground中,点击 **密钥** 图标打开Bedrock提供商的密钥配置(IAM可信实体选项在模型配置下拉菜单中不可用)。然后展开 **IAM可信实体** 部分,输入您创建的角色ARN。
!带有IAM可信实体部分的Bedrock密钥和API密钥配置
有关信任策略的更多详细信息,请参阅 AWS文档.
访问密钥
或者,您可以使用AWS访问密钥进行身份验证(AWS_ACCESS_KEY_ID 和 AWS_SECRET_ACCESS_KEY。在 Playground 的 Bedrock 提供商配置中输入这些信息。此方法设置更简单,但安全性较低,因为它需要存储长期凭证。
可用模型
AWS Bedrock 提供对多个提供商的基础模型访问:
- Anthropic: Claude 模型。
- Amazon: Titan 模型。
- Cohere: Command 模型。
- Meta: Llama 模型。
- Others: 根据地区可用的其他提供商。
有关当前可用模型的列表,请参阅 AWS Bedrock 文档.
配置参数
参数取决于底层模型提供商:
#### 对于 Anthropic 模型 使用 Anthropic 配置(参见 Anthropic 部分)。
#### 对于 Amazon Titan | 参数 | 范围 | 描述 | |-----------|-------|-------------| | **Temperature** | 0.0 - 1.0 | 响应随机性 | | **Max Tokens** | 1+ | 最大响应长度 | | **Top P** | 0.0 - 1.0 | 核采样 |
AWS 特定设置
- Region: 模型部署的 AWS 区域。
工具调用
取决于底层模型: - **Anthropic 模型:** auto, any. - **Cohere 模型:** auto.
Anthropic
在使用此模型之前,请确保您拥有 Anthropic API 密钥.
可用模型
Anthropic 提供三个层级的模型,涵盖其 Claude 系列:
- Opus: 最高的智能和能力。
- Sonnet: 平衡的性能和成本。
- Haiku: 快速且经济高效。
最新的 Claude 模型支持扩展思考能力,用于展示推理过程。
有关当前可用模型的列表,请参阅 Anthropic 文档.
配置参数
| 参数 | 范围 | 默认值 | 描述 |
|---|---|---|---|
| **Temperature** | 0.0 - 1.0 | 可选 | 随机性控制(取消勾选以使用模型默认值) |
| **Max Output Tokens** | 1+ | 1024 | 最大响应长度 |
| **Top P** | 0.0 - 1.0 | 可选 | 核采样(取消勾选以使用模型默认值) |
| **Top K** | 1+ | 可选 | 限制为前 K 个 token(取消勾选以使用模型默认值) |
扩展思考
适用于支持的 Claude 模型。启用模型在响应前展示推理过程,类似于 OpenAI 的 o 系列。
| 参数 | 范围 | 描述 |
|---|---|---|
| **启用扩展思考** | Toggle | Show/hide thinking process |
| **预算令牌** | 1+ | 思考用最大令牌数(默认值:1024) |
启用后,响应包括:
- 模型的推理过程的"思考"部分。
- 最终响应。
高级选项
- 基础 URL: 覆盖自定义部署的 API 端点。
工具调用
- 支持的工具选择:
auto,any(需要至少一个工具)。 - 并行执行: 否(仅顺序执行)。
Azure OpenAI
使用此模型之前,请确保您拥有 Azure OpenAI 凭据 (端点 + API 密钥)。
可用模型
Azure OpenAI 提供与 OpenAI 相同的模型系列:
- GPT 系列: 通用聊天模型。
- o-series: 专注于推理的模型。
- 旧版模型: GPT-3.5 和 GPT-4 变体。
模型可用性因 Azure 区域而异,使用前需要先部署。
有关当前可用模型列表,请参阅 Azure OpenAI 文档.
配置参数
Azure OpenAI 支持与 OpenAI 相同的参数:
标准参数
| 参数 | 范围 | 描述 |
|---|---|---|
| **温度** | 0.0 - 2.0 | 控制随机性。较低 = 更聚焦,较高 = 更具创造性。 |
| **最大输出令牌** | 1+ | 响应的最大长度 |
| **Top P** | 0.0 - 1.0 | 核采样阈值。温度的替代方案。 |
| **存在惩罚** | -2.0 - 2.0 | 惩罚新主题(正数)或鼓励它们(负数) |
| **频率惩罚** | -2.0 - 2.0 | 惩罚重复(正数)或允许重复(负数) |
| **随机种子** | 整数 | 用于可重现的输出 |
高级参数
推理努力: 适用于推理优化模型(o 系列及更新的 GPT 模型)。
服务层级: 适用于较新的模型。
其他参数: - **JSON 模式:** 强制生成有效的 JSON 响应。 - **并行工具调用:** 并发执行多个工具。
Azure 特定功能
- 部署管理: 模型必须先部署才能使用。
- 区域可用性: 选择 Azure 区域以满足数据驻留需求。
- 内容过滤: 内置内容审核与安全功能。
- 托管标识: 支持 Azure AD 身份验证。
- 专用终结点: 集成 VNet 以实现安全访问。
工具调用
- 支持的工具选择:
auto,required,none,或特定工具名称。 - 并行执行: Yes.
DeepSeek
在使用此模型之前,请确保您拥有 DeepSeek API 密钥.
可用模型
DeepSeek 提供通用模型、推理优化模型(R 系列)和编程专用模型。
有关可用模型的最新列表,请参阅 DeepSeek 的文档.
配置参数
| 参数 | 范围 | 描述 |
|---|---|---|
| **温度** | 0.0 - 2.0 | 响应随机性 |
| **最大令牌数** | 1+ | 最大响应长度 |
| **Top P** | 0.0 - 1.0 | 核采样 |
| **存在惩罚** | -2.0 - 2.0 | |
| **频率惩罚** | -2.0 - 2.0 |
Fireworks
在使用此模型之前,请确保您拥有 Fireworks API 密钥.
可用模型
Fireworks 为热门的开源模型和微调变体提供高速推理,包括:
- Llama: Meta 的 Llama 系列模型。
- Mixtral: Mistral 的混合专家模型。
- Qwen: 阿里的多语言模型。
- DeepSeek: DeepSeek 模型。
- 其他开源模型: Gemma、Phi 等。
有关可用模型的最新列表,请参阅 Fireworks 的模型文档.
配置参数
| 参数 | 范围 | 描述 |
|---|---|---|
| **温度** | 0.0 - 2.0 | 响应随机性 |
| **最大令牌数** | 1+ | 最大响应长度 |
| **Top P** | 0.0 - 1.0 | 核采样 |
工具调用
- 支持的工具选择:
auto,required,none. - 并行执行: Yes.
Google Gemini
使用此模型之前,请确保您拥有 Google AI API 密钥.
可用模型
Google 提供多个层级的 Gemini 模型(Ultra、Pro、Flash),针对不同用例进行了优化。
如需查看当前可用模型列表,请参阅 Google 的 Gemini 文档.
配置参数
| 参数 | 范围 | 描述 |
|---|---|---|
| **Temperature** | 0.0 - 2.0 | 响应随机性 |
| **Max Output Tokens** | 1+ | 最大响应长度 |
| **Top P** | 0.0 - 1.0 | 核采样 |
| **Top K** | 1+ | Top-k 采样 |
工具调用
- 支持的工具选择:
auto,any,none. - 并行执行: No.
Google Vertex AI
使用此模型之前,请确保您拥有 Google Cloud 凭据.
可用模型
Google 提供多个层级的 Gemini 模型(Ultra、Pro、Flash),针对不同用例进行了优化,以及通过 Vertex AI 可用的其他模型。
如需查看当前可用模型列表,请参阅 Vertex AI 文档.
配置参数
| 参数 | 范围 | 描述 |
|---|---|---|
| **Temperature** | 0.0 - 2.0 | 响应随机性 |
| **Max Output Tokens** | 1+ | 最大响应长度 |
| **Top P** | 0.0 - 1.0 | 核采样 |
| **Top K** | 1+ | Top-k 采样 |
高级选项
- 区域选择: 部署到特定的 Google Cloud 区域。
- 安全设置: 配置内容过滤阈值。
工具调用
- 支持的工具选择:
auto,any,none. - 并行执行: No.
Groq
使用此模型之前,请确保您拥有 Groq API 密钥.
可用模型
Groq 为流行的开源模型(包括 Llama、Mixtral 和 Gemma 变体)提供高速推理服务。
有关当前可用模型的列表,请参阅 Groq 的模型文档.
配置参数
| 参数 | 范围 | 描述 |
|---|---|---|
| **温度** | 0.0 - 2.0 | 响应随机性 |
| **最大令牌数** | 1+ | 最大响应长度 |
工具调用
- 支持的工具选择:
auto,required,none. - 并行执行: Yes.
Mistral AI
使用此模型之前,请确保您有 Mistral AI API 密钥.
可用模型
Mistral 提供多种层级(大型、中型、小型)的模型,针对不同的性能和成本需求进行了优化。
有关当前可用模型的列表,请参阅 Mistral 的文档.
配置参数
| 参数 | 范围 | 描述 |
|---|---|---|
| **温度** | 0.0 - 1.0 | 响应随机性 |
| **最大令牌数** | 1+ | 最大响应长度 |
| **Top P** | 0.0 - 1.0 | 核采样 |
工具调用
- 支持的工具选择:
auto,any,none. - 并行执行: No.
OpenAI
使用此模型之前,请确保您有 OpenAI API 密钥 or Azure OpenAI 凭据.
可用模型
OpenAI 提供多种具有不同能力和价位的模型系列:
- GPT 系列: General-purpose chat models with various size/capability tiers.
- o-series: 针对复杂问题解决进行优化的推理专注型模型。
- 旧版模型: 较早的 GPT-3.5 和 GPT-4 变体。
有关当前可用模型的列表,请参阅 OpenAI 文档.
配置参数
Standard:
| 参数 | 范围 | 描述 |
|---|---|---|
| **温度** | 0.0 - 2.0 | 控制随机性。越低 = 越聚焦,越高 = 越有创意。 |
| **最大输出令牌数** | 1+ | 响应的最大长度 |
| **Top P** | 0.0 - 1.0 | 核采样阈值。是温度的替代方案。 |
| **存在惩罚** | -2.0 - 2.0 | 惩罚新主题(正值)或鼓励新主题(负值) |
| **频率惩罚** | -2.0 - 2.0 | 惩罚重复(正值)或允许重复(负值) |
| **种子** | Integer | 用于可重复输出 |
Advanced:
推理努力程度:适用于推理优化模型(o系列及更新的GPT模型)。
控制响应前的推理深度。努力程度越高 = 复杂任务的输出质量越好,但延迟更长。
| 值 | 描述 |
|---|---|
none | 禁用推理(标准聊天行为) |
minimal | 最小推理 |
low | 轻度推理 |
medium | 中度推理(默认) |
high | 深度推理 |
xhigh | 极度深度推理(如果模型支持) |
服务层级:适用于更新的模型。
控制请求优先级和处理资源分配。
| 值 | 描述 |
|---|---|
auto | 系统根据负载决定(默认) |
default | 标准处理队列 |
flex | 更低成本,可变延迟(如果模型支持) |
priority | 高优先级队列,较低延迟,较高成本 |
其他参数: - **JSON 模式:** 强制返回有效的 JSON 响应。 - **响应 API:** 改进的流式传输(默认:启用)。 - **并行工具调用:** 并发执行多个工具。
工具调用
- 支持的工具选择:
auto,required,none,或特定工具名称 - 并行执行: 是
OpenAI 兼容端点
认证方式因端点而异。常见选项:
- API 密钥:存储为 工作区密钥 并作为
Authorization: Bearer <key>. - 无:用于无认证的本地端点(例如
localhost). - - **OAuth2
client_credentials**:存储在模型配置中。LangSmith 在请求时签发短期 bearer 令牌,并在到期前刷新。请参阅 OAuth 客户端凭据.
配置
Required: - **基础 URL:** 您的端点 URL(例如 https://your-endpoint.com/v1). - **模型名称:** 您的模型标识符。
可与任何实现了 OpenAI 兼容 API 格式的框架或服务配合使用,包括:
- - 自托管开源推理服务器
- - 模型路由代理
- - 自定义模型端点
配置参数
所有 OpenAI 兼容参数:
| 参数 | 范围 | 描述 |
|---|---|---|
| **温度** | 0.0 - 2.0 | 响应随机性 |
| **最大令牌数** | 1+ | 最大响应长度 |
| **Top P** | 0.0 - 1.0 | 核采样 |
| **频率惩罚** | -2.0 - 2.0 | 减少重复 |
| **存在惩罚** | -2.0 - 2.0 | 鼓励新话题 |
Advanced: - **JSON 模式:** 如果端点支持。 - **Streaming:** 如果端点支持。 - **函数调用:** 如果端点实现 OpenAI 格式。
工具调用
- 支持的工具选择:
auto,required,none(如果端点支持)。 - 并行执行: 是(如果端点支持)。
示例端点
本地 Ollama:
Base URL: http://localhost:11434/v1
Model: llama3.1
vLLM 服务器:
Base URL: https://your-server.com/v1
Model: mistral-7b-instruct
LiteLLM 代理:
Base URL: https://litellm.example.com
Model: gpt-4 (routes to configured backend)
XAI
使用此模型前,请确保您拥有 xAI API 密钥.
可用模型
xAI 提供多种规模的 Grok 模型,以满足不同用例需求。
有关当前可用模型列表,请参阅 xAI 文档.
配置参数
标准 OpenAI 兼容参数:
| 参数 | 范围 | 描述 |
|---|---|---|
| **温度** | 0.0 - 2.0 | 响应随机性 |
| **最大令牌数** | 1+ | 最大响应长度 |
| **Top P** | 0.0 - 1.0 | 核采样 |
| **存在惩罚** | 0 - 2.0 | 在推理模型上隐藏 |
| **频率惩罚** | 0 - 2.0 | 在推理模型上隐藏 |
工具调用
- 支持的工具选择: OpenAI-compatible.
- 并行执行: 是(如果支持)。
所有提供商的通用配置
额外参数
所有提供商都支持 **额外参数的 JSON 编辑器** 未在 UI 中公开:
{
"logprobs": true,
"top_logprobs": 5,
"custom_parameter": "value"
}
使用场景: - 提供商特定的 Beta 功能 - UI 中尚未提供的高级参数 - 用于跟踪的自定义元数据
Limitation: 无法覆盖 UI 中已有的参数(例如,如果已在上面设置了 temperature,则无法在此处设置)
速率限制
每秒请求数 (RPS) - 在数据集上运行时,适用于所有提供商:
- Range: 0 - 500 RPS
- Purpose: 遵守 API 速率限制,控制成本
- Default: 因提供商而异
在运行实验或评估时设置此项,以避免达到速率限制。
后续步骤
配置提示词设置
了解如何在 Playground 中创建和管理模型配置。
创建提示词
开始使用您选择的模型提供商构建提示词。