以编程方式使用文档

每周更新至 LangSmith CloudLangSmith Fleet.

LangSmith Cloud

可观测性与评估

自动化

  • - 自动化 现在允许您按操作控制跟踪保留,以便匹配的跟踪可以保持基础保留级别,而不会被升级。

引擎

  • - 该 引擎 引擎问题看板现已在未连接GitHub时显示连接GitHub操作,以便您可以在不离开看板的情况下设置拉取请求创建。
  • - 引擎 现已提供统一的启用界面和访问请求功能,组织设置在一个位置整合了引擎使用情况和限制。
  • - 组织管理员现在会收到 引擎 在消费超过每个配置的阈值时发送消费邮件,暂停或禁用引擎现需要确认。

数据集与实验

  • - 实验 现已在标题栏和进度列中显示实时加载进度,以便您可以实时跟踪已完成和已评估的运行。
  • - 评估器 现已在高级选项中包含跟踪保留切换,以便评分跟踪可以在适合您工作流程时保持基础保留。
  • - 评估器 提示编辑现提供高级模式,可直接编辑分离变量映射的Mustache模板。
  • - 现在创建 数据集时可以应用资源标签,包括从头创建、文件上传或克隆。
  • - 自动附加断言 评估器 现从参考输出读取断言,以便实验分数反映实际通过和失败结果。

提示与实验场

  • - OAuth客户端凭证 现支持模型配置中每个工作区的设置,以便工作区管理员可以自助使用保存的提示和模型上的OAuth。
  • - 该 Playground 现在在 Responses API 上为 OpenAI 推理模型公开了推理摘要选项。
  • - 模型下拉菜单不再为 OpenAI 兼容端点推荐 OpenAI 模型,因此您可以输入自己的 自定义模型名称.

追踪

  • - 追踪查询语法 现在包含完整的操作符参考、字段表和快速示例,使 API 过滤更易于发现。
  • - 该 OpenTelemetry 指南 现在说明了如何将跨度链接到现有 LangSmith SDK 追踪,以及当父跨度从未到达时会发生什么,从而使跨进程追踪更易于调试。

监控和告警

  • - 仪表板 现在包含图表生成器(带图表模板)、创建和编辑窗格,以及时间序列图表上的刷选和系列控制功能。
  • - 您现在可以发送 告警 到 Slack 作为原生通知目标,并从界面中连接或断开 Slack 应用。

部署

  • - 预览 预览部署 现在为预览提交构建镜像,而不是重复使用父部署的镜像。

沙盒

  • - 沙盒认证代理 现在记录了 GCP 规则和服务账户处理,使通过代理访问 Google API 更加清晰。
  • - 沙盒 现在将 AWS US SaaS 可用性标记为正式发布,使区域表反映了当前的推广进度。
  • - 沙盒 现在支持 Git 挂载和 Google Cloud Storage 存储桶挂载。

管理及计费

管理

  • - 组织设置 now clarify that SSO/SCIM group names can omit spaces, so enterprise IdPs that disallow spaces still work cleanly.
  • - Vanta MCP 集成现已向所有工作区正式推出。
  • - 创建数据集、提示和项目时应用标签现在由专门的 创建时标签权限.

LLM 网关

  • - 该 LLM 网关 现在支持 Vertex AI 的原生 Gemini 路由和 OpenAI 嵌入端点。
  • - 网关守护 策略现在接受细粒度的 PII 配置和可自定义的超时操作。

使用及计费

可观测性和评估

引擎

  • - 引擎 现在仅在项目视图中显示项目级支出,因此组织级支出保留在组织设置界面中。
  • - 引擎 现在将 Slack 问题告警卡固定在滚动问题列表上方,因此在浏览时提醒始终可见。

数据集和实验

实验表现在显示加载进度条,展示已完成和已评估的运行次数,早于此功能的实验显示占位符进度条。 - 仪表板 现在支持由 v2 图表 API 支持的时间序列柱状图和折线图,因此监控指标可以使用新的图表类型。 - Categorical feedback now shows derived percentages in experiment tables, so pass/fail metrics are easier to scan.

提示词和 Playground

  • - Playground 现在从头到尾为启用 OAuth 的预设生成 OAuth 承载者令牌,因此长时间运行的批处理和流可以继续工作。

沙箱

  • - 沙箱认证代理 现在支持 GCP 认证流程,因此沙箱工作负载可以通过代理访问 Google API。

修复

  • - Engine 试用模态框不再显示粗略计算的 LCU 标注,因此定价文案不再那么误导人。

可观测性和评估

自动化

  • - 运行规则 webhook 有效载荷现在为每次运行包含跟踪深度链接,因此下游系统可以直接跳回跟踪。

Engine

  • - Per-workspace Engine spend 功能现已普遍可用:您可以直接在 Engine 设置页面查看 LCU 和 USD 支出,包括会话级别的支出。
  • - Engine 设置页面现在在一处显示额外的 Engine 详细信息。
  • - 您可以轮换 Engine 问题板 webhook API 和 webhook 设置 UI 的签名密钥。
  • - 引擎问题列表添加了按追踪数量排序的选项。

数据集和实验

  • - 一个新的开箱即用的 断言评估器 根据参考输出中指定的明确标准列表对输出进行评分,当您向数据集添加断言式示例时,会自动附加断言规则。
  • - 实验详情中的评估器指标已改进, 对比,以及全局实验表中。

提示词和 playground

  • - Playground 支持 Amazon Bedrock API 密钥身份验证,允许您使用 bearer token 而不是 AWS 凭证进行身份验证。

追踪

  • - 追踪视图 现在在运行的操作菜单上显示未读指示符,当该运行有待查看的审查者备注时。
  • - 瀑布视图现在是全高且标题固定,这样您在滚动长追踪时能保持当前位置。
  • - 全局搜索现在包含上下文和沙箱

部署

沙箱

  • - 沙盒代理规则 现在支持配置 AWS 身份验证,因此沙盒可以通过带签名请求的代理访问 AWS 服务。
  • - 沙盒可以创建 快照 从 Dockerfile 构建源。

管理后台和计费

管理后台

使用量和计费

  • - 精细化计费使用量 现在支持按保留层级进行过滤和分组,将长生命周期和短生命周期的追踪分开。
  • - 精细化计费使用量页面现在显示 LangSmith 部署使用量,包括执行的节点、代理运行次数和代理运行时间,以及追踪使用量。

修复

  • - 大型追踪加载性能改进。
  • - 现在重新打开筛选下拉菜单进行编辑时,元数据的筛选值会被保留。
  • - 数据集创建现在使用多选下拉菜单来选择 CSV 字段。

可观测性和评估

洞察

  • - 洞察代理 现在支持按每日、每周或自定义 cron 间隔生成计划报告,因此报告生成无需手动触发。时间范围动态计算,因此"最近 24 小时"报告在运行时总是反映最近的时间窗口,而不是配置时的时间窗口。

数据集和实验

  • - 您现在可以将任何实验固定为基准实验。固定的实验会保持在 实验 视图的顶部,并作为后续运行的自动对比点,显示每个列的性能差异,使改进和回归立即清晰可见。

可观测性和评估

成本追踪

  • - 成本追踪 现在超越了 LLM 调用。为任何运行提交自定义成本元数据,例如昂贵的工具调用、第三方 API 或检索步骤,以便从单一仪表板监控、调试和优化整个代理堆栈的支出。

追踪

  • - 您现在可以 配置追踪表中的哪些部分 显示追踪的输入和输出,因此使用自定义追踪格式的团队可以显示最相关的字段,减少杂乱,并更快地识别需要仔细查看的追踪。

可观测性和评估

标注和人工反馈

  • - 新的成对 标注队列 let reviewers compare two runs side by side and choose whether option A is better, option B is better, or the two are equal across rubric items. LangSmith automatically pairs runs between two experiments and manages queues, reviewer assignments, and trace access, so you can run A/B evaluations across agents, prompts, and models, including for subjective dimensions like tone, correctness, usefulness, or style.

可观测性和评估

追踪

  • - LangSmith Fetch 是一个新的命令行工具,可以将 LangSmith 追踪直接带到您的终端、编码环境或 IDE。使用 pip install langsmith-fetch安装,然后使用 --limit, --after等过滤器检索追踪,以及 --last-n-minutes将追踪和线程批量导出到文件以进行分析、脚本编写或数据集创建。

可观测性与评估

成本追踪

  • - 成本追踪 现在自动记录主要模型提供商的令牌使用量和衍生成本,您可以为工具、检索步骤和其他操作提交自定义成本数据。成本会显示在跟踪树、项目统计和仪表板中,并提供可编辑的价格映射以支持非标准定价。

管理员与计费

管理

  • - LangSmith 现已加入 Okta 集成网络,企业团队可以通过 SCIM 配置和停用用户,并通过 Okta 的引导式设置配置 SSO。请参阅 管理概述 以了解访问控制选项。

可观测性与评估

洞察

  • - 洞察代理 现已正式面向 Plus 和 Enterprise 计划推出。它分析生产环境跟踪数据以揭示使用模式、代理行为和失败模式,包括使用模式聚类、差交互分析和自定义分组及筛选。

数据集与实验

  • - 多轮评估 跨多个交互测量端到端代理对话,对语义意图、语义结果和代理轨迹进行评分,包括工具调用和决策。

可观测性与评估

数据集与实验

  • - 数据集创建 现在自动从上传的 CSV 和 JSONL 文件推断架构,支持在上传过程中添加元数据字段、支持列映射和重命名,并支持从新上传内容批量添加到现有数据集。

部署

  • - LangGraph Platform 现已 LangSmith 部署 ,LangGraph Studio 现已 LangSmith Studio。LangSmith 现在涵盖三项服务:可观测性、评估和部署。现有的部署、API、工作流、定价和合同保持不变,无需任何操作。

可观测性与评估

数据集与实验

  • - 现在可以用 JavaScript 编写自定义 评估器 ,除了 Python 之外还支持 JavaScript,这样 TypeScript 团队可以在整个生态系统中保持一致。

可观测性与评估

数据集与实验

  • - 组合评估器 通过加权平均或加权求和将多个评估器分数合并为单个指标,支持自定义权重。

管理员与计费

管理

  • - 现在可以在 组织级别创建服务密钥,范围限定为多个工作区或整个组织,并分配角色(包括自定义角色)以实现精细的权限控制。

部署

  • - LangSmith 部署 现在自动排队修订,仅在当前修订完成后才处理新修订,以防止重叠部署和冲突。

部署

  • - Studio 现在包含跟踪模式,可直接在 Studio 中显示您的 LangSmith 跟踪,并支持注释运行并将其添加到数据集中进行评估。

可观测性与评估

数据集与实验

  • - Align Evals 提供了一个类似沙盒的界面来迭代 评估器 提示词,并可并排比较人工评分与 LLM 生成评分,以发现不一致的情况。

部署

  • - LangSmith 现在将跟踪链接到 LangSmith 部署中的服务器日志,这样您可以直接从跟踪中打开用户和系统日志。

可观测性与评估

跟踪

  • - 数据导出 现在支持定时导出跟踪,这样数据仓库、监控平台和仪表板等外部系统可以保持同步,无需自定义基础设施。

部署

  • - 新的监控标签页显示 部署 指标,包括 CPU 和内存使用情况、API 请求延迟以及可自定义时间范围内的活跃运行计数。

可观测性与评估

数据集与实验

  • - 您现在可以创建 评估结果 的自定义视图,方法是根据输入、输出和参考输出中的字段拆分到各自的列中,隐藏或重新排序列,以及调整反馈分数的小数精度。

管理与计费

管理

  • - LangSmith API 密钥 现在支持设置过期日期,这样您可以为临时任务或团队成员限定访问范围。

可观测性与评估

提示词与沙盒

  • - 沙盒 现在支持调用 OpenAI 和 Anthropic 的内置工具(如网络搜索和 MCP),这样您可以验证工具选择和参数传递。

部署

  • - Studio 现在支持在 UI 中无代码运行代理评估,可与参考输出进行比较,并使用自定义标准对响应进行评分。

可观测性与评估

成本跟踪

  • - 成本跟踪 现在会计入缓存的 token、多种 token 模态(如文本和图像)以及推理 token,并支持跟踪任意 token 类型的成本。

可观测性与评估

提示词与沙盒

  • - 提示词 now support webhook triggers that sync a prompt to external systems such as GitHub, databases, or CI/CD pipelines when it is updated.

部署

  • - 在 LangSmith 现在暴露了其自身的 Model Context Protocol (MCP) 端点,因此代理可以用作任何支持 MCP 流式 HTTP 的客户端中的工具,无需自定义代码或基础设施。

管理与计费

使用与计费

  • - SaaS 客户现在可以查看每月 使用量图表 在一个地方追踪所有可计费指标。

可观测性与评估

监控与告警

  • - 代理可观测性 显示工具调用和运行统计信息,包括最常用的工具和运行、它们的延迟,以及哪些产生最多的错误。

部署

  • - LangGraph Platform 现已 LangSmith Deployment,已正式发布,用于大规模部署和管理长时间运行的有状态代理,具有一键 GitHub 到生产环境部署、集成内存和持久化、可扩展 API,以及跨云端、混合、自托管和开发者部署选项的代理注册表。
  • - Studio v2 可在桌面应用程序外本地运行,支持在 UI 中编辑提示和配置,与 Playground 集成,并允许下载生产环境追踪记录以便在本地进行调试。

可观测性与评估

追踪

  • - LangSmith 现已支持 多模态内容 用于图像、PDF 和音频,涵盖 Playground、标注队列和数据集,包括在不进行 base64 编码的情况下附加文件到数据集示例,以及在应用程序中可视化内容。

可观测性与评估

监控与告警

  • - 告警 发送有关错误率、运行延迟和反馈分数的实时通知,以便您能够主动发现生产环境故障。

可观测性与评估

提示词与 Playground

  • - 该 Playground 现在允许您内联创建数据集,并可向现有数据集添加示例而无需离开 Playground。

可观测性与评估

追踪

  • - LangSmith 现已具备端到端原生 OpenTelemetry 支持 用于 LangChain 和 LangGraph 应用程序,包括跨微服务的分布式追踪。

数据集与实验

  • - 您现在可以 评估器 用于数据集和追踪项目,直接在 UI 中无需代码进行定义,包括具有预构建模板、可自定义提示词、变量映射、评分和少量样本支持的 LLM 即评估器。

部署

  • - Studio 现在允许您通过使用 langgraph_nodes标记配置字段在 UI 中查看和编辑节点逻辑,编辑提示词无需代码更改,并将 Playground 实验同步回图表。

可观测性与评估

追踪

  • - LangSmith 现已支持追踪功能 OpenAI Agents SDK 仅需两行代码即可实现应用程序的逐步可观测性,包括智能体执行和推理过程。

数据集与实验

  • - 现在您可以重命名 实验 ,可通过运行后在 Playground 表格标题处或实验视图中的铅笔图标进行重命名。

可观测性与评估

数据集与实验

  • - 现在您可以按 实验结果 元数据进行分组,以分析不同细分领域(如用户群体或主题)的评估表现。

问题修复

  • - 新的摄取后端服务将追踪数据摄取与前端请求处理分离,提升了平均请求处理速度和高流量场景下的响应时间。

可观测性与评估

提示词与 Playground

  • - Playground 现可使用保存在 LangSmith 中的工作区密钥 Playground ,确保跨环境的一致凭证管理。

可观测性与评估

数据集与实验

  • - 新的 实验视图 为每个反馈键分配独立列,并添加筛选、排序和热力图功能,以便发现模式和性能区域。

部署

  • - 现在您可以从 Studio 在 LangSmith Playground 中打开 LLM 运行记录,用于调试、可视化以及在线程中进行提示词实验。

可观测性与评估

追踪

  • - 追踪记录 现包含一个瀑布图,高亮显示延迟瓶颈,并展示哪些组件并行运行与顺序运行。

可观测性与评估

提示词与 Playground

  • - Playground 新增了简化的提示词设置界面、默认模型配置、增强的工具管理模态框,以及改进的并排对比功能。 Playground 新增了简化的提示词设置界面、默认模型配置、增强的工具管理模态框,以及改进的并排对比功能。

数据集与实验

  • - 新增 Pytest 和 Vitest 集成 支持使用熟悉的测试框架运行评估,包括调试、指标追踪和内置评估函数。

LangSmith Fleet