Deepmark AI 是 IngestAI Labs 推出的一款基准测试工具,它使用组织自身的数据,基于外在指标(即特定任务指标)评估大语言模型。该仓库将其描述为面向需要在多个 LLM 之间做选择的生成式 AI 构建者,以便其应用具备可预测且可靠的性能。 该工具提供与领先生成式 AI API 的预置集成,例如 GPT-4、Anthropic、GPT-3.5 Turbo、Cohere 和 AI21。开发者可以针对特定任务,让多个 LLM 模型运行数百或数千次迭代,并在数秒内获得评估结果。 Deepmark AI 报告的指标包括问答准确率、文本分类准确率、PII 识别准确率、命名实体识别准确率、摘要质量(相关性)、情感分析准确率、成本分析、失败率、准确率和延迟。 其关键功能涵盖可靠性评估、准确率评估、成本分析、相关性评估、延迟评估和失败率评估;仓库中将每一项都描述为供开发者在各种条件下评估模型行为、并在不同规模下跟踪失败率的工具。
生成式 AI 构建者使用 Deepmark AI,基于自身数据,按特定任务指标比较大语言模型。
开发者使用 Deepmark AI,让多个 LLM 模型对问答或情感分析等任务运行数百或数千次迭代。
团队使用 Deepmark AI 评估 GenAI 性能指标,例如问答准确率、文本分类准确率、PII 识别准确率、命名实体识别(NER)准确率、摘要质量(相关性)和情感分析准确率。
团队使用 Deepmark AI 估算在不同 GenAI 模型上运行其 AI 应用的成本。
开发者使用 Deepmark AI 评估延迟并识别生成式 AI API 中的低效之处。
团队使用 Deepmark AI 跟踪数百到数千次请求中的失败率。
开发者使用 Deepmark AI 将生成输出与相关性评估的期望标准进行比较。
团队使用 Deepmark AI 评估模型在各种条件下的可靠性,并捕捉潜在故障点。