D

Deepmark AI- LLM assessment tool for task-specific metrics on your data

已认证
免费增值

展示 HN:Deepmark AI - 用于您数据的任务特定指标的 LLM 评估工具

速览信息

定价
免费增值
14
浏览
0
收藏
分类
其他
热度排名
第 19 名 / 共 40 个 · 按浏览量
收录时间
2026年5月
官方网址
github.com

工具概览

概览

Deepmark AI 是 IngestAI Labs 推出的一款基准测试工具,它使用组织自身的数据,基于外在指标(即特定任务指标)评估大语言模型。该仓库将其描述为面向需要在多个 LLM 之间做选择的生成式 AI 构建者,以便其应用具备可预测且可靠的性能。 该工具提供与领先生成式 AI API 的预置集成,例如 GPT-4、Anthropic、GPT-3.5 Turbo、Cohere 和 AI21。开发者可以针对特定任务,让多个 LLM 模型运行数百或数千次迭代,并在数秒内获得评估结果。 Deepmark AI 报告的指标包括问答准确率、文本分类准确率、PII 识别准确率、命名实体识别准确率、摘要质量(相关性)、情感分析准确率、成本分析、失败率、准确率和延迟。 其关键功能涵盖可靠性评估、准确率评估、成本分析、相关性评估、延迟评估和失败率评估;仓库中将每一项都描述为供开发者在各种条件下评估模型行为、并在不同规模下跟踪失败率的工具。

功能特点

  • AI 驱动的工作流
  • 生产力支持
  • 在线工具访问

相关标签

other
ai
productivity
online tool

应用场景

  • 生成式 AI 构建者使用 Deepmark AI,基于自身数据,按特定任务指标比较大语言模型。

  • 开发者使用 Deepmark AI,让多个 LLM 模型对问答或情感分析等任务运行数百或数千次迭代。

  • 团队使用 Deepmark AI 评估 GenAI 性能指标,例如问答准确率、文本分类准确率、PII 识别准确率、命名实体识别(NER)准确率、摘要质量(相关性)和情感分析准确率。

  • 团队使用 Deepmark AI 估算在不同 GenAI 模型上运行其 AI 应用的成本。

  • 开发者使用 Deepmark AI 评估延迟并识别生成式 AI API 中的低效之处。

  • 团队使用 Deepmark AI 跟踪数百到数千次请求中的失败率。

  • 开发者使用 Deepmark AI 将生成输出与相关性评估的期望标准进行比较。

  • 团队使用 Deepmark AI 评估模型在各种条件下的可靠性,并捕捉潜在故障点。

用户评论

还没有评论,来分享你的使用体验吧