uno-s1-duel logo

uno-s1-duel

新上架免费

由零样本 0.8B 决策模型(类型化选项,无文本生成)打 UNO,对阵启发式算法和真人——对随机对手 22/30,带概率条的实时浏览器牌桌。RLCard + Python。

速览信息

定价
Free
0
浏览
0
收藏
收录时间
2026年10月
官方网址
github.com

工具概览

概览

UNO S1 Duel 是一个研究项目,让 StartLux-Decision-0.8B-Q8_0(被描述为一个类型化决策模型,不生成文本,每个问题只做一次前向传播)与真实游戏对战,以找出它在哪里获胜、打平和失败。其主要报告结果是基于 RLCard 引擎的双人 UNO,对随机对手赢 22/30,对手写的战术型对手赢 17/30。零样本 0.8B 模型每步约 35–85ms,打出教科书式的 UNO,与书面战术战平,并在浏览器牌桌上为真人设有席位。 该仓库描述了一种把模型用作预先计算结论的裁判、而非推理者的模式。它用完整的句子叙述状态,为每个选择给出后果选项,在 S1 评判之前先用廉价的启发式缩小候选范围,并把规则保留在代码中。模型不跟踪历史;由 harness 负责。文中指出,违背这些做法会导致退化为均匀噪声。 项目包含跨 UNO、Trivia buzzer、Battlesnake、Blackjack、Minesweeper、Crafter 和 2048 等游戏的评分卡,并刻意保留负面结果以划定能力边界。它提供运行说明,以及玩家、对局、审计、Web 牌桌、观战工具和测试的布局。决策使用 StartLux-Decision-0.8B-Q8_0,采用 CC BY-NC 4.0 许可用于研究,而代码是作者自己的。

功能特点

  • AI 助手
  • 自然语言界面
  • 工作流自动化

相关标签

ai-agent
card-game
decision-model
game-ai
llm
ai
ai assistant
automation

应用场景

  • 团队用 UNO S1 Duel 让类型化决策模型与真实游戏对战,找出它在哪里获胜、打平和失败。

  • 团队用它与随机对手和启发式对手进行带种子的 UNO 对局。

  • 团队用它在浏览器牌桌上为真人设置席位。

  • 团队用它直播 S1 对启发式算法的对局。

  • 团队用它对 30 局游戏审计 UNO 规则。

  • 团队用它运行单元测试和 hypothesis 属性测试。

  • 团队用它通过内置的启发式回退,在没有 S1 服务器的情况下运行对局。

用户评论

还没有评论,来分享你的使用体验吧