研究方法 · 2026 R1

Tovaki 如何在不预选赢家的前提下比较 AI 视频模型

这是四模型计划测试的公开机器可读合同。它先固定生成范围、失败计入方式、评审可见内容与发布门,再允许任何质量结论出现。

已准备,尚未执行2026-08-25 · Tovaki Research

尚未完成供应商生成、人工评分、结果或排名。本页先公开方法,再等待证据。

4个模型接入
6类不同任务
24个首轮单元
3位盲评人

这套基准测量什么?

它检查短视频能否保持人物与物件身份、按正确顺序完成变化、维持可读的镜头地理、表现真实接触与反应,并交付经过完整直接监听的同步声音。它只是六任务的 Tovaki 接入样本,不是供应商通用排行榜。

协议版本承诺

下方摘要覆盖完整私人协议的每一个字节,包括精确提示词、本轮模型名单、权重、重试和发布门。日后披露的文件若摘要相同,可证明协议没有变化;摘要本身不能证明实验已经执行。

SHA-256 · 协议摘要

3efa03ed5fb305054069571bee501e0a06cb247e3334530c9dd7820cff8840d7
打开机器可读 JSON打开 Agent 友好 Markdown

保持不变的条件

每个任务内,所有候选接收同一创作要求。不能用模型专属提示词或只挑更漂亮的重跑结果修饰差异。

统一 6 秒

每次请求使用同一目标时长。

9:16 · Tovaki 720p 档

统一竖屏格式与公开接入分辨率档。

所有单元都使用原生音频

可选音频会开启,强制音频保持开启;静音与有声条件不会混在一起。

每任务一条精确提示词

不为供应商改写,不做隐藏增强,不允许创意性重试。

统一评审代理

保留原始文件;评审只接收同一 H.264/AAC 配方。

任务内独立 A–D

同一个匿名字母不会跨任务永久对应某个模型。

六类任务,而不是一张漂亮画面

任务刻意覆盖明亮、温暖、喜剧、动感、触感、观察与诗意风格,避免一种狭窄审美替代电影制作能力。

  1. 关系与物件交接
  2. 对白与倾听反应
  3. 运动动作地理
  4. 材质接触与恢复
  5. 连续运镜与身份
  6. 明亮超现实因果

八个公开评分维度

评审使用 0–5 分、0.5 步长。权重总计 100;一张漂亮静帧无法掩盖时间、接触、声音或故事因果错误。

提示词遵循

15/100

要求的人物、物件、动作、顺序、场景和禁止项都实际出现。

时序稳定

15/100

运动发展过程中没有闪烁、突然替换或无法解释的时间断裂。

人物与物件身份

15/100

人物和可追踪物件在运动、遮挡前后保持同一身份。

运动与物理接触

15/100

接近、接触、受力、转移、释放和物理反馈都清楚可读。

运镜与空间地理

10/100

镜头服务事件,人物方向和空间关系保持可理解。

表演与反应

10/100

视线、停顿、倾听和反应发生在引发它们的事件之后。

声音完成度

10/100

对白与音效可听、同步、空间一致,并经过完整直接监听。

剪辑可用价值

10/100

镜头无需遮住关键事件就能完成预定的叙事工作。

匿名盲评流程

  1. 冻结并审批

    核对协议摘要,并在任何请求前取得具名积分上限审批。

  2. 生成并留指纹

    记录每次首发、技术失败、重试、实扣积分、时间戳和 SHA-256。

  3. 统一代理并监听

    每个单元生成一个匿名代理,完整直接监听全部音轨。

  4. 匿名评分

    三位评审使用不同随机顺序,看不到模型、厂商、价格、元数据或私人映射。

  5. 先锁分,再揭盲

    身份公开前锁定三份评分卡哈希;锁分后修改会使分析失效。

不好看不是重试理由

每个单元最多重试一次,且只限供应商错误、超时、文件损坏、返回错误时长或分辨率、缺少必要音轨。构图弱、表演怪或故事没有完成,都必须保留为证据。

首轮计划 1620 Tovaki 积分。若每个单元都发生一次允许的技术失败,协议绝对上限为 3240。具名负责人批准前,生成仍未获授权。

公开证据,但不破坏盲测

现在公开

范围、设置、任务类别、评分权重、重试规则、锁分规则、预算上限、发布语言和协议摘要。

锁分后才公开

精确提示词、本轮模型名单、样本哈希、脱敏失败台账、匿名原始评分、实际积分和局限。

持续保密

未经同意的评审个人身份、供应商凭证或令牌,以及复现实验不需要的私人供应商元数据。

发布门

  • 当前没有质量结果。成本与技术限制不能代替质量排名。
  • 未来任何结论都必须写明“在这组六任务的 Tovaki 接入样本中”。
  • 前两名总分差距小于 3/100 时,必须写“本样本无法区分”。
  • “最好的 AI 视频模型”“适合所有用途的冠军”和“必爆模型”始终属于禁止主张。

方法论基础

以下来源只影响具体控制项;它们不为 Tovaki 背书,也不会把这项小型接入研究变成对应论文的基准。