Metodología de investigación · 2026 R1

Cómo comparará Tovaki modelos de vídeo con IA sin elegir antes al ganador

Este es el contrato público y legible por máquinas de una prueba prevista con cuatro modelos. Fija qué se genera, cómo cuentan los fallos, qué ven los revisores y qué debe publicarse antes de permitir una afirmación de calidad.

Preparado, no ejecutado2026-08-25 · Tovaki Research

No se ha completado ninguna generación, puntuación humana, resultado ni clasificación. La metodología se publica antes del resultado.

4integraciones de modelos
6tipos de tareas
24celdas de primera toma
3revisores ciegos

¿Qué mide este benchmark?

Comprueba si tomas cortas conservan personas y objetos, completan un cambio en el orden pedido, mantienen legible la geografía, muestran contacto y reacción, y entregan sonido sincronizado escuchado directamente. Es una muestra de seis tareas en la integración de Tovaki, no un ranking universal de proveedores.

Compromiso de versión del protocolo

El resumen cubre cada byte del protocolo privado, incluidos prompts exactos, lista de modelos, pesos, reintentos y puerta de publicación. Una divulgación posterior con el mismo resumen demuestra que el archivo no cambió; el hash por sí solo no demuestra que se ejecutó la prueba.

SHA-256 · Resumen del protocolo

3efa03ed5fb305054069571bee501e0a06cb247e3334530c9dd7820cff8840d7
Abrir el JSON legible por máquinasAbrir el Markdown para agentes

Lo que permanece fijo

Todos los candidatos reciben la misma exigencia creativa dentro de cada tarea. No se corrigen diferencias con prompts específicos ni eligiendo una repetición más bonita.

Seis segundos

Todas las solicitudes usan la misma duración.

9:16 · nivel Tovaki 720p

Un formato vertical y un nivel declarado de integración.

Audio nativo en cada celda

El audio opcional se activa y el audio permanente sigue activo; no se mezclan condiciones mudas y con sonido.

Un prompt exacto por tarea

Sin reescritura por proveedor, mejora oculta ni reintento creativo.

Un proxy de revisión normalizado

Se conservan los originales y todos reciben la misma entrega H.264/AAC.

Etiquetas A–D por tarea

Una letra no identifica permanentemente al mismo modelo entre tareas.

Seis tareas, no una sola imagen bonita

El conjunto cubre deliberadamente trabajo luminoso, cálido, cómico, cinético, táctil, observacional y poético para que una estética estrecha no represente toda la capacidad cinematográfica.

  1. Relación y entrega de un objeto
  2. Diálogo y reacción del oyente
  3. Geografía de acción en movimiento
  4. Contacto y recuperación de material
  5. Cámara continua e identidad
  6. Causalidad surrealista luminosa

Ocho dimensiones visibles

Los revisores puntúan de 0 a 5 en pasos de 0,5. Los pesos suman 100; un fotograma bonito no oculta fallos de tiempo, contacto, sonido o causalidad.

Fidelidad al prompt

15/100

Aparecen personas, objetos, acciones, orden, entorno y prohibiciones solicitados.

Estabilidad temporal

15/100

El movimiento progresa sin parpadeos, sustituciones ni saltos temporales inexplicables.

Identidad de sujetos y objetos

15/100

Las mismas personas y objetos rastreables persisten durante movimiento y oclusión.

Movimiento y contacto físico

15/100

Aproximación, contacto, fuerza, transferencia, liberación y respuesta son legibles.

Cámara y geografía

10/100

El movimiento revela el evento y mantiene comprensibles dirección y espacio.

Interpretación y reacción

10/100

Mirada, pausa, escucha y reacción siguen al evento que las provoca.

Finalización sonora

10/100

Voz y efectos son audibles, sincronizados, coherentes en perspectiva y escuchados directamente.

Valor útil de montaje

10/100

La toma cumple su función narrativa sin esconder el evento importante.

Flujo de revisión ciega

  1. Congelar y aprobar

    Verificar el resumen y obtener un límite de créditos con responsable antes de solicitar nada.

  2. Generar y registrar huellas

    Registrar primera toma, fallo técnico, reintento, crédito real, fecha y SHA-256.

  3. Normalizar y escuchar

    Crear un proxy anónimo por celda y escuchar directamente todo el audio.

  4. Puntuar a ciegas

    Tres revisores usan órdenes distintos sin nombres, proveedores, precios, metadatos ni mapa privado.

  5. Bloquear y revelar

    Se bloquean por hash las tres tarjetas antes de revelar identidad; un cambio invalida el análisis.

Un resultado feo no justifica reintentar

Cada celda permite un solo reintento por error del proveedor, timeout, archivo dañado, duración o resolución devuelta incorrecta, o pista de audio obligatoria ausente. Una composición débil, interpretación extraña o historia fallida permanece como evidencia.

Primera pasada prevista: 1620 créditos Tovaki. Techo absoluto si cada celda necesita un reintento técnico permitido: 3240. La generación no está autorizada hasta que un responsable apruebe un límite.

Evidencia pública sin romper la prueba ciega

Público ahora

Alcance, ajustes, categorías, pesos, reintentos, bloqueo, presupuesto, lenguaje de publicación y resumen del protocolo.

Solo tras bloquear puntuaciones

Prompts exactos, lista de modelos, hashes de muestras, fallos redactados, puntuaciones anónimas, créditos reales y limitaciones.

Permanece privado

Identidad personal de revisores sin consentimiento, credenciales o tokens y metadatos privados innecesarios para reproducir el resultado.

Puerta de publicación

  • Todavía no hay resultado de calidad. Coste y límites técnicos no sustituyen una clasificación.
  • Toda conclusión deberá decir “en esta muestra de seis tareas de la integración de Tovaki”.
  • Si los dos primeros difieren menos de 3 puntos sobre 100, deberá decir que no son distinguibles en esta muestra.
  • “Mejor modelo de vídeo con IA”, “ganador para todo” y “modelo viral” siguen siendo afirmaciones prohibidas.

Fundamentos metodológicos

Estas fuentes informan controles concretos; no respaldan a Tovaki ni convierten este pequeño estudio en su benchmark.