ia

El ex-intern de Alibaba que levantó $300 MDD para decidir qué tan buenos son tu Cursor o Copilot

ia · 6 min de lectura

El ex-intern de Alibaba que levantó $300 MDD para decidir qué tan buenos son tu Cursor o Copilot

UniPat AI vale $2.5 mil millones de dólares y Alibaba acaba de apostar fuerte en ella. Lo que hacen es simple pero crítico: decirte si los coding agents que usas realmente hacen lo que dicen.

El ex-intern de Alibaba que levantó $300 MDD para decidir qué tan buenos son tu Cursor o Copilot

Imagínate hacer tu internship en uno de los laboratorios de IA más importantes de China y salir con la idea que te hace multimillonario en menos de un año. Eso pasó. Li Kuan hizo su internship en Tongyi, la división de IA de Alibaba, y de ahí nació UniPat AI: una startup fundada a finales de 2025 que hoy vale $2.5 mil millones de dólares y acaba de cerrar una ronda de $300 millones liderada por Alibaba… por Alibaba. Sus propios ex-jefes.

¿Qué hace UniPat exactamente?

No construyen el próximo ChatGPT ni un coding agent que compita con Cursor. UniPat está en un negocio mucho más sutil y, la neta, más importante: decirte si los agentes de IA realmente pueden hacer lo que dicen que pueden.

La empresa desarrolla dos cosas clave:

  1. Benchmarks y escenarios de evaluación: pruebas diseñadas para medir a los coding agents (los que escriben código por ti), los browser agents (los que navegan la web de forma autónoma) y los modelos multimodales que entienden imágenes y texto al mismo tiempo.

  2. Datos humanos de entrenamiento: datos anotados por personas reales, exactamente lo que los laboratorios de IA necesitan y cada vez les cuesta más conseguir.

Básicamente, UniPat es el árbitro del mundo de los agentes de IA. Si un modelo dice que resuelve el 80% de los bugs reales de GitHub, son ellos quienes confirman o desmienten esa cifra.

El negocio de romper IAs

Los coding agents como Cursor, GitHub Copilot o Claude Code llevan meses compitiendo entre sí con benchmarks propios. Cada quien publica sus números y dice que es el mejor. El problema es que si Uber ya quemó todo su presupuesto de IA en 4 meses usando esas herramientas, alguien tiene que hacer la auditoría de verdad.

Ahí entra UniPat. Su producto estrella se llama Monthly-SWEBench: un benchmark que se actualiza mensualmente con 100 tareas nuevas sacadas de pull requests reales de GitHub. No son tareas inventadas en un laboratorio; son bugs y features reales que programadores humanos ya resolvieron en producción.

El proceso es ridículo de riguroso. Según la documentación del benchmark en su sitio, parten de unas 10,000 PRs en crudo cada mes y las filtran por un pipeline de seis etapas:

  • Repositorios en Python, Go, C++, Java, Rust, TypeScript y JavaScript
  • PRs que incluyan cambios de pruebas y más de 30 líneas modificadas
  • Verificación de que el código pasa de “falla” a “pasa” con el fix correcto
  • Alineación de instrucciones para que no haya requerimientos ocultos
  • Rotación completa cada mes para eliminar overfitting

De 10,000 quedan 100. Solo las mejores. Significa que ningún modelo puede “memorizar” el benchmark porque cada mes son tareas completamente nuevas.

¿Quién está ganando actualmente?

Los resultados de junio 2026 del Monthly-SWEBench en la categoría de coding agents:

ModeloScore GeneralBugsFeatures
GPT-5.5-High76%80%72%
Claude-Opus-4.8-XHigh69%70%68%
GLM-5.2-Max65%s/ds/d

Dato que no es menor: GLM-5.2-Max es un modelo chino de Zhipu AI. La competencia ya no es solo entre OpenAI y Anthropic; hay tres jugadores distintos en el podio.

Por qué Alibaba puso $300 millones aquí

Alibaba no está invirtiendo en UniPat por carita. Tiene estrategia calculada:

Primero, Alibaba compite directamente con OpenAI en el mercado de coding agents con su familia de modelos Qwen, que ya superó los 3 mil millones de descargas en agosto 2026 según Fortune, pasando a Meta y Google en adopción de modelos open source. Si Qwen quiere convencer a empresas de que su modelo es mejor que GPT-5.5, necesita benchmarks independientes que lo respalden. UniPat puede ser ese árbitro creíble, o al menos eso espera Alibaba.

Segundo, UniPat también genera datos humanos de entrenamiento, que es exactamente lo que todo laboratorio de IA necesita desesperadamente. Los datos de buena calidad se están convirtiendo en el commodity más escaso del sector.

La ronda también atrajo a otros gigantes: Tencent, HongShan (antes Sequoia China) y Jinqiu Fund, el fondo de ByteDance. Básicamente todos los grandes de China apostando al mismo caballo de infraestructura.

Esto no es casualidad. Como documentamos en el análisis del Stanford AI Index 2026, la infraestructura de evaluación se está volviendo tan crítica como los propios modelos. No sirve de nada tener el modelo más chingón si no puedes demostrar que lo es con rigor científico.

Lo que esto significa si usas Cursor o Copilot

Si eres dev en México y usas algún AI coding agent, UniPat afecta directamente tus decisiones de herramientas aunque nunca hayas oído el nombre.

La realidad es que muchos de los benchmarks que las empresas usan para vender sus productos son controlados, con tareas que ya conocen, o simplemente desactualizados. Monthly-SWEBench es diferente porque los modelos no pueden prepararse de antemano; las tareas son de PRs del mes anterior en repositorios reales.

Práctico para ti: la próxima vez que una empresa diga “nuestro agente resuelve el X% de las tareas de SWE-bench”, busca si ese número viene de un benchmark estático o de uno mensual como el de UniPat. La diferencia es enorme.

Y no te pierdas el ángulo de los browser agents: UniPat también evalúa agentes que navegan la web y ejecutan acciones cotidianas de forma autónoma. Si tu empresa está explorando automatización de procesos con IA, este es el tipo de infraestructura que va a decidir qué herramienta usar.

La pregunta que nadie está haciendo

UniPat no está sola en este espacio de datos para IA. Es parte de un boom silencioso de startups de infraestructura: las que no construyen el modelo ni la app final, sino la plomería que hace funcionar el ecosistema. Y en ese nicho, empresas como Manycore también están haciendo dinero vendiéndole datos a robots industriales.

El dato que más me llama la atención: UniPat fue fundada a finales de 2025 y en menos de un año ya vale $2.5B. Ese ritmo dice más sobre el estado del mercado de infraestructura de IA que cualquier análisis.

Pero hay una pregunta que nadie está respondiendo bien todavía: ¿puede UniPat mantener su neutralidad siendo financiada por Alibaba, Tencent y ByteDance, tres empresas cuyos modelos está evaluando? Es re piola que el benchmark sea abierto hoy, pero esa tensión va a crecer conforme los modelos chinos suban en el ranking.

Por ahora, el Monthly-SWEBench sigue siendo de los más confiables del sector. Pero vale la pena seguirlo de cerca.

¿Usas coding agents en tu trabajo y le das credibilidad a los benchmarks que publican? ¿O ya aprendiste a no creerles nada hasta verlo en producción? Cuéntanos abajo.

Fuentes

Comentarios

No te pierdas ningún post

Recibe lo nuevo de Al Chile Tech directo en tu correo. Sin spam.

También te puede interesar