eday.studio
Todos los informes

Elección de un modelo para clasificar anuncios

Quería saber qué modelo podía convertir anuncios desordenados en datos estructurados fiables sin encarecer innecesariamente una tarea sencilla de clasificación de texto.

Una prueba fija para cuatro modelos

Di a cada modelo los mismos 100 anuncios escritos a mano, las mismas instrucciones, el mismo esquema JSON y el mismo sistema de puntuación. Desactivé fotos, búsqueda, grounding y herramientas externas para aislar la clasificación de texto.

Qué contaba como correcto
Un caso estricto exigía acertar categoría, identidad, términos de búsqueda, atributos de valor, soporte de mercado y uso del precio.
Qué se mantuvo igual
El texto, las instrucciones, el contrato de salida y la puntuación fueron compartidos. El razonamiento y muestreo usaron los valores predeterminados de cada proveedor.
Qué no cubrió la prueba
El estudio no evaluó fotos, investigación web, búsqueda de ventas comparables, valoración final ni ganancia real.

La primera comparación de modelos

Luna lideró la precisión estricta y semántica y fue la opción medida más económica. Gemini Lite fue más rápido en promedio, pero aprobó 38 casos menos y tuvo un P95 ligeramente mayor.

ModeloCasos estrictosPuntuación semánticaCosto / 1KPromedioP95Tokens / caso
Lunagpt-5.6-luna81/10098.05%$0.79296.28s10.35s1514.49
Gemini 3.7gemini-3.7-flash54/10095.10%$2.89098.06s20.39s1417.71
Gemini 3.6gemini-3.6-flash56/10095.44%$3.591011.54s40.06s1604.41
Gemini Litegemini-3.5-flash-lite43/10093.47%$0.87952.51s11.52s1063.29

Contabilidad de la ejecución

ModeloTokens de entradaEntrada en cachéTokens de salidaTokens de razonamientoGasto de la prueba
Lunagpt-5.6-luna102,452048,99726,037$0.079287
Gemini 3.7gemini-3.7-flash80,850060,92130,113$0.289091
Gemini 3.6gemini-3.6-flash80,850079,59160,662$0.359104
Gemini Litegemini-3.5-flash-lite80,850025,4790$0.087953
Los tokens de salida incluyen los de razonamiento. Calculé el gasto con las llamadas exitosas y las tarifas Standard publicadas durante el estudio. Las cifras no están conciliadas con una factura.

El punto de partida práctico

Elegí Luna para esta ruta de texto porque produjo los resultados más sólidos al menor costo medido. La siguiente fase se centró en mejorar su prompt.

Resultado medido: 81/100 casos estrictos · 98.05% de puntuación semántica · $0.79 por 1,000 clasificaciones · 10.35s de latencia P95.

Límites de la primera prueba

La primera prueba fue útil, pero era pequeña y controlada. Estos números describen cuatro ejecuciones concretas. No son una clasificación permanente de los modelos.

Fue una prueba temprana
Todavía no registraba huellas del prompt y del evaluador. Los resultados, controles, tokens, costo y latencia siguen siendo útiles, pero no compararía estas puntuaciones directamente con el estudio posterior del prompt v3.
El tiempo no estaba controlado
Luna ejecutó cinco solicitudes a la vez y Gemini 3.7 ejecutó dos. Los tiempos muestran cómo se comportaron estas pruebas, no qué proveedor alcanza el mayor rendimiento posible.
El costo es una estimación
Los modelos completaron 400 llamadas entre las cuatro ejecuciones. Aplicar las tarifas Standard publicadas al uso registrado da un total aproximado de $0.82. Puede faltar cualquier cargo por solicitudes fallidas.
Los casos fueron diseñados
Los 100 anuncios eran casos sintéticos y etiquetados a mano. Sirven para encontrar fallos de clasificación, pero no representan la mezcla normal de anuncios en producción.