Elección de un modelo para clasificar anuncios
Quería saber qué modelo podía convertir anuncios desordenados en datos estructurados fiables sin encarecer innecesariamente una tarea sencilla de clasificación de texto.
Una prueba fija para cuatro modelos
Di a cada modelo los mismos 100 anuncios escritos a mano, las mismas instrucciones, el mismo esquema JSON y el mismo sistema de puntuación. Desactivé fotos, búsqueda, grounding y herramientas externas para aislar la clasificación de texto.
- Qué contaba como correcto
- Un caso estricto exigía acertar categoría, identidad, términos de búsqueda, atributos de valor, soporte de mercado y uso del precio.
- Qué se mantuvo igual
- El texto, las instrucciones, el contrato de salida y la puntuación fueron compartidos. El razonamiento y muestreo usaron los valores predeterminados de cada proveedor.
- Qué no cubrió la prueba
- El estudio no evaluó fotos, investigación web, búsqueda de ventas comparables, valoración final ni ganancia real.
La primera comparación de modelos
Luna lideró la precisión estricta y semántica y fue la opción medida más económica. Gemini Lite fue más rápido en promedio, pero aprobó 38 casos menos y tuvo un P95 ligeramente mayor.
| Modelo | Casos estrictos | Puntuación semántica | Costo / 1K | Promedio | P95 | Tokens / caso |
|---|---|---|---|---|---|---|
| Lunagpt-5.6-luna | 81/100 | 98.05% | $0.7929 | 6.28s | 10.35s | 1514.49 |
| Gemini 3.7gemini-3.7-flash | 54/100 | 95.10% | $2.8909 | 8.06s | 20.39s | 1417.71 |
| Gemini 3.6gemini-3.6-flash | 56/100 | 95.44% | $3.5910 | 11.54s | 40.06s | 1604.41 |
| Gemini Litegemini-3.5-flash-lite | 43/100 | 93.47% | $0.8795 | 2.51s | 11.52s | 1063.29 |
Contabilidad de la ejecución
| Modelo | Tokens de entrada | Entrada en caché | Tokens de salida | Tokens de razonamiento | Gasto de la prueba |
|---|---|---|---|---|---|
| Lunagpt-5.6-luna | 102,452 | 0 | 48,997 | 26,037 | $0.079287 |
| Gemini 3.7gemini-3.7-flash | 80,850 | 0 | 60,921 | 30,113 | $0.289091 |
| Gemini 3.6gemini-3.6-flash | 80,850 | 0 | 79,591 | 60,662 | $0.359104 |
| Gemini Litegemini-3.5-flash-lite | 80,850 | 0 | 25,479 | 0 | $0.087953 |
El punto de partida práctico
Elegí Luna para esta ruta de texto porque produjo los resultados más sólidos al menor costo medido. La siguiente fase se centró en mejorar su prompt.
Resultado medido: 81/100 casos estrictos · 98.05% de puntuación semántica · $0.79 por 1,000 clasificaciones · 10.35s de latencia P95.
Límites de la primera prueba
La primera prueba fue útil, pero era pequeña y controlada. Estos números describen cuatro ejecuciones concretas. No son una clasificación permanente de los modelos.
- Fue una prueba temprana
- Todavía no registraba huellas del prompt y del evaluador. Los resultados, controles, tokens, costo y latencia siguen siendo útiles, pero no compararía estas puntuaciones directamente con el estudio posterior del prompt v3.
- El tiempo no estaba controlado
- Luna ejecutó cinco solicitudes a la vez y Gemini 3.7 ejecutó dos. Los tiempos muestran cómo se comportaron estas pruebas, no qué proveedor alcanza el mayor rendimiento posible.
- El costo es una estimación
- Los modelos completaron 400 llamadas entre las cuatro ejecuciones. Aplicar las tarifas Standard publicadas al uso registrado da un total aproximado de $0.82. Puede faltar cualquier cargo por solicitudes fallidas.
- Los casos fueron diseñados
- Los 100 anuncios eran casos sintéticos y etiquetados a mano. Sirven para encontrar fallos de clasificación, pero no representan la mezcla normal de anuncios en producción.