Fine-Tuning de Modelos como Servicio Freelance

Fine-tuning de modelos como servicio freelance: qué, cómo y cuánto cobrar

Resumen clave: Coste: 0,15 €/contrato. Fine-tuning (2 días): QLoRA sobre Llama 3.3 8B con Unsloth. 3 epochs, learning rate 2e-4, LoRA rank 16. Ahorro: 98,7% en coste de inferencia. Deployment (2 días): vLLM en una GPU A10G de AWS (0,50 €/hora). El fine-tuning amplifica los sesgos del dataset. Para más contexto, te recomendamos leer sobre modelos de IA Locales para Empresas Llama, Qwen.

El fine-tuning (ajuste fino) consiste en adaptar un modelo de lenguaje preentrenado a un dominio o tarea específica usando un dataset propio. En 2026, no es solo para grandes empresas: cualquier startup con 200-500 ejemplos puede fine-tunar Llama 3.3 o Mistral para su caso de uso, y lo hace.

El problema: la mayoría de los equipos de producto no saben preparar el dataset, elegir la técnica de fine-tuning ni evaluar el resultado. Ahí es donde entra el freelance especializado.

Cuándo tiene sentido el fine-tuning (y cuándo no)

Cuándo sí

  • El modelo base no sigue el formato que necesitas (JSON estructurado, código específico, formato legal)
  • Necesitas respuestas en un tono o estilo consistente que el system prompt no logra
  • El dominio tiene vocabulario especializado (médico, legal, financiero) que el modelo base no domina
  • Quieres reducir costes: un modelo fine-tuned de 8B parámetros puede igualar a GPT-4o en tu tarea específica a un coste 10-15x menor

Cuándo no

  • No tienes al menos 200 ejemplos de calidad (pregunta-respuesta, instruction-response)
  • El RAG ya resuelve tu problema (antes de fine-tunar, prueba RAG)
  • Necesitas el modelo para tareas muy diversas (el fine-tuning especializa, no generaliza)
  • No tienes forma de evaluar si el modelo mejoró o no

Técnicas de fine-tuning que necesitas dominar

Full fine-tuning vs parameter-efficient

El full fine-tuning actualiza todos los parámetros del modelo. Es caro (necesitas GPUs con mucha VRAM) y arriesgado (puedes perder capacidades generales del modelo).

El parameter-efficient fine-tuning (PEFT) actualiza solo una fracción de los parámetros. Las técnicas más usadas:

Técnica Parámetros entrenables VRAM necesaria Cuándo usarla
LoRA 0.1-1% 1x A100 (80GB) o 2x 4090 Caso general, la opción por defecto
QLoRA (4-bit quantized) 0.1-1% 1x 4090 (24GB) Presupuesto limitado, prototipado rápido
IA3 <0.1% Similar a LoRA Menor footprint, menos flexible
Adapter layers 1-5% Similar a LoRA Multi-task con adapters intercambiables

Herramientas

  • Unsloth: fine-tuning 2x más rápido que Hugging Face TRL, compatible con LoRA/QLoRA. La opción más eficiente en 2026.
  • Hugging Face TRL: estándar de la industria, documentación extensa, integration con HF Hub.
  • Axolotl: wrapper sobre TRL que simplifica la configuración.
  • OpenAI fine-tuning API: si el cliente usa solo OpenAI y no quiere gestionar infraestructura. Limitado a modelos OpenAI.

Tarifas para fine-tuning freelance

Servicio Tarifa proyecto (€) Duración
Evaluación de viabilidad (¿fine-tuning o RAG?) 1.500 – 3.000 3-5 días
Preparación de dataset + fine-tuning LoRA 3.000 – 8.000 1-2 semanas
Fine-tuning + evaluación + deployment 6.000 – 15.000 2-4 semanas
Pipeline completo (dataset + training + serving + monitoring) 12.000 – 30.000 4-8 semanas

Costes de infraestructura (a cargo del cliente)

Configuración Coste por hora Coste entrenamiento típico
1x A100 (RunPod/Lambda) 1,50 – 2,50 € 15 – 60 €
2x A100 3,00 – 5,00 € 30 – 120 €
1x H100 3,00 – 4,50 € 20 – 80 €
OpenAI fine-tuning (gpt-4o-mini) ~0,02 €/1K tokens training Variable

Un fine-tuning de Llama 3.3 8B con QLoRA sobre 2.000 ejemplos cuesta entre 5 y 15 € de GPU en RunPod. No es el coste principal; lo caro es el dataset y la evaluación.

Calcula tu tarifa con la calculadora.

Un proyecto real de fine-tuning freelance

Cliente: empresa española de legaltech que quiere un modelo que extraiga cláusulas de contratos de alquiler en formato JSON estructurado.

Problema: GPT-4o lo hace bien pero cuesta 0,15 € por contrato. Procesan 5.000 contratos/mes = 750 €/mes solo en inferencia. Quieren reducir costes.

Proceso:

  1. Dataset (3 días): recopilan 500 contratos anotados manualmente con las cláusulas extraídas. Formato: instruction (contrato) + response (JSON con cláusulas). Limpieza de datos: eliminan contratos con errores de OCR, normalizan formato.
  1. Baseline (1 día): evalúan GPT-4o con 100 contratos de test. Accuracy: 87%. Coste: 0,15 €/contrato.
  1. Fine-tuning (2 días): QLoRA sobre Llama 3.3 8B con Unsloth. 3 epochs, learning rate 2e-4, LoRA rank 16. Coste GPU: ~8 €. Duration: 45 minutos en 1x A100.
  1. Evaluación (2 días): el modelo fine-tuned alcanza 84% de accuracy en el test set (3 puntos menos que GPT-4o). Coste de inferencia con vLLM: 0,002 €/contrato. Ahorro: 98,7% en coste de inferencia.
  1. Deployment (2 días): vLLM en una GPU A10G de AWS (0,50 €/hora). Sirve ~50 contratos/minuto.

Resultado: el cliente acepta perder 3 puntos de accuracy a cambio de reducir el coste de 750 €/mes a ~10 €/mes. El proyecto se paga solo en el primer mes.

Tarifa facturada: 6.000 € (10 días de trabajo).

Errores en proyectos de fine-tuning

  1. No evaluar contra baseline. Si no mides el modelo base antes y después del fine-tuning, no puedes demostrar que mejoró. Y a veces empeora (catastrophic forgetting).
  1. Dataset de baja calidad. El fine-tuning amplifica los sesgos del dataset. Si tus ejemplos de entrenamiento tienen errores, el modelo los aprenderá. Dedica el 60% del tiempo del proyecto al dataset.
  1. No usar un held-out test set. Si evalúas con los mismos datos que entrenaste, los resultados no son válidos. Separa 20% para test antes de empezar.
  1. Sobre-entrenar (too many epochs). Más epochs no significa mejor modelo. El overfitting en fine-tuning es fácil de detectar: el loss de validación sube mientras el de entrenamiento baja. Usa early stopping.
  1. No considerar RAG primero. Si el problema es acceso a información, RAG es más rápido, más barato y más fácil de mantener. Fine-tuning es para estilo, formato y dominio, no para conocimiento.

Más sobre modelos de IA en la guía de LLM Engineer y la guía de RAG developer. Para más contexto, te recomendamos leer sobre notion para gestión freelance: configuración completa..


¿Te está sirviendo SeniorStack? Añádenos a tus fuentes preferidas en Google y nos verás destacados en tus resultados y respuestas de IA.

Deja un comentario