Saltar al contenido

Infraestructura y precios desde operaciones

Todo lo que hemos publicado en Infraestructura y precios, leído desde operaciones: qué cambia para una empresa B2B de 10 a 200 personas.

  1. Destacado

    Salesforce abandona el precio por asiento fijo mientras los agentes de IA toman el mando de la interfaz

    En Dreamforce, Salesforce confirmó que abandona el precio por puesto y avanza hacia un mix de precio por consumo, por resultado de transacción y por resultado de negocio, ya que los agentes de IA (vía Claude, ChatGPT, Slack o su propio Agentforce) ahora ejecutan tareas que antes requerían que personas navegaran múltiples aplicaciones. El CEO Marc Benioff dijo que ningún modelo único sirve para la mayoría de los clientes, así que los equipos de ventas ahora tienen libertad para negociar los términos caso por caso.

    Qué cambia en operaciones — Si tu stack de ventas, soporte u operaciones incluye Salesforce, los supuestos de presupuesto basados en costos fijos por puesto pueden dejar de aplicar: un cambio hacia precios por consumo o por resultado significa que tu factura de CRM podría escalar según el uso o según el valor que genere un agente de IA, no según la cantidad de empleados. Antes de renovar o ampliar un contrato con Salesforce, pregunta explícitamente qué modelo de precio está sobre la mesa (por puesto, por consumo, por resultado de transacción, por resultado de negocio) y modela tus costos bajo cada uno, ya que el propio proveedor dice que ya no existe un modelo por defecto. Las empresas que operan con equipos de ventas o soporte reducidos y que dependen de agentes para atravesar múltiples sistemas (según la fuente, integraciones al estilo Salesforce, SAP o Workday) también deberían vigilar el impacto en costos si el uso de agentes se dispara en periodos de alta demanda, ya que el precio por consumo puede ser menos predecible que una tarifa plana por usuario.

  1. OpenAI y Anthropic recortan los precios de sus APIs el mismo día

    Si tu bot de soporte, asistente de ventas o automatización interna corre sobre las APIs de GPT o Claude, esto es una palanca de coste directa: GPT-6 Luna a 0,10 $/M tokens de entrada cuesta aproximadamente una veinteava parte de Claude Opus 5.5, y los descuentos en tokens en caché de Opus 5.5 importan mucho si tus agentes mantienen conversaciones largas de varios turnos donde la mayoría de los tokens son contexto repetido. Antes de renovar cualquier contrato con un proveedor de IA o de fijar la elección de modelo para una nueva automatización, recalcula el coste: un flujo de trabajo que parecía caro con los precios de GPT-5.6 u Opus 5.0 puede ahora ser lo bastante barato como para ampliarlo a más casos de uso, y una cola de soporte que hoy se enruta a un modelo premium podría funcionar igual de bien con uno más económico.

  1. Grok 4.6 llega a Amazon Bedrock con guardrails y disyuntivas de precio entre regiones

    Para una empresa de 10 a 200 personas que corre agentes de ventas o soporte sobre AWS Bedrock, esto es una decisión de arquitectura real, no solo un modelo nuevo para probar. Guardrails, registro de invocaciones y prompt caching ahora funcionan en el endpoint bedrock-runtime, que es el que conviene usar si se necesita un límite de política alrededor de un agente desatendido y un rastro de auditoría de lo que efectivamente hizo. Pero la salida estructurada en JSON y el uso de herramientas del lado del servidor siguen disponibles solo en bedrock-mantle, así que un flujo que depende de un esquema de salida estricto tiene que elegir ese endpoint en su lugar. El precio agrega otra palanca: enrutar a través del perfil Global de inferencia entre regiones, más barato, frente al perfil Geo limitado a EE. UU., o bajar al nivel de servicio Flex a la mitad de la tarifa estándar para trabajo por lotes no urgente, cambia la economía unitaria de un agente más que la elección del modelo en sí.

  1. AWS rediseña Bedrock AgentCore para reducir el costo de memoria inactiva y los retrasos de arranque en frío

    Si tus agentes de soporte o ventas corren sobre Bedrock AgentCore, esto cambia dos cifras que sí importan: la factura de AWS y cuánto espera un cliente cuando un agente inactivo vuelve a activarse. Antes, un agente de larga duración o con picos de uso seguía pagando por su pico de memoria durante toda la sesión, y los arranques en frío empeoraban a medida que crecía la imagen del contenedor o la concurrencia — un problema real para agentes que están callados la mayor parte del día y se disparan en horario laboral. El nuevo runtime factura más cerca del uso real y mantiene los arranques en frío estables en unos 2 segundos sin importar el tamaño de la imagen, así que los equipos que corren varios agentes (un clasificador de soporte, un bot de calificación de leads, un asistente interno de operaciones) pueden dejarlos escalados a cero entre solicitudes sin la penalización de latencia anterior cuando un cliente o un representante los activa en frío. Es un cambio de infraestructura, no una capacidad nueva, pero reduce el costo operativo de exactamente el patrón que usan la mayoría de las empresas de 10 a 200 personas: varios agentes especializados que están mayormente inactivos.

  1. Bedrock incorpora caché de prompts y reduce drásticamente el costo de las herramientas de soporte con IA

    Si tu chatbot de soporte, asistente interno de conocimiento o copiloto de ventas corre sobre Bedrock y envía el mismo prompt de sistema o documentación de producto en cada solicitud —como hacen la mayoría de las herramientas con recuperación aumentada—, esto reduce el costo por consulta y acelera los tiempos de respuesta sin cambiar el modelo en sí. Los equipos que manejan automatización de soporte de alto volumen (cientos o miles de tickets diarios) deberían ver la caché aplicada automáticamente o configurarla de forma explícita, ya que AWS señala que funciona mejor cuando una parte importante del prompt —como un fragmento de base de conocimiento o definiciones de herramientas— permanece idéntica entre llamadas. Para una empresa de 10 a 200 personas que ya paga por token en flujos de soporte o ventas con IA sobre Bedrock, esto es una palanca de costo directa que vale la pena revisar este trimestre, no una consideración a futuro.

  1. SageMaker incorpora enrutamiento por prefijos para reducir la latencia de LLMs autoalojados

    La mayoría de las empresas B2B de 10 a 200 personas usan una API alojada como OpenAI o Anthropic, y este cambio no las afecta directamente. Pero si tu automatización de operaciones o soporte corre un modelo autoalojado o afinado detrás de SageMaker —algo común cuando se manejan datos sensibles de clientes, historiales de tickets o guiones de venta propietarios que deben permanecer en tu propia VPC— esta actualización de enrutamiento es una reducción gratuita de latencia y costo. Los bots de soporte y las herramientas de asistencia a agentes que reutilizan el mismo prompt de sistema en miles de tickets al día verán una respuesta más rápida en el primer token y menor gasto en GPU con solo actualizar a la nueva estrategia de enrutamiento, sin cambios en los prompts ni en la lógica de la aplicación.

  1. Salesforce integra sus agentes de IA en los niveles estándar de precios del CRM

    Si tu empresa de 10 a 200 personas opera Sales Cloud, Service Cloud, o ambos, este reempaquetado afecta directamente tu próxima renovación de contrato: funciones que quizás pagabas como add-ons (o que evitabas por el costo) podrían quedar incluidas en tu nivel actual, o tu nivel actual podría descontinuarse y reemplazarse por uno más caro que incluye agentes de IA que no pediste. Antes de renovar, pide a tu equipo de cuenta que compare tu gasto actual en add-ons contra la nueva estructura de Ediciones — el empaquetado puede jugar a tu favor si ya pagabas por Agentforce o Data Cloud por separado, pero también puede forzar una actualización si el nuevo nivel base ya no coincide con lo que realmente usas. En cualquier caso, esto es un evento de facturación y empaquetado, no evidencia de que la IA agéntica ya esté madura.

  1. AWS enseña cómo reducir el costo de tokens en RAG sobre Bedrock filtrando contexto irrelevante

    Si tu bot de soporte, asistente de ventas o buscador de conocimiento interno corre sobre un pipeline de generación aumentada por recuperación a través de Bedrock (o una arquitectura similar), la factura de tokens crece según cuánto contexto irrelevante se mete en cada prompt: documentos largos, texto repetitivo y pasajes casi duplicados que se recuperan 'por las dudas'. La compresión consciente de la consulta ataca ese problema filtrando los fragmentos recuperados contra la pregunta real antes de que lleguen al modelo, que es exactamente la palanca que determina si el asistente de IA de un equipo de soporte de 20 personas cuesta 200 o 2.000 dólares al mes a escala. Los equipos que ya corren RAG en producción deberían tratar esto como un ítem concreto de reducción de costos, no como una mejora futura: no requiere cambiar de modelo, solo insertar un paso de compresión en el pipeline existente de recuperación a generación.

  1. Stripe compra OpenRouter: qué implica para los equipos que enrutan tráfico de IA a través de él

    Si tu automatización de ventas o soporte usa OpenRouter para alternar entre GPT, Claude, Gemini o modelos abiertos según coste o disponibilidad, ahora dependes de una pieza de infraestructura propiedad de una empresa de pagos y no de un router neutral e independiente; conviene revisar si los niveles de precios, los límites de tasa o los términos de SLA cambian en los próximos trimestres, y si Stripe impulsa cambios de facturación basada en uso que afecten al coste por solicitud. Los equipos que tienen a OpenRouter como único punto de fallo para la orquestación de modelos deberían confirmar que pueden recurrir a las APIs directas de los proveedores si cambian las condiciones, y tratar esto como una señal para auditar el riesgo de concentración de proveedores en su stack de IA, no como motivo para migrar de inmediato.

  2. Liquid AI lanza LFM2.5-DSpark con inferencia hasta 3,2 veces más rápida

    Para una empresa B2B que ejecuta un agente de chat con IA, un bot de triaje de tickets o un asistente de calificación de ventas sobre un modelo pequeño, autoalojado o desplegado en el borde, una aceleración de inferencia de 3,2x se traduce en menor latencia por respuesta y menos horas de GPU por conversación, es decir, facturas de alojamiento más bajas con el mismo volumen, o la posibilidad de ejecutar un modelo más capaz al mismo coste. Los equipos actualmente limitados por SLA de tiempo de respuesta en chat en vivo o soporte por voz, donde cada segundo de latencia del modelo se traduce en tiempo de espera del cliente, obtienen el beneficio más inmediato; los equipos que usan modelos API alojados por proveedores importantes no verán ningún cambio a menos que esos proveedores adopten técnicas similares.

  1. AWS suma enrutamiento entre regiones para GPT-5.6 en Bedrock

    Si tu bot de soporte, agente de calificación de leads o automatización de operaciones llama a GPT-5.6 a través de Amazon Bedrock, esto elimina un dolor de cabeza operativo real: saturaciones de capacidad en una sola región que provocan respuestas perdidas o retrasadas en horas pico. En lugar de escribir y mantener tu propia lógica de reintentos y conmutación entre regiones, ahora Bedrock se encarga de ese enrutamiento, lo que significa menos alertas a las 3 de la madrugada cuando un flujo de IA de cara al cliente empieza a saturarse. Los equipos que operan con estructuras reducidas (10-200 personas) rara vez tienen tiempo de ingeniería sobrante para construir infraestructura de resiliencia por su cuenta, así que este es un caso en el que el proveedor de la nube absorbe esa complejidad, lo cual representa una ganancia directa, aunque modesta, para la disponibilidad de cualquier canal de ventas o soporte impulsado por IA construido sobre Bedrock.

  1. Reordenar tareas, no comprar chips: así se ganaron 33 puntos de uso en un clúster GPU

    La mayoría de las empresas B2B de 10 a 200 personas no operan sus propios clústeres de GPU, así que esto no es una tarea directa para ellas — pero es un dato útil cuando un proveedor dice que escalar una función de IA requiere una costosa actualización de infraestructura. Si solo reordenar tareas puede liberar 33 puntos de utilización en el mismo hardware, vale la pena preguntarle a cualquier proveedor que cotice "más cómputo" si ya optimizó lo que tiene antes de facturar hardware adicional. El ángulo aquí es palanca de negociación y escrutinio de proveedores, no un cambio operativo interno — casi nadie entre los lectores tocará un scheduler, pero sí pagará por uno indirectamente a través de los costos de inferencia o fine-tuning.

  2. El eclipse solar redujo brevemente el tráfico de internet en Islandia, España y Portugal

    Para una empresa B2B de 10 a 200 personas, este evento no tiene ninguna implicación operativa que amerite acción. No es un incidente de seguridad, ni un riesgo de capacidad, ni un fallo de infraestructura: es una caída breve y predecible en el comportamiento de navegación de consumidores en una región concreta, ligada a un fenómeno natural. A menos que tu base de clientes esté fuertemente concentrada en Reikiavik, Madrid o Lisboa y tu negocio dependa del tráfico en tiempo real durante una ventana de dos horas el día del eclipse, no hay nada aquí que deba cambiar en tu dotación de soporte, tu monitoreo de disponibilidad o tus flujos de automatización. Vale la pena mencionarlo sobre todo como ejemplo de lo bien que la telemetría de red puede capturar el comportamiento humano a escala, un dato útil si alguna vez necesitas explicarle a un cliente una anomalía de tráfico que de otro modo parecería inexplicable.

  3. Nemotron 3.5 Lightning de NVIDIA llega a SageMaker JumpStart en AWS

    Si tu equipo de operaciones o ingeniería ya trabaja sobre AWS, esto importa menos como noticia de "nuevo modelo de IA" y más como una historia de compras e infraestructura: el despliegue de un clic dentro de SageMaker JumpStart reduce la carga de integración de añadir un modelo rápido y más económico a chatbots de ventas, triaje de soporte o automatización de flujos internos. Para una empresa de 10 a 200 personas, es la diferencia entre un sprint de ingeniería de dos semanas y una tarde probando si un modelo más ligero maneja el enrutamiento de tickets o la calificación de leads lo suficientemente bien como para sustituir a uno más caro. La salvedad: es una comodidad específica de AWS, no un cambio universal de capacidad — si no operas en AWS, o aún no tienes infraestructura para probar cambios de modelo con seguridad mediante A/B testing, hoy no hay nada que accionar más allá de anotar que la opción existe.

  1. OpenAI le presenta a Texas su plan de infraestructura de IA "responsable"

    Para una empresa B2B de 10 a 200 personas que automatiza ventas y soporte sobre los modelos de OpenAI, esta carta no cambia nada operativo hoy: es una comunicación de política pública sobre la ubicación de infraestructura física en un estado, no un cambio de producto, precio o API. La relevancia indirecta merece anotarse: la construcción continua de centros de datos en Texas y estados similares forma parte de la expansión de capacidad que sostiene la disponibilidad de modelos y, eventualmente, las tendencias de costo del acceso a la API. Los operadores deberían tratar esto como contexto de fondo, no como una tarea pendiente — no hay nueva herramienta, cuota ni límite de tasa al que reaccionar. Lo único que vale la pena vigilar, sin confirmar por ahora, es si acuerdos de infraestructura a nivel estatal como este empiezan a aparecer en comunicaciones del proveedor sobre residencia regional de datos o endpoints optimizados por latencia, algo que sí importaría directamente para flujos de soporte y operaciones sensibles al cumplimiento normativo.

Siguiente paso

Diagnóstico gratuito

Quince minutos, sin correo. Sale un mapa de a dónde se va el trabajo y el orden de lo que conviene automatizar primero.

Hacer el diagnóstico gratuito

Empieza al momento, en el navegador.

Precio
Gratis
Duración
15 minutos

La lista ordenada de candidatos se queda contigo en cualquier caso.