Jueces LLM: ciegos a las omisiones en notas clínicas
Un paper de arXiv (agosto 2026) muestra que los jueces LLM detectan datos agregados pero son ciegos a las omisiones en notas clínicas. Qué método lo arregla.
Un paper de arXiv (agosto 2026) muestra que los jueces LLM detectan datos agregados pero son ciegos a las omisiones en notas clínicas. Qué método lo arregla.
Por que los agentes IA fabrican APIs, rutas y citas falsas, y como una capa de verificacion baja la tasa de alucinacion del 18% a menos del 3%.
El caso real de un sidecar de IA con 9 bugs fundamentales que hacian parecer que todo andaba. Como cazarlos leyendo el trafico crudo del LLM.
Comparativa directa de Groq y TokenPAPA: cuándo pagar por velocidad LPU y cuándo elegir precio bajo con 30+ modelos y caching automático.
El multiplicador 20x de Claude Max aplica solo a la ventana de 5 horas, no al límite semanal. Qué pagás realmente por USD 200/mes.
Cómo ordenar la optimización inferencia LLM en dos familias de técnicas: las que negocian latencia y throughput y las que expanden toda la frontera.
Un transformer de 8 capas entrenado en 1,5 horas por 67 centavos sacó 44% en ARC-AGI-1 y empató a TRM y HRM. Qué hay detrás del resultado.
La pérdida de savviness con LLMs es la erosión de la astucia práctica que sufre un desarrollador al delegar su razonamiento en modelos de IA. Paolo Galeone, un ingeniero de software con 15 años de carrera, relata cómo pasó de ser un creador apasionado a un aburrido evaluador de prompts.
OpenAI está probando un modo persistente para Codex que permite a los agentes funcionar sin parar en segundo plano, generar sus propias tareas y contactar al usuario proactivamente. Sin fecha de lanzamiento pero con implicancias de seguridad documentadas por la propia empresa.
Anthropic anunció el Model Hardware Standard (MHS), un estándar abierto que permite a agentes de IA controlar dispositivos físicos con lenguaje natural. Resultados de pruebas con Genentech, Carnegie Mellon y QuEra muestran automatización 3× más rápida y 99.3% de recuperación de fallos.