Pablo Cardozo

Investigación sobre sistemas de IA en producción

Pablo CardozoIndependent Applied AI Researcher · Technical PartnerBuenos Aires, ArgentinaGitHub · LinkedIn

Resumen

Este registro separa afirmaciones de investigación de artefactos de ingeniería. Los working papers definen preguntas y protocolos de evaluación; los technical reports documentan sistemas implementados y evidencia acotada; los protocolos de investigación declaran lo que todavía falta medir. Ningún trabajo actual se presenta como peer reviewed.

Palabras clave: evaluación de IA; memoria conversacional; sistemas de agentes; extracción estructurada; IA en producción

1. Trabajo actual

Cada entrada declara el estado de la evidencia y sus limitaciones. Una interfaz pulida no se trata como resultado y las mediciones reportadas por repositorios se identifican como tales.

  1. WP-01 · Working paper · 2026

    Evaluación del aislamiento de memoria de largo plazo en agentes conversacionales multi-tenant

    Este working paper define un protocolo reproducible para evaluar memoria conversacional con aislamiento entre tenants. El sistema combina estado de corto plazo del hilo, memoria vectorial y evidencia documental basada en grafos. El artefacto disponible crea dos tenants sintéticos, registra hechos distintos para cada uno, prueba recuperación, detecta filtraciones cruzadas y mide latencia. No se afirma ningún resultado cuantitativo hasta publicar una ejecución versionada.

    Estado
    Protocolo de evaluación disponible; falta publicar el artefacto de resultados

    Leer · PDF

  2. TR-01 · Technical report · 2026

    Evaluación con un juez automático de un agente conversacional transaccional

    Este technical report examina un harness de evaluación para un asistente de restaurantes que debe responder preguntas, gestionar pedidos de varios turnos, manejar pagos, resistir entradas inseguras y escalar a una persona. Un modelo juez separado puntúa exactitud, accionabilidad, completitud, relevancia y tono de 0 a 100, mientras el harness registra latencia, tokens, trazas y estadísticas por categoría. Un informe fechado del repositorio registra una mejora de 19 de 46 casos aprobados a 31 de 46 después de una implementación parcial. Esas cifras son las reportadas por el repositorio y no fueron reejecutadas de forma independiente para esta publicación.

    Estado
    Implementación pública y resultados reportados por el repositorio

    Leer · PDF

  3. RP-01 · Protocolo de investigación · 2026

    Protocolo de benchmark para extracción multi-etapa con LLMs desde catálogos heterogéneos

    Este protocolo convierte un sistema implementado de ingesta de catálogos en tres etapas en una comparación falsable. El sistema primero extrae la estructura documental, luego reconstruye filas fuente y finalmente normaliza productos en lotes acotados con validación de esquemas y controles de procedencia. El benchmark propuesto compara esta descomposición con un baseline de una sola pasada usando exactitud por campo, cobertura de filas, integridad de procedencia, tasa de revisión, latencia y costo. Actualmente no se afirma ningún resultado comparativo.

    Estado
    Sistema implementado; benchmark controlado todavía no ejecutado

    Leer · PDF

2. Estándar de publicación

Un trabajo pasa de protocolo a informe solo cuando se pueden inspeccionar su pregunta, dataset, baseline, entorno, métricas, salidas crudas y limitaciones. Un informe se vuelve candidato a submission únicamente después de reproducción y revisión externa.

3. Declaración

Se utilizaron sistemas de IA durante el desarrollo de software y la preparación editorial. Pablo Cardozo conserva la responsabilidad por las afirmaciones, selección de fuentes, interpretación y correcciones. La autoría se asignará por contribución sustantiva, no solo por propiedad del repositorio.

Pablo Cardozo · Independent Applied AI Researcher · Buenos Aires, Argentina