Investigación sobre sistemas de IA en producción
Resumen
Este registro separa afirmaciones de investigación de artefactos de ingeniería. Los working papers definen preguntas y protocolos de evaluación; los technical reports documentan sistemas implementados y evidencia acotada; los protocolos de investigación declaran lo que todavía falta medir. Ningún trabajo actual se presenta como peer reviewed.
Palabras clave: evaluación de IA; memoria conversacional; sistemas de agentes; extracción estructurada; IA en producción
1. Trabajo actual
Cada entrada declara el estado de la evidencia y sus limitaciones. Una interfaz pulida no se trata como resultado y las mediciones reportadas por repositorios se identifican como tales.
WP-01 · Working paper · 2026
Evaluación del aislamiento de memoria de largo plazo en agentes conversacionales multi-tenant
Este working paper define un protocolo reproducible para evaluar memoria conversacional con aislamiento entre tenants. El sistema combina estado de corto plazo del hilo, memoria vectorial y evidencia documental basada en grafos. El artefacto disponible crea dos tenants sintéticos, registra hechos distintos para cada uno, prueba recuperación, detecta filtraciones cruzadas y mide latencia. No se afirma ningún resultado cuantitativo hasta publicar una ejecución versionada.
- Estado
- Protocolo de evaluación disponible; falta publicar el artefacto de resultados
TR-01 · Technical report · 2026
Evaluación con un juez automático de un agente conversacional transaccional
Este technical report examina un harness de evaluación para un asistente de restaurantes que debe responder preguntas, gestionar pedidos de varios turnos, manejar pagos, resistir entradas inseguras y escalar a una persona. Un modelo juez separado puntúa exactitud, accionabilidad, completitud, relevancia y tono de 0 a 100, mientras el harness registra latencia, tokens, trazas y estadísticas por categoría. Un informe fechado del repositorio registra una mejora de 19 de 46 casos aprobados a 31 de 46 después de una implementación parcial. Esas cifras son las reportadas por el repositorio y no fueron reejecutadas de forma independiente para esta publicación.
- Estado
- Implementación pública y resultados reportados por el repositorio
RP-01 · Protocolo de investigación · 2026
Protocolo de benchmark para extracción multi-etapa con LLMs desde catálogos heterogéneos
Este protocolo convierte un sistema implementado de ingesta de catálogos en tres etapas en una comparación falsable. El sistema primero extrae la estructura documental, luego reconstruye filas fuente y finalmente normaliza productos en lotes acotados con validación de esquemas y controles de procedencia. El benchmark propuesto compara esta descomposición con un baseline de una sola pasada usando exactitud por campo, cobertura de filas, integridad de procedencia, tasa de revisión, latencia y costo. Actualmente no se afirma ningún resultado comparativo.
- Estado
- Sistema implementado; benchmark controlado todavía no ejecutado
2. Estándar de publicación
Un trabajo pasa de protocolo a informe solo cuando se pueden inspeccionar su pregunta, dataset, baseline, entorno, métricas, salidas crudas y limitaciones. Un informe se vuelve candidato a submission únicamente después de reproducción y revisión externa.
3. Declaración
Se utilizaron sistemas de IA durante el desarrollo de software y la preparación editorial. Pablo Cardozo conserva la responsabilidad por las afirmaciones, selección de fuentes, interpretación y correcciones. La autoría se asignará por contribución sustantiva, no solo por propiedad del repositorio.
Pablo Cardozo · Independent Applied AI Researcher · Buenos Aires, Argentina