IA

Anthropic revela que Claude ya lidera una de cada cuatro decisiones de su propia investigación en IA

Adrian Kessler
Añádenos en Google

Una de cada cuatro tareas de investigación en inteligencia artificial en Anthropic ahora es liderada por Claude. No asignada a Claude como asistente, ni revisada por Claude después — sino iniciada a partir de una instrucción de alto nivel y completada de principio a fin, con un humano verificando el resultado cuando termina. Hace nueve meses, esa cifra era menos del uno por ciento.

Anthropic traza una línea entre dos cosas. Cuando Claude lidera una tarea, maneja la mayor parte del trabajo de forma independiente; un supervisor examina el resultado en lugar de guiar cada paso. Esa es una categoría diferente del noventa por ciento de toda la I+D de Anthropic en la que Claude actúa como colaborador — un humano dirige, Claude maneja partes específicas. Liderar es la clasificación más exigente. Ahora representa el 26 por ciento de toda la investigación en IA que realiza la empresa, ponderado por el tiempo que los investigadores dedicarían de otro modo a esas tareas.

La escala es concreta. Alrededor de 30.000 agentes de Claude se ejecutan simultáneamente en las plataformas internas de Anthropic, realizando trabajo en entrenamiento de modelos, evaluaciones, investigación de interpretabilidad y análisis de seguridad. En agosto, esos agentes tomaron más de mil millones de decisiones en total. Los sistemas de monitoreo en tiempo real de Anthropic bloquearon el 0,002 por ciento de ellas — aproximadamente una de cada 47.000 acciones — antes de su ejecución. Luego, una capa fuera de línea señaló alrededor de 100.000 transcripciones semanales para revisión, escalando aproximadamente 50 a un humano.

La seguridad tiene un presupuesto medible dentro de ese sistema. Durante una sola semana de julio, el trabajo dedicado a mantener seguros a los agentes consumió el seis por ciento de todo el cómputo de investigación y desarrollo en IA, y el doce por ciento del cómputo que la propia I+D impulsada por IA estaba utilizando. Anthropic dice que clasificó de manera conservadora, excluyendo los clasificadores de seguridad dedicados del recuento, lo que sugiere que la proporción real es aún mayor.

Un problema epistemológico está en el centro de todo esto. La contribución de Claude a la investigación de Anthropic es evaluada en parte por el propio Claude. Un modelo de Claude evalúa el trabajo de Claude; las cifras de supervisión cubren solo una plataforma interna; y la clasificación del cómputo se basó en modelos de Claude que muestreaban y etiquetaban sus propias ejecuciones. Ningún tercero independiente ha auditado la metodología. Los tres números que publicó Anthropic son precisos, pero son precisión auto-reportada — lo cual es algo diferente de la precisión verificada.

Anthropic dice que comenzará a incorporar evaluadores externos dentro del proceso. No hay nombres, ni fechas de inicio, y aún no ha aparecido una divulgación comparable de otros laboratorios de IA. La cifra del 26 por ciento, al ritmo que ha avanzado, es una instantánea más que un techo.

Etiquetas: , , , , ,

Añádenos en Google

Discussion

There are 0 comments.