Que no cunda el pánico con eso de que OpenAI limitará el acceso de su próximo modelo a unas pocas empresas, falsa alarma.
@dotcsv
-
Model Capacity and Data Memorization Risk in AI Systems
By
–
Pero a mayor capacidad del modelo más riesgo de memorización.
-
Benchmarking AI Models: Balancing Accuracy with Cost Efficiency
By
–
Aquí siempre en el equipo de Noam, ojalá más y más benchmarks se reportarán cruzando accuracy con coste!
-

Anthropic Model Card: Evaluation Overfitting Risks Assessment
By
–
2) Tal y como reportan en el propio Model Card hay riesgo de que estas evaluaciones hayan sido vistas por el modelo durante el pre-entrenamiento (a.k.a overfitting) y eso desvirtúa la interpretación de las métricas. Trabajo honesto el de Anthropic en la Model Card en muchos de
-

Mythos Model Evaluation: Why Single Benchmark Reporting Matters
By
–
Respecto a Mythos me han preguntado por qué en el vídeo de Youtube no he hecho mención a esta gráfica que todos estas comentando, y hay un par de motivos por el que descarté hablar de ello tras leer la Model Card. 1) Reportar la eficiencia de un modelo sobre un único benchmark
-

Opus loses warmth and personality in tone generation
By
–
Tal cual. El tono es lo más triste porque la calidez de Opus se pierde por completo, e incluso cuando fuerzas a que lo intente suena todo el rato a esto
-
AI Model Cherry Picking Benchmarks Falls Behind Competitors
By
–
Hacen mucho cherry picking de sólo aquellos benchmarks en los que salen primeros, pero se han quedado atrás frente a Gemini, GPT y Claude. Cuando hacen updates que sí los coloca a la frontera suelo hacer vídeo. Pero llevan un tiempo que se han quedado atrás.
-

OpenAI’s Internal Model Solves Five More Erdos Problems
By
–
Other 5 Erdos problems more solved using an internal model of OpenAI. It adds up and keeps going.
-

Meta’s GPU Investment Accelerates AI Race Competition
By
–
Las GPUs de Zuckerberg went brrrrr brrrrr para dar un salto necesario por estar en la carrera. Ahora toca mantener el ritmo!

