Esto me ha gustado. La mayoría de código publicado por humanos ya es funcional, y eso hace que en muchos casos la IA no se entrene con código que falla y por tanto no esté acostumbrada a que las cosas "vayan mal". Para solucionar esto han usado datos sintéticos generado por
@dotcsv
-
SWE-Bench Progress Forecast: August to Year-End Predictions
By
–
¿Si en Agosto estamos a 30.08% en el SWE-Bench a cuánto creéis que subirá este valor a final de año?
-

SWE-bench: New Benchmark for Complex AI Reasoning Tasks
By
–
Esta semana escucharemos bastante sobre el SWE-bench ya que parece se convertirá en el nuevo benchmark para evaluar las capacidades de razonamiento y de resolución de tareas complejas de la próxima generación de modelos. Ya en Marzo os decía
-

Company Achieves Breakthrough via Fine-tuned OpenAI Model
By
–
El salto logrado por esta compañía es notable, y lo han conseguido a partir de hacer un fine-tuning del modelo de OpenAI con datos de cómo Ingenieros de Software razonan y resuelven este tipo de tareas.
-
Genie AI Achieves 30% on Software Engineering Benchmark
By
–
🔴 ¡IAs como INGENIERO DE SOFTWARE!
— Carlos Santana (@DotCSV) 12 août 2024
¿Recordáis Devin? La IA capaz de hacer labores de ingeniero de software lograba resolver un 13.8% de las tareas del benchmark SWE-Bench en Marzo.
Hoy la empresa Cosine anuncia un 30.08% con su nuevo sistema Genie 🧞♂️✨pic.twitter.com/XvGzVMU9Pv¡IAs como INGENIERO DE SOFTWARE! ¿Recordáis Devin? La IA capaz de hacer labores de ingeniero de software lograba resolver un 13.8% de las tareas del benchmark SWE-Bench en Marzo. Hoy la empresa Cosine anuncia un 30.08% con su nuevo sistema Genie
-
Making AI Technology Publicly Accessible and Visible
By
–
La tecnología ya es pública al alcance de todos. Aquí hablo de darle exposición.
-
Instant Voice Cloning AI: Accessibility Risks and Implications
By
–
Pensad por ejemplo, una IA que permita clonar la voz de cualquier persona al instante. Y de la que cualquiera pudiera tener acceso.
-
Disclosure Dilemma: Revealing Dangerous Technology Risks
By
–
Si supiera de una tecnología cuyo uso trae peligros obvios, y que poco a poco se está conociendo… ¿Creéis que es mejor cubrirla y que más gente la conozca (con el riesgo de quien la mal use y con la ventaja de que la gente esté más preparada) o mejor dejarla en un perfil bajo?
-

ChatGPT Adds Interactive Tables and Graphs Features
By
–
Hasta el día de hoy no había visto las funcionalidades de tablas y gráficos interactivos en mi cuenta de ChatGPT. Si en vuestro caso tampoco id a probarlo porque a lo mejor ya lo tenéis Si generáis un gráfico o trabajáis con tablas ahora podréis explorarlas de forma interactiva
-

AI Progress Enters Slowdown Phase: Market Trends Analysis
By
–
La fase en la que el progreso empieza a ralentizarse.
