Wow, fixing one simple parameter could stop your AI training from collapsing! UCL, Shanghai Jiao Tong University, and HKUST (Guangzhou) present HölderPO. Instead of summing token probabilities in a fixed way, HölderPO uses a flexible averaging trick controlled by a single “p”
HölderPO: single-parameter fix to prevent AI training collapse
By
–
