动量的好处与困扰,darknet与自己(摸到pytorch尾灯!)
训练cifar10,用darknet架构,上了79,用自己的,也上了79,但darknet优势明显:快了13秒一轮!
虽然自己的架构领先了0.2分,代价非常大!
上面两个版本都使用卷积层权重和bias的动量参与!就这一句话:
scal_cpu << <(w_size + 255) / 256, 256 >> > (w_size, 0.98, _grad_weight, 1);
darknet版本从13秒一轮,上升到70秒一轮
自己的版本从14.5秒一轮,上升到83秒一轮!
如果干掉这句话,两个版本都能稳定在78.5分!而且速度嗖嗖的!看一看两个架构,差别也很小!
看看lr的更新,也保持一致:
下一步,问题自然而来!解决这个慢的问题!先放下!慢慢来!
