pytorch求hessian - IT评测·应用市场-qidao123.com技术社区

复制代码

def getHessian(grads, model, loss_fn, dat, tar ,device):
loss = loss_fn(model(dat), tar)
grads_fn = torch.autograd.grad(loss, model.parameters(), retain_graph=True, create_graph=True) # 记录一阶梯度的grad_fn
# 这部分是更新一阶梯度的值，因为其实我要计算的一阶梯度的值是grads
for source, target in zip(grads, grads_fn):
target.data.copy_(source)
hessian_params = []
#第k个梯度
for k in range(len(grads_fn)):
# 第i个参数
for param in model.parameters():
hess_params = []
# 第k个梯度的地i行参数
for i in range(grads_fn[k].size(0)):
# 判断是w还是b
if len(grads_fn[k].size()) == 2:
# w
for j in range(grads_fn[k].size(1)):
hess = torch.autograd.grad(grads_fn[k][i][j], param, retain_graph=True, allow_unused= True)
hess_params.append(hess[0].cpu().detach().numpy() if hess[0] is not None else None)
else:
# b
hess = torch.autograd.grad(grads_fn[k][i], param, retain_graph=True, allow_unused=True)
hess_params.append(hess[0].cpu().detach().numpy() if hess[0] is not None else None)
hessian_params.append(np.array(hess_params))
return hessian_params

复制代码

net = ANN()
opt = optim.SGD(net.parameters(), lr=1e-4)
net.load_state_dict(model_state_dict)
net.to(device)
opt.load_state_dict(optimizer_state_dict)
opt.zero_grad()
pred = net(inputs)
loss = loss_fn(pred, targets)
grads = torch.autograd.grad(loss, net.parameters(), retain_graph=True, create_graph=True) # 计算一阶梯度
loss.backward(retain_graph=True)
opt.step()
·········
······
#之后进行hessian矩阵的计算就可以

复制代码