
Fine tune output
(Pdb) images[2].mean()
tensor(-1., device='cuda:0')
(Pdb) images[1].mean()
tensor(-0.5780, device='cuda:0')
(Pdb) images[0].mean()
tensor(-0.7716, device='cuda:0')
(Pdb) (Pdb) high_level_task[0]
tensor([     2,   7978,   2403,   6911, 235292,   5651,   3124,    573,  18571,
          7762,   6643,    573,   9010,  72993,  21810,   4894,   3040, 235292,
        235248, 235274, 235274, 235274,    728, 235274, 235248, 235284, 235308,
        235308, 235248, 235274, 235318, 235315, 235248, 235274, 235310, 235318,
        235248, 235284, 235318, 235248, 235274, 235284, 235321, 235248, 235274,
        235284, 235321, 235248, 235274, 235284, 235321, 235248, 235274, 235284,
        235321, 235248, 235274, 235284, 235321, 235248, 235274, 235284, 235321,
        235248, 235274, 235284, 235321, 235248, 235274, 235284, 235321, 235248,
        235274, 235284, 235321, 235248, 235274, 235284, 235321, 235248, 235274,
        235284, 235321, 235248, 235274, 235284, 235321, 235248, 235274, 235284,
        235321, 235248, 235274, 235284, 235321, 235248, 235274, 235284, 235321,
        235248, 235274, 235284, 235321, 235248, 235274, 235284, 235321, 235248,
        235274, 235284, 235321, 235248, 235274, 235284, 235321, 235248, 235274,
        235284, 235321, 235248, 235274, 235284, 235321, 235248, 235274, 235284,
        235321, 235248, 235274, 235284, 235321, 235248, 235274, 235284, 235321,
        235248, 235274, 235284, 235321, 235248, 235274, 235284, 235321, 235289,
          4284,   8277, 235292,      0,      0,      0,      0,      0,      0,
             0,      0,      0,      0,      0,      0,      0,      0,      0,
             0,      0,      0,      0,      0,      0,      0,      0,      0,
             0,      0,      0,      0,      0,      0,      0,      0,      0,
             0,      0,      0,      0,      0,      0,      0,      0,      0,
             0,      0,      0,      0,      0,      0,      0,      0,      0,
             0,      0], device='cuda:0')
(Pdb) subtask_tokens[0]
tensor([    2, 28040,  7762, 14574,  6643,  9010, 37901, 21810,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0,
            0,     0,     0,     0,     0,     0,     0,     0,     0,     0],
       device='cuda:0')
(Pdb) actions.shape
torch.Size([4, 50, 32])
(Pdb) actions.mean()
tensor(0.0143, device='cuda:0')
(Pdb) 




Inference:
