root@ubuntu:/docker# python3 torch2trt_infer.py
[04/13/2023-17:43:30] [TRT] [I] Loaded engine size: 13 MiB
[04/13/2023-17:43:31] [TRT] [V] Deserialization required 536025 microseconds.
[04/13/2023-17:43:31] [TRT] [I] [MemUsageChange] TensorRT-managed allocation in engine deserialization: CPU +0, GPU +563, now: CPU 0, GPU 563 (MiB)
[04/13/2023-17:43:32] [TRT] [V] Total per-runner device persistent memory is 578824192
[04/13/2023-17:43:32] [TRT] [V] Total per-runner host persistent memory is 152336
[04/13/2023-17:43:36] [TRT] [V] Allocated activation device memory of size 20401094656
[04/13/2023-17:43:36] [TRT] [I] [MemUsageChange] TensorRT-managed allocation in IExecutionContext creation: CPU +0, GPU +20008, now: CPU 0, GPU 20571 (MiB)
아니 추론엔진 크기가 13MiB인데 그게 20GiB로 늘어나는게 말이 됨?
차라리 내놓는 GPU들이 VRAM이 크면 모르는데 그것도 아니고
속도 끌어올린다는 명목으로 VRAM 소모량 좆같이 만드는데
이것도 상위 카드 사게 하려는 장사전략인가
근데 장사전략 치고는 A100 80GB도 간간히 뻗는다는데 그냥 속도만 너무 중시해서 생긴 문제인가
쉿 업계비밀