viable/strict/1788603844: [cuBLAS] 항상 cuBLAS(Lt) 작업 공간을 선점적으로 할당하기 (#194311)
이 릴리스 노트는 캐시 기반 접근 방식 대신 cuBLAS(Lt) 작업 공간을 미리 선점적으로 할당하도록 하는 프로토타입 변경을 설명합니다. 벤치마크 데이터는 eager 작업 공간 사용 시 각 연산 오버헤드가 작게 나타나며, workload에 따라 성능 향상 또는 저하가 나타날 수 있음을 보여줍니다. 논의는 그래프 캡처 동작 및 캐시 지우기 전략에 대한 지속적인 고려 사항을 다룹니다.
Why it matters: 채택되면 cuBLAS 기반 연산의 성능 특성이 달라질 수 있으며 그래프 캡처 디버깅에 영향을 줄 수 있습니다. 또한 작업 공간의 수명 관리가 단순해질 수 있지만 연산당 오버헤드가 달라질 수 있습니다.
AI-assisted brief
official source