ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

6.3 显存与地址:amd_memory

6.3 显存与地址:amd_memory 要让 GPU 干任何活第一步都是准备内存命令流IB/PM4要放在 GPU 能读到的内存里被拷贝的 src/dst 数据也要有 GPU 虚拟地址。裸用 libdrm 做这件事每次都要走「分配 BO → 分配 VA 范围 → 建立映射 →可选CPU 映射」四步还要处理各步失败时的逆序回滚。amd_memory.{c,h}的价值就是把这套样板收敛成一两个函数。这一篇讲清楚它封装了什么、每层 libdrm 调用各自负责什么、以及不同变体该怎么选。一、一个 BO 从分配到可用要过几关在 amdgpu 的模型里「一块能被 GPU 命令直接引用的内存」不是一次调用就绪的它有三个正交的概念amdgpu_bo_alloc分配物理 BO选 heap: VRAM/GTTamdgpu_va_range_alloc分配一段 GPU 虚拟地址amdgpu_bo_va_op MAP把 BO 映射到该 VAamdgpu_bo_cpu_map拿到 CPU 指针可选BObuffer object真实的物理后备分配时用preferred_heap决定放在 VRAM 还是 GTT系统内存用flags指定 CPU 可访问等属性。VA 范围GPU 侧的虚拟地址空间独立于物理 BO 分配。命令流里写的地址如 WRITE_DATA 的目标就是这个 VA。MAP把物理 BO 绑到某段 VA 上页表由此建立GPU 才能通过该地址访问到数据。CPU map可选给测试代码一个void*去填数据 / 读回校验。这四步任何一步失败前面已成功的都要按逆序撤销——这正是最容易写错、也最值得封装的部分。二、主力函数amdgpu_bo_alloc_and_map绝大多数测试用的就是它。一次调用把四步和回滚全包了intamdgpu_bo_alloc_and_map(amdgpu_device_handle dev,unsignedsize,unsignedalignment,unsignedheap,uint64_tflags,amdgpu_bo_handle*bo,void**cpu,uint64_t*mc_address,amdgpu_va_handle*va_handle){structamdgpu_bo_alloc_requestrequest{.alloc_sizesize,.phys_alignmentalignment,.preferred_heapheap,.flagsflags,};amdgpu_bo_handle buf_handle;amdgpu_va_handle handle;uint64_tvmc_addr;intr;ramdgpu_bo_alloc(dev,request,buf_handle);if(r)returnr;ramdgpu_va_range_alloc(dev,amdgpu_gpu_va_range_general,size,alignment,0,vmc_addr,handle,0);if(r)gotoerror_va_alloc;ramdgpu_bo_va_op(buf_handle,0,size,vmc_addr,0,AMDGPU_VA_OP_MAP);if(r)gotoerror_va_map;ramdgpu_bo_cpu_map(buf_handle,cpu);if(r)gotoerror_cpu_map;*bobuf_handle;*mc_addressvmc_addr;*va_handlehandle;return0;error_cpu_map:amdgpu_bo_cpu_unmap(buf_handle);error_va_map:amdgpu_bo_va_op(buf_handle,0,size,vmc_addr,0,AMDGPU_VA_OP_UNMAP);error_va_alloc:amdgpu_bo_free(buf_handle);returnr;}调用方拿回四样东西各有用途输出类型用途*boamdgpu_bo_handle提交时进 BO list让内核知道这次提交引用了它*cpuvoid*CPU 侧填数据 / 读回校验*mc_addressuint64_tGPU 虚拟地址写进 PM4 packet 的地址字段*va_handleamdgpu_va_handle释放时归还 VA 范围关键设计点是那串goto的逆序回滚CPU map 失败就只回滚到 unmapfreeVA map 失败就回滚 VA 分配……保证任何中途失败都不泄漏 BO 或 VA。这段逻辑写一次、所有测试复用是这个库最实在的价值之一。三、释放一句对称的收尾分配的逆操作同样打包好顺序与分配严格镜像voidamdgpu_bo_unmap_and_free(amdgpu_bo_handle bo,amdgpu_va_handle va_handle,uint64_tmc_addr,uint64_tsize){amdgpu_bo_cpu_unmap(bo);amdgpu_bo_va_op(bo,0,size,mc_addr,0,AMDGPU_VA_OP_UNMAP);amdgpu_va_range_free(va_handle);amdgpu_bo_free(bo);}CPU unmap → VA unmap → 归还 VA 范围 → 释放 BO。测试里alloc_and_map/unmap_and_free成对出现就不会漏资源。四、几个变体什么时候用哪个同一主题有几个变体差别只在「映射那一步怎么做」函数差别适用场景amdgpu_bo_alloc_and_map标准 MAP默认读写权限绝大多数测试amdgpu_bo_alloc_and_map_raw用amdgpu_bo_va_op_raw显式带READABLE|WRITEABLE|EXECUTABLE 自定义mapping_flags并按getpagesize()对齐需要可执行页放 shader ISA或自定义映射标志amdgpu_bo_alloc_and_map_sync按sync参数分流走 user-queue 路径_uq或普通路径用户队列UQ提交模型_raw版本的映射长这样注意它显式给出页权限并把大小对齐到系统页ramdgpu_bo_va_op_raw(dev,buf_handle,0,ALIGN(size,getpagesize()),vmc_addr,AMDGPU_VM_PAGE_READABLE|AMDGPU_VM_PAGE_WRITEABLE|AMDGPU_VM_PAGE_EXECUTABLE|mapping_flags,AMDGPU_VA_OP_MAP);放 compute shader 二进制的 BO 必须可执行就得走_raw显式带EXECUTABLE位普通数据 BO 用标准版即可。五、BO list把提交要引用的 BO 打包提交一次命令内核需要知道这次会碰到哪些 BO用于驻留/换页。amd_memory提供了一个最常用的两 BO 打包intamdgpu_get_bo_list(amdgpu_device_handle dev,amdgpu_bo_handle bo1,amdgpu_bo_handle bo2,amdgpu_bo_list_handle*list){amdgpu_bo_handle resources[]{bo1,bo2};returnamdgpu_bo_list_create(dev,bo2?2:1,resources,NULL,list);}bo2传 NULL 就只登记一个。典型场景bo1是命令 IBbo2是数据 BO。这个 list 会交给下一步的命令提交下一篇 6.4 之后的提交框架会用到。六、其它职责amd_memory还兼管几类与内存相关的杂活用到时知道去哪找即可内存信息查询get_available_vram/get_available_system_memory/get_gpu_memory_info用于按可用容量裁剪测试规模。dmabuf / 导入导出create_dmabuf、virtual_mem_to_gpu_bo把一段用户虚拟内存包成 GPU BO服务跨设备共享与 SVM 类场景。裸 CPU 虚拟内存virtual_alloc_memory/virtual_free_memory/wait_on_value用于纯 CPU 侧的辅助缓冲与轮询等待。多 fence 等待amdgpu_command_submission_multi_fence_wait_all。七、关键结论amdgpu 内存有三个正交概念物理 BO、GPU VA 范围、二者的 MAPamd_memory的核心就是把「分配四步 逆序回滚」封成一句amdgpu_bo_alloc_and_map。一次分配返回四样东西各司其职bo进 BO list、cpu填/读、mc_address写进 PM4、va_handle释放用。需要可执行页放 shader或自定义映射标志时用_raw变体用户队列模型用_sync变体。amdgpu_get_bo_list把「这次提交引用了哪些 BO」打包衔接到命令提交环节。
返回列表