tkestack/gpu-manager在k8s1.23版本之后的使用方法-迪思分享

本站所有内容来自互联网收集，仅供学习和交流，请勿用于商业用途。如有侵权、不妥之处，请第一时间联系我们删除！Q群：

目录异常排查编译

异常

在1.25版本的k8s集群中部署gpu-manage时，虽然显示gpu节点上gpu-manage的pod实例都是running状态，但是给pod申领tencent.com/vcuda-memory资源时，却始终找不到有资源的节点。

查看节点的详情时，返回的allocatable字段中也没有相关资源:Allocatable: cpu: 48 ephemeral-storage: 48294789041 hugepages-1Gi: 0 hugepages-2Mi: 0 memory: 65291520Ki pods: 110 System Info: Machine ID: 50ca20960ea94552bd5ef84a20ce7e47

说明gpu-manager并没有正确运行。

排查

查看任意gpu-manager的pod日志，可以看到如下异常信息：

rebuild ldcache

launch gpu manager

E0426 06:17:06.729262 2384 server.go:131] Unable to set Type=notify in systemd service file?

E0426 06:17:11.731947 2384 server.go:152] cant create container runtime manager: context deadline exceeded

说明gpu-manager和容器运行时接口通信失败了。

查看异常信息指向的代码：… containerRuntimeManager, err := containerRuntime.NewContainerRuntimeManager( m.config.CgroupDriver, m.config.ContainerRuntimeEndpoint, m.config.RequestTimeout) if err != nil { klog.Errorf(“cant create container runtime manager: %v”, err) return err } klog.V(2).Infof(“Container runtime manager is running”) …

可以看到是访问m.config.ContainerRuntimeEndpoint超时，这个变量的默认值定义在cmd/manager/options/options.go

const ( DefaultDriver = “nvidia” DefaultQueryPort = 5678 DefaultSamplePeriod = 1 DefaultVirtualManagerPath = “/etc/gpu-manager/vm” DefaultAllocationCheckPeriod = 30 DefaultCheckpointPath = “/etc/gpu-manager/checkpoint” DefaultContainerRuntimeEndpoint = “/var/run/dockershim.sock” DefaultCgroupDriver = “cgroupfs” )

可以看到这里用的运行时接口是/var/run/dockershim.sock，但是在k8s1.23版本之后，接口路径已经改为/var/run/cri-dockerd.sock，所以修改默认之后重新编译即可。

编译

使用make img既可以用源码的Makefile自动编译打包成新的镜像，但是源码的/home/zp/work/gpu-manager/build/Dockerfile中的git222不一定能装上，可以改成git，另外有一些依赖需要国际上的支持。

编译后的镜像在1.25版本的k8s中可以正常使用。

迪思分享版权声明 ① 本网站名称：❤迪思分享❤ 本站永久网址：▶https://www.dsary.com◀
② 如果您喜欢本站，点击这儿

开通VIP，同时按Ctrl+D保存网页
③ 在浏览网站中可能会帮助到您：

④ 本站接受投稿，同时也开启了创作分成，投稿用户只需自行设置收费即可！点击查看如果需要投稿，请点击投稿发布文章！
⑤ 本站一律禁止以任何方式发布或转载任何违法的相关信息，如果发现请点击上方联系方式进行举报！情况如实，可获得本站一个月的VIP
⑥ 本站资源大多存储在云盘，如发现链接失效，请联系我们我们会第一时间更新。如遇压缩包需解压密码，一般为：www.dsary.com 丨 www.syymw.com请知悉！
⑦ 修改版本安卓及电脑软件，加群提示为修改者自留，非本站信息，注意鉴别！资源来源于网络，仅供大家学习与参考，请于下载后24小时内删除；
⑧ 若作商业用途，请联系原作者授权，若本站侵犯了您的权益请联系站长进行删除处理；可联系上方QQ或进入QQ群进行反馈！
⑨互联网的本质是自由与分享，我们真诚的希望，每一份有价值的正能量能够在互联网中自由传播。

THE END

编程教程

tkestack/gpu-manager在k8s1.23版本之后的使用方法

异常

排查

编译

请登录后发表评论