OpenCL框架组成

本文主要讨论OpenCL框架,其组成可划分为以下三个部分:

  • OpenCL平台API:平台API定义了宿主机程序发现OpenCL设备所用的函数以及这些函数的功能,另外还定义了为OpenCL应用创建上下文的函数。
  • OpenCL运行时API:这个API管理上下文来创建命令队列以及运行时发生的其他操作。例如,将命令提交到命令队列的函数就来自OpenCL运行时API。
  • OpenCL编程语言:这是用来编写内核代码的编程语言。它基于ISO C99标准的一个扩展子集,因此通常称为OpenCL C编程语言。

在后面的小节中,我们将为以上各个部分提供一个高层的概述。详细内容留待本书后面介绍,不过使用OpenCL时先有一个高层认识会很有帮助。

1. 平台API

平台(platform)一词在OpenCL中有非常特定的含义。它表示宿主机、OpenCL设备和OpenCL框架的组合。一个异构计算机上可以同时存在多个OpenCL平台。例如,CPU开发商和GPU开发商可以在一个系统上分别定义自己的OpenCL框架。程序员需要一种方法查询系统中可用的OpenCL框架。他们需要查找哪些OpenCL设备可用,这些OpenCL设备有什么特性。另外,他们还需要控制这些框架和设备的哪个子集构成给定OpenCL应用中使用的平台。

这些功能由OpenCL平台API中的函数解决。在后面的章节中将会看到,我们重点讨论OpenCL程序员为宿主机程序编写代码时,每个OpenCL应用程序都以类似的方式打开,调用平台API的函数为OpenCL计算定义上下文。

2. 运行时API

平台API中的函数为OpenCL应用定义上下文。运行时API则强调使用这个上下文满足应用需求的函数。这是一个庞大而且确实相当复杂的函数集。

运行时API的第一个任务是建立命令队列。可以将命令队列关联到一个设备,不过一个上下文中可以同时有多个活动的命令队列。

有了命令队列,就可以使用运行时API来定义内存对象和管理内存对象所需要的所有其他对象(如对于图像对象还需要采样器对象)。管理内存对象是一个很重要的任务。为了支持垃圾回收,OpenCL会跟踪多少个内核实例使用这些对象(也就是说,持有一个内存对象),以及内核何时用完一个内存对象(即释放一个内存对象)。

运行时API管理的另一个任务是创建构建动态库所用的程序对象,内核就由这些动态库定义。程序对象、编译程序对象的编译器以及内核定义都在运行时层处理。

最后,与命令队列交互的命令都由运行时层的函数发出。管理数据共享和对内核执行施加约束的同步点也由运行时API处理。

可以看到,运行时API函数完成了宿主机程序的大部分具体工作。要想一次掌握运行时API,从第一个函数开始学完所有函数,这是很有压力的。我们发现,更好的做法是使用一种实用的方法。掌握真正要使用的函数。过一段时间,你就会把它们全面覆盖到,并完全掌握,不过要根据OpenCL应用的具体需要来学习这些函数。

3. 内核编程语言

宿主机程序非常重要,不过完成OpenCL中实际工作的是内核。有些OpenCL实现允许你与非OpenCL编写的原生内核交互,不过,大多数情况下都需要编写内核来完成应用中的特定工作。

OpenCL中的内核编程语言称为OpenCL C编程语言,因为我们希望过一段时间后可以定义符合规范的其他语言。它由ISO C99语言派生而来。

在OpenCL中,要对支持可移植性特别当心。这要求我们标准化不同类的OpenCL设备之间的最小公共子集。由于C99中有些特性只有CPU能够支持,所以在定义OpenCL C编程语言时,我们去掉了C99的一些语言特性。删除的主要语言特性包括:

  • 递归函数。
  • 函数指针。
  • 位域。

另外,我们不支持完整的标准库集合。OpenCL编程语言中不支持的标准头文件很多,不过程序员最有可能遗漏的是stdio.h和stdlib.h。再次说明,一旦不再将通用处理器作为OpenCL设备,这些库将很难获得支持。

由于需要保持OpenCL核心抽象的真实性,所以会带来另外一些限制。例如,OpenCL定义了一组内存地址空间。联合(union)或结构(structure)不能混合类型。另外,OpenCL还定义了一些不透明的类型,例如,支持图像的内存对象。OpenCL C编程语言除了允许将这些类型作为参数传递给函数外,不允许对它们做任何其他处理。

我们将OpenCL C编程语言限制为只满足用于OpenCL的关键OpenCL设备的需求。出于同样的原因,促使我们扩展语言以及以下方面:

  • 矢量类型和这些类型实例上的操作。
  • 地址空间限定符,支持OpenCL对多个地址空间的控制。
  • 一组丰富的内置函数,支持OpenCL应用中通常需要的功能。
  • 全局和局部内存中处理无符号整数和单精度标量变量的原子函数。

大多数编程语言忽略浮点算术系统的特定细节。它们只是从硬件导入算术系统,从而完全避开这个问题。由于所有主流CPU都支持IEEE 754和IEEE 854标准,所以这个策略是可行的。实际上,通过集中研究这些浮点标准,硬件开发商在为语言开发商解决浮点定义的有关问题。

不过,在异构世界中,如果脱离CPU,那么对浮点算术运算的支持会有更多的选择。过去通过与硬件开发商的紧密合作,我们希望大力推动他们完善对IEEE浮点标准的支持。与此同时,我们不希望对这些开发商过于苛刻,所以赋予他们一定的灵活性可以避开IEEE标准中一些不常使用但实现很困难的特性。后面会详细讨论有关细节,不过从高层可以总结为OpenCL需要以下特性:

  • 对IEEE 754格式的全面支持。双精度是可选的,不过如果提供双精度,也必须符合IEEE 754格式。
  • 支持默认的IEEE 754舍入模式,即“舍入为最近整数”。其他舍入模式尽管值得推荐(因为数值分析学者需要这些模式),但它们是可选的。
  • 尽管IEEE规范要求动态改变舍入模式,但OpenCL中的舍入模式是静态设置的。
  • 必须支持特殊值INF(无穷大)和NaN(非数字),不过不要求提示NaN(通常反映并发系统中的问题)。
  • 非规格化数(小于1的数乘以所支持的最大负指数)可以化简为0。如果你还不了解为什么这很重要,不用担心,很多人都与你一样。这也是数值分析学者很依赖但很少有程序员了解的另一个特性。

关于浮点数异常还有很多其他规则,不过它们对大多数人来说都过于复杂、过于深奥,没有必要在这里多做说明。关键是要了解我们已努力满足IEEE 754的大多数内容,同时省略了很少使用而且(在配有矢量单元的异构平台上)难以支持的一些特性。

OpenCL规范并不仅限于IEEE标准。在OpenCL规范中,还有一些表格详尽地定义了数学函数中允许的相对误差。要想了解所有这些错误确实难度很大,不过对于编写详细数值代码的程序员来说,定义这些错误是至关重要的。

综合以上浮点数需求、限制和扩展,就得到了一个非常适合当前异构平台的编程语言,随着这些平台中使用的处理器继续发展,并变得更为通用,OpenCL C编程语言也会随之发展。

4. 小结

我们已经介绍了核心OpenCL框架的基本组成。要单独地了解这些组成部分(我们介绍时就主要采用了这种方式)很重要。为了把这些单独的部分汇集起来,形成OpenCL的一个全景图,下面对应用在OpenCL框架中的基本工作流做个小结,如图1-9所示。

图1-9 这个模块图总结了OpenCL的组成以及一个OpenCL应用执行期间在宿主机上发生的动作

首先是一个定义上下文的宿主机程序。图1-9中的上下文包含两个OpenCL设备、一个CPU和一个GPU。接下来定义了命令队列。这里有两个队列,一个是面向GPU的有序命令队列,另一个是面向CPU的乱序命令队列。然后宿主机程序定义一个程序对象,这个程序对象编译后将为两个OpenCL设备(CPU和GPU)生成内核。接下来宿主机程序定义程序所需的内存对象,并把它们映射到内核的参数。最后,宿主机程序将命令放入命令队列来执行这些内核。

-----------------------------

本文节选自《OpenCL编程指南》

原书名:OpenCL Programming Guide

作者:Aaftab Munshi / Benedict R. Gaster / Timothy G. Mattson / James Fung / Dan Ginsburg

本书由五位OpenCL核心设计人员携手打造,不仅详细而完整地解读了枯燥的OpenCL规范,而且通过一些重要的案例展示了如何利用OpenCL实现大量并行算法、编写复杂的并行程序、对OpenCL进行性能优化,以及探查硬件和针对硬件进行调整,是系统学习OpenCL的经典参考书。

阅读本书PDF样章,请访问http://download.csdn.net/detail/hzbooks/4791805

豆瓣收藏本书,请访问http://book.douban.com/subject/20385439/

OpenCL框架组成相关推荐

  1. OpenCL框架与示例

    OpenCL框架与示例 下面的图简单说明了OpenCL的编程框架,图是用的GPU,其他类似: 名词的概念: Platform (平台):主机加上OpenCL框架管理下的若干设备构成了这个平台,通过这个 ...

  2. Android平台利用OpenCL框架实现并行开发初试

    在我们熟知的桌面平台,GPU得到了极为广泛的应用,小到各种电子游戏,大到高性能计算,多核心.高并行化的GPU成为我们日常娱乐和科学研究必不可少的"利器".同样,在近些年兴起的移动平 ...

  3. 一文细说OpenCL框架

    说明: 子曾经曰过:不懂Middleware的系统软件工程师,不是一个好码农: 1. 介绍 OpenCL(Open Computing Language,开放计算语言):从软件视角看,它是用于异构平台 ...

  4. OpenCL编程详细解析与实例

    OpenCL编程详细解析与实例 C语言与OpenCL的编程示例比较 参考链接: https://www.zhihu.com/people/wujianming_110117/posts 先以图像旋转的 ...

  5. 在Android上使用OpenCL调用GPU加速

    转载:http://blog.csdn.net/dj0379/article/details/39484061 其实去年就已经把Android上OpenCL的demo做出来了,但是由于种种原因一直没有 ...

  6. OpenCL与异构并行计算

    原文:http://blog.csdn.net/changan2001/article/details/52955251 由于人工智能.深度学习和大数据处理随着移动互联的兴起,特别是对于图片.视频.语 ...

  7. OpenVINO安装之安装openCL

    参考: OpenVINO框架及相关工具套件安装https://docs.openvinotoolkit.org/cn/latest/_docs_install_guides_installing_op ...

  8. OpenCV、OpenCL、OpenGL、OpenPCL

    对于几个开源库的总结,作为标记,以前看过,现在开始重视起来!更详细资料请移步 开源中国社区! 涉及:OpenCV,OpenCL,OpenGL,OpenPCL 截止到目前: OpenGL的最新版本为4. ...

  9. OpenCL基础(一)

    OpenCL基础(一) OpenCL简介 OpenCL模型 平台模型 执行模型 上下文 命令队列 存储模型 编程模型 OpenCL简介 OpenCL是由Khronos Group针对异构计算装置进行并 ...

最新文章

  1. Python 进阶 — 面向对象设计原则
  2. 计算机的工作原理题,计算机工作原理试题期中试卷
  3. Winform中怎样重写窗体关闭事件实现验证密码通过才能关闭窗体
  4. 5个令人震惊的统计数据证明日志不足
  5. 计算机原理及应用课程,课程介绍
  6. magento去除子分类的url地址中带有父分类的url key
  7. Android activity跳转动画,6种activity进入动画
  8. Android kernel Crash后,定位出错点的方法
  9. 大并发下程序出错_Python并发编程理论篇
  10. Android:Activity统一堆栈管理(实现随时finish特定或是所有Activty)
  11. Unity+NGUI多分辨率适配方案
  12. 实现一个输入程序,接收从 键盘读入的字符串。当字符串中所含字符个数少于程序设定的上限时,输出这个字符串;否则抛出MyStringException1异常,在异常处理中要求重新输入新的字符串或者中断程序
  13. python语言要多久_怎么自学python,大概要多久?
  14. 单片机流水灯源代码+仿真
  15. PLTS中计算Skew(计算延时差:对内/对间)
  16. 当当图书分类html,基于httpclient与jsoup的抓取当当图书页面数据简单Demo
  17. 批量改变图片尺寸大小的方法!一分钟搞定!
  18. 数据挖掘是什么,数据挖掘的学习路线是什么?
  19. 【03】图解原型和原型链by魔芋
  20. 学习笔记:几种矩阵乘法(matmul product普通乘积、hadamard product矩阵点乘、kronecker product克罗内克积、斯特拉森矩阵乘法)

热门文章

  1. Unity引擎Fps打怪兽小游戏
  2. oracle查看双机状态,如何查看双机状态 - eSight V300R008C00 异地高可用性系统软件安装指南 (SUSE Linux + Oracle + Veritas) 12 - 华为...
  3. Linux virtual filesystem switch I 磁盘相关概念以及知识
  4. 华为笔记本适合计算机网络系学生,适合学生党笔记本电脑,MateBook D系列Windows锐龙版你pick了吗...
  5. android 自定义心电图,Android如何实现动态滚动波形图(心电图)功能
  6. Paraview学习小笔记
  7. Java banner解析
  8. 数据的归一化与标准化
  9. HDLBits-Circuits学习小结(四)D触发器(latches and flip-flops)
  10. 替换T淘宝NPM镜像