如何使用矢量化解决方案提高IP地址解析速度？-C++-PHP中文网

提高 IP 地址解析速度

用于快速 IPv4 解析的矢量化解决方案

洗牌桌预计算

性能基准

首页

后端开发

C++

如何使用矢量化解决方案提高IP地址解析速度？

Barbara Streisand

Nov 15, 2024 am 04:24 AM

How to improve IP address parsing speed using vectorized solutions?

提高 IP 地址解析速度

您当前解析 IPv4 地址的代码相当高效，但可以进一步优化以获得更快的速度。一种方法是利用专门为此任务设计的矢量化解决方案。

用于快速 IPv4 解析的矢量化解决方案

对于支持 SSE4.1 或 SSSE3 指令的 x86 处理器，这里有一个可显着提高性能的矢量化解决方案:

__m128i shuffleTable[65536];    //can be reduced 256x times, see @IwillnotexistIdonotexist

UINT32 MyGetIP(const char *str) {
    __m128i input = _mm_lddqu_si128((const __m128i*)str);   //"192.167.1.3"
    input = _mm_sub_epi8(input, _mm_set1_epi8('0'));        //1 9 2 254 1 6 7 254 1 254 3 208 245 0 8 40 
    __m128i cmp = input;                                    //...X...X.X.XX...  (signs)
    UINT32 mask = _mm_movemask_epi8(cmp);                   //6792 - magic index
    __m128i shuf = shuffleTable[mask];                      //10 -1 -1 -1 8 -1 -1 -1 6 5 4 -1 2 1 0 -1 
    __m128i arr = _mm_shuffle_epi8(input, shuf);            //3 0 0 0 | 1 0 0 0 | 7 6 1 0 | 2 9 1 0 
    __m128i coeffs = _mm_set_epi8(0, 100, 10, 1, 0, 100, 10, 1, 0, 100, 10, 1, 0, 100, 10, 1);
    __m128i prod = _mm_maddubs_epi16(coeffs, arr);          //3 0 | 1 0 | 67 100 | 92 100 
    prod = _mm_hadd_epi16(prod, prod);                      //3 | 1 | 167 | 192 | ? | ? | ? | ?
    __m128i imm = _mm_set_epi8(-1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, 6, 4, 2, 0);
    prod = _mm_shuffle_epi8(prod, imm);                     //3 1 167 192 0 0 0 0 0 0 0 0 0 0 0 0
    return _mm_extract_epi32(prod, 0);
//  return (UINT32(_mm_extract_epi16(prod, 1)) << 16) + UINT32(_mm_extract_epi16(prod, 0)); //no SSE 4.1
}

登录后复制

洗牌桌预计算

为了有效地利用这个矢量化解决方案，需要一个预先计算的洗牌表shuffleTable，可以按如下方式生成：

void MyInit() {
    memset(shuffleTable, -1, sizeof(shuffleTable));
    int len[4];
    for (len[0] = 1; len[0] <= 3; len[0]++)
        for (len[1] = 1; len[1] <= 3; len[1]++)
            for (len[2] = 1; len[2] <= 3; len[2]++)
                for (len[3] = 1; len[3] <= 3; len[3]++) {
                    int slen = len[0] + len[1] + len[2] + len[3] + 4;
                    int rem = 16 - slen;
                    for (int rmask = 0; rmask < 1<<rem; rmask++) {
//                    { int rmask = (1<<rem)-1;    //note: only maximal rmask is possible if strings are zero-padded
                        int mask = 0;
                        char shuf[16] = {-1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1};
                        int pos = 0;
                        for (int i = 0; i < 4; i++) {
                            for (int j = 0; j < len[i]; j++) {
                                shuf[(3-i) * 4 + (len[i]-1-j)] = pos;
                                pos++;
                            }
                            mask ^= (1<<pos);
                            pos++;
                        }
                        mask ^= (rmask<<slen);
                        _mm_store_si128(&amp;shuffleTable[mask], _mm_loadu_si128((__m128i*)shuf));
                    }
                }
}

登录后复制

性能基准

在 Ivy Bridge 处理器上，矢量化解决方案展示了令人印象深刻的性能，每秒处理 3.36 亿个地址。这比原始问题中提供的代码大约快 7.8 倍。

以上是如何使用矢量化解决方案提高IP地址解析速度？的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

热工具

热门话题

Java教程

1655

CakePHP 教程

1413

Laravel 教程

1306

PHP教程

1252

C# 教程

1226

显示更多

Related knowledge

C语言数据结构：树和图的数据表示与操作 Apr 04, 2025 am 11:18 AM

C语言数据结构：树和图的数据表示与操作树是一个层次结构的数据结构由节点组成，每个节点包含一个数据元素和指向其子节点的指针二叉树是一种特殊类型的树，其中每个节点最多有两个子节点数据表示structTreeNode{intdata;structTreeNode*left;structTreeNode*right;};操作创建树遍历树（先序、中序、后序）搜索树插入节点删除节点图是一个集合的数据结构，其中的元素是顶点，它们通过边连接在一起边可以是带权或无权的数据表示邻

C语言文件操作难题的幕后真相 Apr 04, 2025 am 11:24 AM

文件操作难题的真相：文件打开失败：权限不足、路径错误、文件被占用。数据写入失败：缓冲区已满、文件不可写、磁盘空间不足。其他常见问题：文件遍历缓慢、文本文件编码不正确、二进制文件读取错误。

C＃与C：历史，进化和未来前景 Apr 19, 2025 am 12:07 AM

C#和C 的历史与演变各有特色，未来前景也不同。1.C 由BjarneStroustrup在1983年发明，旨在将面向对象编程引入C语言，其演变历程包括多次标准化，如C 11引入auto关键字和lambda表达式，C 20引入概念和协程，未来将专注于性能和系统级编程。2.C#由微软在2000年发布，结合C 和Java的优点，其演变注重简洁性和生产力，如C#2.0引入泛型，C#5.0引入异步编程，未来将专注于开发者的生产力和云计算。

CS-第 3 周 Apr 04, 2025 am 06:06 AM

算法是解决问题的指令集，其执行速度和内存占用各不相同。编程中，许多算法都基于数据搜索和排序。本文将介绍几种数据检索和排序算法。线性搜索假设有一个数组[20,500,10,5,100,1,50]，需要查找数字50。线性搜索算法会逐个检查数组中的每个元素，直到找到目标值或遍历完整个数组。算法流程图如下：线性搜索的伪代码如下：检查每个元素：如果找到目标值：返回true返回falseC语言实现：#include#includeintmain(void){i

C语言多线程编程：新手指南与疑难解答 Apr 04, 2025 am 10:15 AM

C语言多线程编程指南：创建线程：使用pthread_create()函数，指定线程ID、属性和线程函数。线程同步：通过互斥锁、信号量和条件变量防止数据竞争。实战案例：使用多线程计算斐波那契数，将任务分配给多个线程并同步结果。疑难解答：解决程序崩溃、线程停止响应和性能瓶颈等问题。

c语言如何输出倒数 Apr 04, 2025 am 08:54 AM

如何在 C 语言中输出倒数？回答：使用循环语句。步骤：1. 定义变量 n 存储要输出的倒数数字；2. 使用 while 循环持续打印 n 直到 n 小于 1；3. 在循环体内，打印出 n 的值；4. 在循环末尾，将 n 减去 1 以输出下一个更小的倒数。

c语言函数的定义调用声明格式怎么搞 Apr 04, 2025 am 06:03 AM

C语言函数包含定义、调用和声明。函数定义指定函数名、参数和返回类型，函数体实现功能；函数调用执行函数并提供参数；函数声明告知编译器函数类型。值传递用于参数传递，注意返回类型，保持一致的代码风格，并在函数中处理错误。掌握这些知识有助于编写优雅、健壮的C代码。

C 中的整数：一点历史 Apr 04, 2025 am 06:09 AM

整数是编程中最基础的数据类型，堪称编程的基石。程序员的工作就是赋予这些数字意义，无论软件多么复杂，最终都归结于整数运算，因为处理器只理解整数。为了表示负数，我们引入了二进制补码；为了表示小数，我们创造了科学计数法，于是有了浮点数。但归根结底，一切仍然离不开0和1。整数的简史在C语言中，int几乎是默认类型。尽管编译器可能会发出警告，但在许多情况下，你仍然可以写下这样的代码：main(void){return0;}从技术角度来看，这与以下代码等效：intmain(void){return0;}这种

See all articles

如何使用矢量化解决方案提高IP地址解析速度？

提高 IP 地址解析速度

用于快速 IPv4 解析的矢量化解决方案

洗牌桌预计算

性能基准

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题