【翻译】通过 .NET Core 3.0 SIMD Intrinsics获取4倍加速

2020-03-19 10:35:17 非科班碼農

几周前，我和Den Raskovalov就C＃性能进行了一次有趣的交谈，结果变成了一个很小但有趣的编码练习。证明或反对的陈述是：

下面列出的C ++代码（转换为C＃）在速度方面永远不会接近C ++。

<code>auto computeSum(char* fileName) {
    auto fIn = open(fileName, O_RDONLY | O_BINARY, 0644);

    static constexpr size_t BUFFER_SIZE = 1 << 16;
    uint8_t buffer[BUFFER_SIZE];
    uint8_t const* pBuffer = nullptr;
    size_t bufferPos = 0;
    size_t bufferLen = 0;

    int64_t sum = 0;
    uint8_t b;
    int n = 0;
    while (bufferLen = read(fIn, buffer, BUFFER_SIZE)) {
        pBuffer = buffer;
        const uint8_t* const pBufferEnd = buffer + bufferLen;
        while (pBuffer != pBufferEnd) {
            if (*pBuffer < 128) {
                n = (n << 7) + *pBuffer;
            } else {
                n = (n << 7) + *pBuffer - 128;
                sum += n;
                n = 0;
            }
            ++pBuffer;
        }
    }
    close(fIn);
    return sum;
}
/<code>

假设：

保持单线程
读取的文件可能足够短（〜1 GB或更少），可以缓存在RAM中-即IO带宽不会成为瓶颈。

如果您不想深入研究代码，请执行以下操作：

该文件存储使用可变长度数量编码方案（ Variable-Length Quantity coding scheme）存储(0…1,000,000)范围内的整数列表。计算所有这些整数的总和。

编码方案使用每个字节中的最高有效位（MSB）来指示当前号码的位序列是否连续（MSB = 0）（MSB = 1）。

因此，我们开始改进代码计算的版本，使其总和尽可能快，同时遵守上述规则。

为了简短起见，在这里我主要关注C＃代码，尽管这里您可以同时找到C＃和C++代码（我的存储库，如果有任何情况，我将使用最新版本的C＃和C++代码进行更新）,还有此处（Den的存储库，那里有最新的C++代码）。

原始的C＃代码：

<code>public static long ComputeSum(string fileName, 
    Func<readonlymemory>, long, int, (long, int)> sumComputer)
{
    using var fs = new FileStream(fileName, FileMode.Open);
    using var lease = MemoryPool<byte>.Shared.Rent(MinBufferSize);
    var buffer = lease.Memory;

    long sum = 0;
    int n = 0;
    while (true) {
        var count = fs.Read(buffer.Span);
        if (count == 0)
            return sum + n;
        (sum, n) = sumComputer(buffer.Slice(0, count), sum, n); 

    }
}

private static (long, int) ComputeSum(ReadOnlyMemory<byte> buffer, long sum, int n)
{
    var span = buffer.Span;
    foreach (var b in span) {
        if (b < 128)
            n = (n << 7) + b;
        else {
            sum += (n << 7) + b - 128;
            n = 0;
        }
    }
    return (sum, n);
}
/<byte>/<byte>/<readonlymemory>/<code>

高级包装程序在这里读取文件；它得到一个委托，该委托指向计算逻辑的特定实现（即必须是最佳的）。

在Core i7-8700K，Ubuntu 19.04，gcc或.NET Core 3.0预览版5和约1GB的文件上测试数据的性能：

C++ 约为430毫秒
C＃约为500毫秒

第一轮优化相对简单：

C++：通过编译器选项启用一组优化（-Ofast -fomit-frame-pointer -march = native -mtune = native -funroll-loops -Wno-shift-count-overflow），启用PGO（配置文件引导的优化），使用内存映射文件
C＃：使用不安全的指针，展开主循环，添加依赖异步管道的版本。我做了最后一部分，主要是为了测试是否有任何好处-我使用的实现违反了原始的“单线程”条件，因为生产者在读取该块的同时消费者又在计算总和。另一方面，依赖于内存映射文件的C++版本隐式地执行了类似的操作-因此，在两种情况下，它看起来都不像是完全违反了我们的“单线程”规则（即，我们在这里同意文件读取操作可能并发）。

更新的C＃代码：

<code>public static async Task<long> ComputeSumAsync(string fileName, 
    Func<readonlymemory>, long, int, (long, int)> sumComputer, 
    CancellationToken ct = default)
{
    await using var fs = new FileStream(fileName, FileMode.Open);
    var pipe = new Pipe(new PipeOptions(
        minimumSegmentSize: MinBufferSize, 
        useSynchronizationContext: false));

    async Task ProduceAsync() {
        await fs.CopyToAsync(pipe.Writer, ct);
        pipe.Writer.Complete();
    }

    async Task<long> ConsumeAsync() {
        try {
            var sum = 0L;
            var n = 0;
            var lastTimeProcessed = 0L;
            var readTask = pipe.Reader.ReadAsync(ct);
            while (true) {
                var result = await readTask.ConfigureAwait(false);
                var buffer = result.Buffer;
                var toProcess = buffer.Slice(lastTimeProcessed);
                lastTimeProcessed = toProcess.Length;
                if (toProcess.IsEmpty && (result.IsCompleted || result.IsCanceled))
                    break;
                pipe.Reader.AdvanceTo(toProcess.Start, toProcess.End);
                readTask = pipe.Reader.ReadAsync(ct); // We can start it right now to read while compute
                foreach (var segment in toProcess)
                    (sum, n) = sumComputer(segment.Slice(0), sum, n);
            }
            return sum + n;
        }
        finally {
            pipe.Reader.Complete();
        }
    }

    var (produceTask, consumeTask) = (ProduceAsync(), ConsumeAsync());
        await Task.WhenAll(produceTask, consumeTask);
        return consumeTask.Result;
}
 

private static unsafe (long, int) ComputeSumUnsafeUnrolled(
    ReadOnlyMemory<byte> buffer, long sum, int n)
{
    var span = buffer.Span;
    fixed (byte* pStart = span) {
        var pEnd = pStart + span.Length;
        var pEnd16 = pEnd - 15;
        var p = pStart;
        while (p < pEnd16) {
            // Loop
            var b = p[0];
            n = (b & 127) + (n << 7);
            if ((b & 128) != 0) {
                sum += n; 
                n = 0;
            }

            // Skipping loop repeats for p[1] ... p[14]

            // Loop
            b= p[15];
            n = (b & 127) + (n << 7);
            if ((b & 128) != 0) {
                sum += n; 
                n = 0;
            }

            p += 16;
        }
        while (p < pEnd) {
            var b = *p++;
            n = (b & 127) + (n << 7);
            if ((b & 128) != 0) {
                sum += n; 
                n = 0;
            }
        }
    }
    return (sum, n);
}
/<byte>/<long>/<readonlymemory>/<long>/<code>

结果再次非常相似：

C++版本为394毫秒
带有异步管道的C＃版本416ms
462ms（“常规” C＃版本）

我尝试实现其他一些想法-特别是实现了几乎完全依赖于非分支指令的版本，但没有一个能更好地工作。下一轮带来了将近5倍的加速：Alexey Poyarkov编写了一个非常高效的基于AVX2的和计算代码版本。我依靠.NET Core 3.0 SIMD内联函数将他的代码逐行转换为C＃，以后又进行了一些外观上的更改。这就是C＃代码最终版本的样子：

<code>private static unsafe (long, int) ComputeSumSimd(
    ReadOnlyMemory<byte> buffer, long sum, int n)
{
    var span = buffer.Span;
    fixed (byte* pStart = span) {
        return ComputeSumSimd(new IntPtr(pStart), span.Length, sum, n);
    }
}

private static unsafe (long, int) ComputeSumSimd(
    IntPtr start, long length, long sum, int n)
{
    var b7F = (byte) 127;
    var bFF = (byte) 255;
    var m7F = Avx2.BroadcastScalarToVector256(&b7F);
    var mFF = Avx2.BroadcastScalarToVector256(&bFF);
    var sum0 = Vector256<long>.Zero;
    var sum7 = Vector256<long>.Zero;
    var sum14 = Vector256<long>.Zero;
    var sum21 = Vector256<long>.Zero;

    var p = (byte*) start;
    var pEnd = p + length;

    // The following SIMD loop assumes n == 0 when it starts,
    // so we have to reach this point "manually" here
    if (n != 0) {
        while (p < pEnd) {
            var b = *p++;
            n = (b & 127) + (n << 7);
            if ((b & 128) != 0) { 

                sum += n;
                n = 0;
                break;
            }
        }
    }

    // SIMD loop
    while (p + 36 <= pEnd) {
        // Offset 0
        var x = Avx2.LoadVector256(p);
        // f indicates whether *p has flag (assuming p iterates through vector indexes);
        // f[i] is either 0 (no flag) or -1 (i.e. all byte bits are set)
        var f = Avx2.CompareGreaterThan(Vector256<sbyte>.Zero, x.AsSByte()).AsByte();
        x = Avx2.And(x, m7F);

        // Offset 1
        var x1 = Avx2.LoadVector256(p + 1);
        var f1 = Avx2.CompareGreaterThan(Vector256<sbyte>.Zero, x1.AsSByte()).AsByte();
        // f01 indicates whether *p flag sequence is (0,1); similarly, f[i] is either 0 or -1
        var f01 = Avx2.CompareGreaterThan(f.AsSByte(), f1.AsSByte()).AsByte(); 
        
        // Offset 2
        var x2 = Avx2.LoadVector256(p + 2);
        var f2 = Avx2.CompareGreaterThan(Vector256<sbyte>.Zero, x2.AsSByte()).AsByte();
        var f00 = Avx2.Or(f, f1);
        // f001 indicates whether *p flag sequence is (0,0,1)
        var f001 = Avx2.CompareGreaterThan(f00.AsSByte(), f2.AsSByte()).AsByte();

        var f000 = Avx2.Or(f00, f2);
        // f0001 indicates whether *p flag sequence is (0,0,0,1)
        // we assume here that the 4th byte always has a flag (i.e. the encoding
        // is valid), so we don't read it.
        var f0001 = Avx2.CompareGreaterThan(f000.AsSByte(), mFF.AsSByte()).AsByte();

        sum0 = Avx2.Add(sum0, Avx2.SumAbsoluteDifferences(Avx2.And(x, f), Vector256<byte>.Zero).AsInt64());
        sum7 = Avx2.Add(sum7, Avx2.SumAbsoluteDifferences(Avx2.And(x, f01), Vector256<byte>.Zero).AsInt64());
        sum14 = Avx2.Add(sum14, Avx2.SumAbsoluteDifferences(Avx2.And(x, f001), Vector256<byte>.Zero).AsInt64());
        sum21 = Avx2.Add(sum21, Avx2.SumAbsoluteDifferences(Avx2.And(x, f0001), Vector256<byte>.Zero).AsInt64());

        p += 32;
    }

    var s07 = Avx2.Add(sum0, Avx2.ShiftLeftLogical(sum7, 7));
    var s1421 = Avx2.Add(Avx2.ShiftLeftLogical(sum14, 14), Avx2.ShiftLeftLogical(sum21, 21));
    var s = Avx2.Add(s07, s1421);

    sum += s.GetElement(0) + s.GetElement(1) + s.GetElement(2) + s.GetElement(3);
    n = 0; // Fine assuming we'll process 4+ items in the following loop
     

    while (p < pEnd) {
        var b = *p++;
        n = (b & 127) + (n << 7);
        if ((b & 128) != 0) {
            sum += n; 
            n = 0;
        }
    }
    return (sum, n);
}
/<byte>/<byte>/<byte>/<byte>/<sbyte>/<sbyte>/<sbyte>/<long>/<long>/<long>/<long>/<byte>/<code>

结果：

C++版本为95ms
C＃版本为130ms
带有异步管道的C＃版本为113ms。

最终，我发现在Ubuntu上以C＃版本使用内存映射文件实际上很有意义。我从过去的经验中知道，它们在Windows上没有提供任何好处-而且，情况恰恰相反，因此，我甚至没有尝试将其作为初始优化之一。但是似乎这是在Ubuntu上的.NET Core上读取文件的最快方法：

<code>public static long ComputeSumMMF(string fileName, 
    Func<intptr> sumComputer)
{
    using var f = MemoryMappedFile.CreateFromFile(fileName, FileMode.Open);
    using var fAccessor = f.CreateViewAccessor();
    var fHandle = fAccessor.SafeMemoryMappedViewHandle;
    var (sum, _) = sumComputer(fHandle.DangerousGetHandle(), (long) fHandle.ByteLength, 0, 0);
    return sum;
}
/<intptr>/<code>

最终排名：

C++版本为95ms
C＃版本为101ms 请注意，这些结果几乎是完美的：假设基线是Int64值序列，计算总和的基线测试几乎需要花费相同的时间，因此CPU不再是此代码的瓶颈-而是RAM带宽。这就是我们显然必须停止的地方。

我的结论：

C＃绝对适合于类似的计算密集型任务，尤其是在.NET Core 3.0中
如果您大规模运行类似的工作负载，则预期差异会更小：仅在单线程的情况下，CPU才是该测试的瓶颈。如果我们要同时运行4个或更多类似的任务（想想这是一个Web服务器解码UTF8输入等），即使在非SIMD版本上，它们也会达到RAM带宽限制。

以下是Den Raskovalov的结论（我也完全同意他的观点）：

“我同意亚历克斯做出的大多数结论，但我想强调您对以下几件事的关注：

即使使用现代的编译器和库，低级优化仍然很重要。实际上，该算法的第一个版本比最终版本慢10倍。编译器仍在优化IO模式，无法像经验丰富的工程师一样使用AVX/SSE流水线。
C＃和C++代码的最终版本几乎相同。Microsoft显然了解利用低级优化的重要性。C＃是真正的工具，而不是CS玩具。在我们开始“竞争”之前，我曾希望将原生C++的实现提高10倍，但没想到.NET可以使用相同的低级优化。
即使在2019年平台融合之后，Alex仍无法在Linux运行上开发的C++代码。也无法运行.NET代码。Alex的版本需要.NET核心的最新版本，即使C++版本在6年前的GCC或clang上能很好地工作。”

分享到:

閱讀更多 非科班碼農 的文章

關鍵字: 几周 Scheme 获取

刚刚工作的毕业生，一个月只有2000多，是不是太少了？

刚刚:刚刚工作的毕业生，一个月只有2000多，是不是太少了？根据你城市消费水平来看啊，还有你从事的工作，假如你在二三线城市做一份事业单位或者是编制类的工作，薪资水平是随着你工作年限逐年增长的，而且在年终也有很多福利补贴待遇等等，算下来收入也是可观的，再举一个例:-毕业生 2000

为什么只有edg赚钱？

电竞行业作为一个新兴产业，这几年发展势头越来越好，IG战队，FPX战队先后夺得了s8-s9世界赛的冠军，据俱乐部知情人士透露，除了国内的几家豪门俱乐部之外，其他俱乐部基本都是亏钱在做的，当然EDG也是:-edg 赚钱:为什么只有edg赚钱？

网上罗马仕充电宝20000毫安的，参数怎么很多样？哪个是真的？

20000:网上罗马仕充电宝20000毫安的，参数怎么很多样？哪个是真的？天猫旗舰店，或者淘宝旗舰店，或者京东旗舰店肯定包真，质量好，再说可以官方验证啊，不能图那十块五块的便宜，毕竟一个充电宝要用好久呢，一两年没问题的。:-罗马仕马仕毫安

我们买的新商品房还没有拿到房产证，怎么转卖最好？

没有取得房抄产证的房子可以转让。但如果确定无法取得房产证的，房产转让不受法律保袭护。一般情况下，只有取得房产证的房屋才能确定房屋产权人，才具有转让的条件。但如果房屋是合法取得的，以百后可以依法办理度房:-转卖房产证商品房拿到:我们买的新商品房还没有拿到房产证，怎么转卖最好？

为什么突厥人可以成功复国？是大唐的刀不锋利了么？

锋利突厥人你这样说只能说明你对历史非常不了解，我先用一句话概括突厥被大唐雄兵打的有多惨：三次灭国，背井离乡，远赴西亚，打不过，俺躲着你还不行吗？突厥的意思是中间怂起的头盔。其来历已经不可靠，可能有着匈奴、鲜卑或:-复国大唐:为什么突厥人可以成功复国？是大唐的刀不锋利了么？

小高层16层高楼间距60米哪一层比较好？

小高层 60:小高层16层高楼间距60米哪一层比较好？首先需要明白，选择层数居住与楼间距毫无关系，住在哪一层，肉眼看对面楼的距离，是相差不大的。设定楼间距60米，纯粹是混淆视听。其实，一幢楼的楼层总数确定的情况下，到底哪一层最佳？很简单，取总层数乘以黄金:-楼间距层高

金银花盆栽好养吗？怎么养？

金银花可以盆栽，很好养的！金银花，是忍冬科的常绿缠绕灌木，枝条柔韧修长，多攀爬或匍匐生长。金银花生性强健，在我国的很多南方省份野外很多地区都能看到它的身影，叶子常年翠绿，到夏季开花，飘香四溢。所以，有:-金银花盆栽:金银花盆栽好养吗？怎么养？

长城对于抵御古代匈奴和蒙古人起到了多大作用？

长城真的无用吗？在今天许多人认为长城无用，古代国家举国之力建造的长城不过只是文物，就连康熙都曾作诗讽刺，原文如下：万里经营到海涯，纷纷调发逐浮夸。当时用尽生民力，天下何曾属尔家。-康熙但真的如此吗？小:-匈奴抵御长城:长城对于抵御古代匈奴和蒙古人起到了多大作用？蒙古人

什么树可以嫁接腊梅？

腊梅只能嫁接在不同品种的腊梅上，其他的树种不行！腊梅的繁殖可以用播种，压条，嫁接，分株等繁殖方法。播种法因不易保持花卉的原有优良特性，且播种的优点是在于大量繁殖，而腊梅大都只需培植少量几株，故一般都不:-腊梅嫁接:什么树可以嫁接腊梅？

行情堪忧，还有多少教育机构的老师们五一假期有课上的？课时量多不多？

堪忧五一假期:行情堪忧，还有多少教育机构的老师们五一假期有课上的？课时量多不多？事实上，因为教育培训都是预收费用的模式。但凡有一点点规模的培训机构老师。在上半年，带课量是可以得到保证。:-课时量

在农村“立夏节”都有哪些民间习俗？

民间习俗农村:在农村“立夏节”都有哪些民间习俗？在农村“立夏节”都有哪些民间习俗一、农村立夏常见的习俗风俗活动：1、吃鸡蛋“立夏吃蛋”习俗由来已久，俗话说“立夏吃了蛋，夏天不疰夏”。据说立夏开始天气越来越热，村里小孩儿会有身体疲劳四肢无力的感觉，吃:-立夏节

男朋友失望分手，但对我还有感觉，答应我两个月之后可以在一起，我应该怎么做，才能改变之前他对我的看法？

失望分手看法:男朋友失望分手，但对我还有感觉，答应我两个月之后可以在一起，我应该怎么做，才能改变之前他对我的看法？你的这个问题特别的有趣，我觉得你先不要看你要怎么做才让他才能让他对你的印象有所改变，你要去看为什么是两个月之后可以在一起，这两个月他会用来做什么，为什么会有这两个月？例如他的身体碰到了什么样的问题吗？:-答应我

工程分包乙方人员伤残谁承担？

承担:工程分包乙方人员伤残谁承担？分包乙方分包致人伤残责任谁承担？严格来说，需要了解更多伤残原因才能区分的，作为非专业人士，自己发表一点浅见供题主参考：1、如果甲方是央企的话，他们合同中的责任、义务等条款内已经将自己的责任全部撇开了，更会:-乙方伤残

有哪些看起来毫不相关的两个历史人物实际上有过联系？

实际上:有哪些看起来毫不相关的两个历史人物实际上有过联系？历史人物联系这个词貌似太宽泛了，就好像有一个调皮的答案说的，胡亥和溥仪相隔2000多年，牵强的找，也有联系：都是亡国之君不是。我想题主的意思是两个看起来应该风马牛不相及的人物，在历史上居然是熟悉或是一个时代的:-毫不相关

13年雪铁龙世嘉自动挡7万多公里，没有水泡事故，多少钱能买？

法系车不保值，如果准备常开可以入手，性价比高，价格应该在二至三万之间，二手车一车一况，一况一价，居体价格看车况。:-钱能水泡:13年雪铁龙世嘉自动挡7万多公里，没有水泡事故，多少钱能买？世嘉自动挡

22+吃土少女17年就有驾驶证了，今年才开始开车，想买个二手昂克赛拉，或者有什么好建议吗？

17年驾驶证二手:22+吃土少女17年就有驾驶证了，今年才开始开车，想买个二手昂克赛拉，或者有什么好建议吗？建议买日系二手车，开顺了卖了，买新车，昂克赛拉无法再次出手时获得好价格，而且也不省油，开完日系车直接换德系:-昂克赛拉

如何骑车去台湾骑行？

骑车在台湾没有回归内地前，最好不要去台湾，一是国内政策不允许你去台湾，因为已停止了台湾个人游。二是你偷着去台湾旅游，安全没有保障，偷渡客在哪里也没有安全保障的。以后内地政策允许个人去台湾旅游了，建议那时再:-骑行台湾:如何骑车去台湾骑行？

本人预算5万左右，想买一辆二手法系车！求推荐？

预算:本人预算5万左右，想买一辆二手法系车！求推荐？ 5万预算5万元左右，想买一辆二手法系车？推荐东风标致老款308车型。1 5万元可以买标致308车况好的，没大事故呢，年限15年左右，公里数3万左右，手动档车型。2 标致308车型，底盘调教扎实，跑高速稳定:-法系二手

14年进口马自达5PK进口10年道奇酷威买哪个划算？

道奇你好，好高兴回答你的问题！14年进口马自达5和10年月道奇酷威个人感觉马自达5比较划算。新车价马5报价29.99万，酷威19.38万两款车都是原装进口，马5属于日系，酷威属于美系。两款车不属于同类车型:-酷威马自达 14年:14年进口马自达5PK进口10年道奇酷威买哪个划算？

2020年，河南教育行业国务院特殊津贴推荐，河南大学并列第三，大家怎么看？

特殊津贴高校人才就要重视，河南省高校人才更要重视，这个人才不是评出了的，而是推荐出来的，没有推荐，连参评的资格都没有。国务院特殊津贴人员推荐，不推荐是百分百没希望，推荐了希望就非常，那么是什么是国务院特殊津贴:-河南大学并列 2020年:2020年，河南教育行业国务院特殊津贴推荐，河南大学并列第三，大家怎么看？

本田CRV2019款1.5T舒适版油耗高吗？

李老猫说车为你非专业解答各种选车用车问题本田crv定位于一款紧凑级suv产品，主要对飚丰田荣放，日产奇骏，这款车整体市场表现非常突出，2019年全年累计销量为18.44万台，平均月销1.5万以上，其深:-舒适版本田油耗:本田CRV2019款1.5T舒适版油耗高吗？

国外疫情如果没有得到有效控制，世界会发生什么事情？头脑风暴？

1.世界经济遭到重创疫情影响之下，各行各业基本属于停工停产的状态，在世界经济趋于一体化的今天，停工停产势必会造成一系列的连锁反应，最后导致的结果可能会引发金融危机。2.世界格局可能发生改变美国仍是世界:-头脑风暴控制:国外疫情如果没有得到有效控制，世界会发生什么事情？头脑风暴？疫情国外

本田XRV这款车的整体表现怎么样？我想买1.5T自动豪华版，全款多少钱？

如果有15万元的预算，让你选择一台空间和动力都很不错的小型SUV，我觉得很多的读者都会想到本田XRV这款车型。因为本田XRV确实太出色了，和同级别的其他盒子SUV车型相比，这款车在空间和动力上都有优势:-xrv 自动:本田XRV这款车的整体表现怎么样？我想买1.5T自动豪华版，全款多少钱？本田豪华版

现在存款有14万，借了5万还没收回来，该做什么好？

何去何从:现在存款有14万，借了5万还没收回来，该做什么好？续租存款利息率较低，可以投资较高收益的项目，比如投资基金，一般情况下可获得6%一10%的回报。如果行情好可达到50%以上收益，去年不少基金超过这目标。目前受疫情影响，股市在低位震荡，也是基金投资的机会。一:-存款 2300

2070super和5700xt买哪个比较好？

如果是玩游戏毫无疑问选择n卡，也就是2070 suep。如果追求性价比可以选择a卡，也就是5700xt. 为什么游戏选n卡呢？首先游戏厂商针对n卡优化比较多，然后就是功耗小，然后N卡架构执行效率极高，:-:2070super和5700xt买哪个比较好？

生完二胎后，感觉自己有点抑郁，总是想发火，特别烦躁，怎么办？

二胎我是两个孩子的妈妈，曾经的我和你一样，生完宝宝我也抑郁了，我知道抑郁症真的很痛苦，产后的那段日子我整天都不开心，做什么事也没积极性，谁也不想搭理，别人给我说话我就觉得很烦。忍不住冲家人发脾气。每当一个:-生完抑郁:生完二胎后，感觉自己有点抑郁，总是想发火，特别烦躁，怎么办？发火

人这一生遇到的人和事为什么感觉都像是必然的经历？

感觉:人这一生遇到的人和事为什么感觉都像是必然的经历？正所谓有因必有果，所以你今天的因，就会产生明天的果。所以这一切你就会觉得是必然的。生活中大部分是普通人大家的生活规律，生活方式，大致相同。当你看到别人家庭的果，自己家也产生同样的果，你就会觉得这一切是:-人和经历

现在校内校外到底教的是美式英语还是英式英语还是混搭英语？

校内:现在校内校外到底教的是美式英语还是英式英语还是混搭英语？校外英式答案肯定是不唯一的！美式英语现在是主流，少量英式发音也个别存在！但对于孩子来说，肯定是混搭英语，因为孩子肯定不是一直一位老师教下去，肯定会换老师！而老师的发音肯定是既有英式的，也有美式的！就连一些英语:-美式英语

上有老下有小，我们真的跳不出这个人生循环了吗？

上有老魔咒:上有老下有小，我们真的跳不出这个人生循环了吗？的确如此，尽管现在不结婚，晚婚的人很多，但是从人类繁洐生息的历史和大多数人来看，成家立业，生儿育女，家庭仍是主流，一个人的生理，心理和生存需求決定了生存状态，生儿育女，瞻养父母即是义务责任，也是生活动:-下有小

如果外面正在下小雨，你会突然想起了谁？

想起:如果外面正在下小雨，你会突然想起了谁？我最不忘，还是秋日的雨夜，天又凉了几分，已经需要披上一件薄薄的外套了。临窗而望，眼见窗台上的几株小植物，叶片上沾了几滴小雨珠，我总喜欢，用小手电去照它们，这样的小水滴看起来晶莹晶莹的，有一种清清凉凉的:-小雨

初中同学许久未见大学期间突然联系请吃饭，态度还良好，我给推了，会不会让人很烦？

初中同学:初中同学许久未见大学期间突然联系请吃饭，态度还良好，我给推了，会不会让人很烦？吃饭许久未见，意思就是交情不怎么样，无功不受禄，人家凭什么那么热情，难道真的是多年一来忘不了咱们之间的同学情谊，倍感想念了吗，不是请帮忙、做业务、就是借钱，十有八九十借钱。我建议还是不要去的好，大家都很忙:-许久未见

现在我觉得认真对某个人说我喜欢你什么的这种话好恶心，我爱你更说不出口，好恶心，是什么心理？

出口心理:现在我觉得认真对某个人说我喜欢你什么的这种话好恶心，我爱你更说不出口，好恶心，是什么心理？爱你更多的是心里问题，可能对方还没有优秀到你满意的程度，更没有到那种离不开的地步！爱情最终还是要回归生活，而生活离不开两个人的相处，父母终究会老，孩子终究会飞，所以选择自己的伴侣尤为重要，你现在觉得恶心更:-喜欢你

剧版的《何以笙箫默》和《再见王沥川》哪一个更好看呢？

再见王沥川好看:剧版的《何以笙箫默》和《再见王沥川》哪一个更好看呢？《遇见王沥川》吧，高以翔的王沥川太招人稀罕了。长相，身材，家世，人品，才能样样好，简直完美，挑不出任何毛病，实在要说一个缺点的话，那就是太tm完美，天妒英才、才让他饱受病魔折磨。偶像剧、深情帅气的男主:-何以笙箫默

计算机专业本科能够进入字节跳动、华为这些公司做开发吗？是否还需要继续读研？

学历是求职必备条件。有了工作不能停止对知识的探索。更高的学历，可以让你有更专业的技术能力和学习能力，可以让你拓展自己的交际圈，可以让你更知名。总之，活到老，学到老，学习对人总是有好处的，技多不压身嘛！:-字节跳动:计算机专业本科能够进入字节跳动、华为这些公司做开发吗？是否还需要继续读研？读研计算机专业

生完二胎的你们，现在有什么感想？

二胎家庭日常是什么样的？是不是觉得家里多了一个小人儿，温馨多了？不存在的！生二胎根本是妈妈们的渡劫磨砺！以前周末睡到自然醒，现在全年无休，时刻警醒着，能睡一次懒觉跟过年似的，黑眼圈不说，头发呼啦啦地掉:-生完二胎感想:生完二胎的你们，现在有什么感想？

华北适合种植蚕豆吗？

华北适合种植蚕豆，种蚕豆的面积大，在西北，华北，都在种植蚕豆，蚕豆茎秆根部有根瘤菌是种植其它农作物的好茬地，特别是土壤培养和防病虫害起到作用。:-蚕豆种植适合:华北适合种植蚕豆吗？华北

华为手机更新EMUI10.1系统后效果咋样？

大家知道现在智能手机的性能不仅仅跟智能手机的硬件有关，还跟智能手机的系统软件息息相关，在国产智能手机操作系统里，小米的MIUI系统跟华为的EMUI系统都是比较优秀的操作系统。最近小米推出了小米MIUI:-咋样华为华为手机更新:华为手机更新EMUI10.1系统后效果咋样？

大热天蜜蜂老是爬到箱外结群正常吗？

蜜蜂爬到:大热天蜜蜂老是爬到箱外结群正常吗？盗蜂现在正是夏季，很多地方蜜源稀少，蜂群中可能缺蜜，也是胡蜂猖獗的时间，所以蜂群中是非常容易发生盗蜂的。在蜂群中发生盗蜂的时候，蜂群守卫蜂会增多，但是这种情况引发的蜜蜂在蜂箱外一般不会结团，只是蜜蜂来:-大热天

辣椒正是生长最佳期，偏偏有的辣椒苗蔫，不是病虫害是咋回事？

最佳期雾都山客来回答您的问题。最近山客家乡的村民正在进行辣椒移栽，确实有像题主提到的情形，辣椒苗移栽前长势葱葱，嫩绿喜人，但是移栽后几天内就出现萎蔫现象，细心观察也不是被病虫害危害。那究竟是什么原因导致辣椒:-苗蔫辣椒咋回事:辣椒正是生长最佳期，偏偏有的辣椒苗蔫，不是病虫害是咋回事？

手机相机发展的最终形态会是怎样的？

最近这几年手机在电子产品行业里可谓是发展速度非常快，苹果和华为两大公司可以说也是，明争暗斗，产品一次比一次有卖点，前一段时间华为和苹果还都推出了手机新品，两家都在大力宣传强调着拍照功能，像iPhone:-形态相机手机最终:手机相机发展的最终形态会是怎样的？

华为为什么不出一款5寸全面屏手机呢？我想应该会有很多人支持吧？

5寸手机支持:华为为什么不出一款5寸全面屏手机呢？我想应该会有很多人支持吧？很高兴回答你的问题，刷头条刷出来的问题，看到很多人回答，感觉还有一些观点没有写出，所以我来回答一下。首先，华为为什么不出小尺寸全面屏手机？其实并不只有华为一家没有出小屏手机，放眼近期各大手机厂商发布的:-华为

生吃山芋，生吃胡萝卜，还有哪些蔬菜可以生吃呢？

胡萝卜蔬菜:生吃山芋，生吃胡萝卜，还有哪些蔬菜可以生吃呢？第一种，黄瓜。这个瓜，可不是菜市场中堆放满满的青瓜。各位可要睁大眼睛看清楚了，这个黄瓜，青中带黄，品种属以前乡下农户少量种植的，形态上面来看这种瓜矮、短、圆，表面覆盖有比较淡的细毛，经水轻轻冲洗之后整:-山芋

为什么马铃薯不宜过早过迟播种？

不宜:为什么马铃薯不宜过早过迟播种？播种过早为什么马铃薯不宜过早过迟播种？马铃薯的种植主要是由于气候条件的限制，过早出苗后容易遇到低温被冻死，种植晚了容易遇到干旱和高温，影响产量。马铃薯种植时间的早晚必须根据种植地方的气候条件来确定。马铃薯生长:-马铃薯

疫情愈发严重，原油为何反而大涨？

原油愈发:疫情愈发严重，原油为何反而大涨？疫情愈发严重和原油大涨没有必然关系。但是资金总是从高处流向低处，原油价格跌的越多，投资价值越明显，相对于其他产业更有投资价值。举个例子：深圳南山房价均价大约6万左右，宝安均价5万左右，如果南山房价涨到:-疫情

生菜球很好吃，怎么种植才能高产呢？

种植:生菜球很好吃，怎么种植才能高产呢？高产对环境条件的要求、1.温度生菜球为喜冷凉、忌高温作物，种子在4度以上可发芽、以15～20度为发芽适温。幼苗能耐较低温度，日平均温度12度时生长壮健，叶球生长最适温度为13～16度。不过目前有些结球生菜:-生菜

装修高手来帮忙看下144平，套内122平，怎么三房改四房？？

看下这个户型三房改四房，改一个小房间，应该没有问题。△原户型图这个户型改四房，能改的方案比较多，但是修改以后是否好用，是一件值得考虑的事情。一、主卧室变为两个卧室可以将主卧室改为两个卧室，但是这样的改动占:-房改 122:装修高手来帮忙看下144平，套内122平，怎么三房改四房？？ 144

大家帮忙看看这个房子如果要砸墙的话，怎么改比较好？

房子:大家帮忙看看这个房子如果要砸墙的话，怎么改比较好？这个户型砸墙，当然可以砸墙，但是在砸墙之前，要搞清楚为什么要砸墙，砸墙以后有什么优劣。△原户型原户型图上的白色墙体部分不是承重墙，理论上说否可以砸掉。但是外墙和与旁边户型或者是公共区域的共用墙体和图上:-帮忙

意蜂夏季喝什么水降温？

降温意蜂夏季喝什么水降温？气温高，蜂巢温度高的情况下，蜜蜂是通过采水的办法挂在蜂箱的四壁来蒸发带走热量，降低蜂巢温度同时也能帮助蜂群维持正常的湿度。在平常的情况下，蜜蜂是在室外采自然水的。夏季消耗的水量:-意蜂夏季:意蜂夏季喝什么水降温？

黄瓜种子催芽后种植需要打底水吗？

黄瓜种子:黄瓜种子催芽后种植需要打底水吗？你好很高兴回答这个问题。答案：不用。1-2天可出芽。黄瓜种子催芽：选用饱满的种子，用30℃水浸泡4小时后催芽。也可用100倍福尔马林溶液浸泡种子10-20分钟，洗净后清水浸种3-4小时，然后于25-3:-催芽黄瓜打底

书友们展示一下自我感觉发挥较好的作品，一起学习？

自我较好这幅作品是参赛的，色彩的搭配，纸张的拼接都是自己设计完成的，一如既往的清新淡雅感觉。书体用的魏碑中楷书，增加了书写的趣味性。:-书友展示:书友们展示一下自我感觉发挥较好的作品，一起学习？

【翻译】通过 .NET Core 3.0 SIMD Intrinsics获取4倍加速

相關文章:

刚刚工作的毕业生，一个月只有2000多，是不是太少了？

为什么只有edg赚钱？

网上罗马仕充电宝20000毫安的，参数怎么很多样？哪个是真的？

我们买的新商品房还没有拿到房产证，怎么转卖最好？

为什么突厥人可以成功复国？是大唐的刀不锋利了么？

小高层16层高楼间距60米哪一层比较好？

金银花盆栽好养吗？怎么养？

长城对于抵御古代匈奴和蒙古人起到了多大作用？

什么树可以嫁接腊梅？

行情堪忧，还有多少教育机构的老师们五一假期有课上的？课时量多不多？

在农村“立夏节”都有哪些民间习俗？

男朋友失望分手，但对我还有感觉，答应我两个月之后可以在一起，我应该怎么做，才能改变之前他对我的看法？

工程分包乙方人员伤残谁承担？

有哪些看起来毫不相关的两个历史人物实际上有过联系？

13年雪铁龙世嘉自动挡7万多公里，没有水泡事故，多少钱能买？

22+吃土少女17年就有驾驶证了，今年才开始开车，想买个二手昂克赛拉，或者有什么好建议吗？

如何骑车去台湾骑行？

本人预算5万左右，想买一辆二手法系车！求推荐？

14年进口马自达5PK进口10年道奇酷威买哪个划算？

2020年，河南教育行业国务院特殊津贴推荐，河南大学并列第三，大家怎么看？

本田CRV2019款1.5T舒适版油耗高吗？

国外疫情如果没有得到有效控制，世界会发生什么事情？头脑风暴？

本田XRV这款车的整体表现怎么样？我想买1.5T自动豪华版，全款多少钱？

现在存款有14万，借了5万还没收回来，该做什么好？

2070super和5700xt买哪个比较好？

生完二胎后，感觉自己有点抑郁，总是想发火，特别烦躁，怎么办？

人这一生遇到的人和事为什么感觉都像是必然的经历？

现在校内校外到底教的是美式英语还是英式英语还是混搭英语？

上有老下有小，我们真的跳不出这个人生循环了吗？

如果外面正在下小雨，你会突然想起了谁？

初中同学许久未见大学期间突然联系请吃饭，态度还良好，我给推了，会不会让人很烦？

现在我觉得认真对某个人说我喜欢你什么的这种话好恶心，我爱你更说不出口，好恶心，是什么心理？

剧版的《何以笙箫默》和《再见王沥川》哪一个更好看呢？

计算机专业本科能够进入字节跳动、华为这些公司做开发吗？是否还需要继续读研？

生完二胎的你们，现在有什么感想？

华北适合种植蚕豆吗？

华为手机更新EMUI10.1系统后效果咋样？

大热天蜜蜂老是爬到箱外结群正常吗？

辣椒正是生长最佳期，偏偏有的辣椒苗蔫，不是病虫害是咋回事？

手机相机发展的最终形态会是怎样的？

华为为什么不出一款5寸全面屏手机呢？我想应该会有很多人支持吧？

生吃山芋，生吃胡萝卜，还有哪些蔬菜可以生吃呢？

为什么马铃薯不宜过早过迟播种？

疫情愈发严重，原油为何反而大涨？

生菜球很好吃，怎么种植才能高产呢？

装修高手来帮忙看下144平，套内122平，怎么三房改四房？ ？

大家帮忙看看这个房子如果要砸墙的话，怎么改比较好？

意蜂夏季喝什么水降温？

黄瓜种子催芽后种植需要打底水吗？

书友们展示一下自我感觉发挥较好的作品，一起学习？

股市中的“庄股”有什么特征？如何在“庄股”中赚钱？

短线如何选股票？短线怎样选股票？

有的老股民说“股价和均线是同步关系”，对此你怎么看？

杨振宁是中国有史以来最伟大的科学家吗？你怎么看？

你们认为阿水跟UZI谁算是lpl最强ADC？

庄家是怎么抛出筹码来打压股价的？

红旗车的质量怎么样？

逍客2.0家用汽车怎么样？

超短线如何确定卖点？

如何快速发现筹码集中的股票？

哪些材料可以证明你目前在职？

公司没有按照规定以员工实际月工资为基数缴纳五险一金，员工能否申请劳动保障进行补交？

用户交了物业管理费后，物业开具的是发票还是收据呢？不开发票的话，是否涉嫌偷税漏税？

债券基金真的稳健吗？有何风险？

36岁，是区直事业单位副高，如果通过了事业编转公务员考试变成了科员，该如何选择？

经典游戏《仙剑奇侠传1》中有哪些隐藏得比较深的道具？

事业单位高级工和普工同时缴纳社保，退休后养老金会有区别吗？

没房、没车、没存款、没有帅气的外表，这样的男生会有女生愿意嫁给他吗？

坐月子的时候会怀孕吗？

女生被喜欢的男生拒绝后很自卑该怎么办？

追女生一般追到什么时候就该放弃？

重庆法官遇刺案，你怎么看？

你吃到过哪些很有名却很难吃的小吃？

肾不好，身体会有哪些反应？

有哪些五十岁的女性还在起早贪黑的工作？

中国人正常工资到底应该拿多少钱才算合理？

科创板的变化对A股市场的影响怎么样？

一只股票，在低位没有成交量了，严重缩量，是好事还是坏事？

装修高手来帮忙看下144平，套内122平，怎么三房改四房？？