Commit ef893128 authored by Michael R. Crusoe's avatar Michael R. Crusoe Committed by Michael R. Crusoe

avx512 cmp,cvt,cvts,cvtt,cvtus,gather,kand,permutex,rcp: new ops for intgemm

sse/sse2: added ".f16" float16 accessor for m128 & m128i

mm{256,512}_cvt{ph_ps,ps_ph}: use .f16 instead of converting from u16

mm512_cvt{epi8_epi16,epi32_ps,cvtph_ps}: added _mm256_cvt* native fallbacks
parent 4a29d21f
......@@ -30,6 +30,7 @@
#define SIMDE_X86_AVX_H
#include "sse4.2.h"
#include "../simde-f16.h"
HEDLEY_DIAGNOSTIC_PUSH
SIMDE_DISABLE_UNWANTED_DIAGNOSTICS
......@@ -165,6 +166,11 @@ typedef union {
SIMDE_ALIGN_TO_32 simde_int128 i128 SIMDE_VECTOR(32) SIMDE_MAY_ALIAS;
SIMDE_ALIGN_TO_32 simde_uint128 u128 SIMDE_VECTOR(32) SIMDE_MAY_ALIAS;
#endif
#if defined(SIMDE_FLOAT16_VECTOR)
SIMDE_ALIGN_TO_32 simde_float16 f16 SIMDE_VECTOR(32) SIMDE_MAY_ALIAS;
#else
SIMDE_ALIGN_TO_32 simde_float16 f16[16];
#endif
SIMDE_ALIGN_TO_32 simde_float32 f32 SIMDE_VECTOR(32) SIMDE_MAY_ALIAS;
SIMDE_ALIGN_TO_32 simde_float64 f64 SIMDE_VECTOR(32) SIMDE_MAY_ALIAS;
SIMDE_ALIGN_TO_32 int_fast32_t i32f SIMDE_VECTOR(32) SIMDE_MAY_ALIAS;
......@@ -184,6 +190,7 @@ typedef union {
SIMDE_ALIGN_TO_32 simde_int128 i128[2];
SIMDE_ALIGN_TO_32 simde_uint128 u128[2];
#endif
SIMDE_ALIGN_TO_32 simde_float16 f16[16];
SIMDE_ALIGN_TO_32 simde_float32 f32[8];
SIMDE_ALIGN_TO_32 simde_float64 f64[4];
#endif
......
......@@ -55,6 +55,7 @@
#include "avx512/cvt.h"
#include "avx512/cvtt.h"
#include "avx512/cvts.h"
#include "avx512/cvtus.h"
#include "avx512/dbsad.h"
#include "avx512/div.h"
#include "avx512/dpbf16.h"
......@@ -72,7 +73,9 @@
#include "avx512/fnmadd.h"
#include "avx512/fnmsub.h"
#include "avx512/fpclass.h"
#include "avx512/gather.h"
#include "avx512/insert.h"
#include "avx512/kand.h"
#include "avx512/kshift.h"
#include "avx512/knot.h"
#include "avx512/kxor.h"
......@@ -95,11 +98,13 @@
#include "avx512/or.h"
#include "avx512/packs.h"
#include "avx512/packus.h"
#include "avx512/permutex.h"
#include "avx512/permutexvar.h"
#include "avx512/permutex2var.h"
#include "avx512/popcnt.h"
#include "avx512/range.h"
#include "avx512/range_round.h"
#include "avx512/rcp.h"
#include "avx512/reduce.h"
#include "avx512/rol.h"
#include "avx512/rolv.h"
......
......@@ -38,6 +38,105 @@ HEDLEY_DIAGNOSTIC_PUSH
SIMDE_DISABLE_UNWANTED_DIAGNOSTICS
SIMDE_BEGIN_DECLS_
SIMDE_HUGE_FUNCTION_ATTRIBUTES
simde__mmask64
simde_mm512_cmp_epi8_mask (simde__m512i a, simde__m512i b, const int imm8)
SIMDE_REQUIRE_CONSTANT_RANGE(imm8, 0, 7) {
simde__m512i_private
r_,
a_ = simde__m512i_to_private(a),
b_ = simde__m512i_to_private(b);
switch (imm8) {
case SIMDE_MM_CMPINT_EQ:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i8 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i8), (a_.i8 == b_.i8));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i8) / sizeof(r_.i8[0])) ; i++) {
r_.i8[i] = (a_.i8[i] == b_.i8[i]) ? ~UINT32_C(0) : UINT32_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_LT:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i8 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i8), (a_.i8 < b_.i8));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i8) / sizeof(r_.i8[0])) ; i++) {
r_.i8[i] = (a_.i8[i] < b_.i8[i]) ? ~UINT32_C(0) : UINT32_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_LE:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i8 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i8), (a_.i8 <= b_.i8));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i8) / sizeof(r_.i8[0])) ; i++) {
r_.i8[i] = (a_.i8[i] <= b_.i8[i]) ? ~UINT32_C(0) : UINT32_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_FALSE:
r_ = simde__m512i_to_private(simde_mm512_setzero_si512());
break;
case SIMDE_MM_CMPINT_NE:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i8 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i8), (a_.i8 != b_.i8));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i8) / sizeof(r_.i8[0])) ; i++) {
r_.i8[i] = (a_.i8[i] != b_.i8[i]) ? ~UINT32_C(0) : UINT32_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_NLT:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i8 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i8), ~(a_.i8 < b_.i8));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i8) / sizeof(r_.i8[0])) ; i++) {
r_.i8[i] = !(a_.i8[i] < b_.i8[i]) ? ~UINT32_C(0) : UINT32_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_NLE:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i8 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i8), ~(a_.i8 <= b_.i8));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i8) / sizeof(r_.i8[0])) ; i++) {
r_.i8[i] = !(a_.i8[i] <= b_.i8[i]) ? ~UINT32_C(0) : UINT32_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_TRUE:
r_ = simde__m512i_to_private(simde_x_mm512_setone_si512());
break;
default:
HEDLEY_UNREACHABLE();
}
return simde_mm512_movepi8_mask(simde__m512i_from_private(r_));
}
#if defined(SIMDE_X86_AVX512BW_NATIVE)
#define simde_mm512_cmp_epi8_mask(a, b, imm8) _mm512_cmp_epi8_mask((a), (b), (imm8))
#endif
#if defined(SIMDE_X86_AVX512BW_ENABLE_NATIVE_ALIASES)
#undef _mm512_cmp_epi8_mask
#define _mm512_cmp_epi8_mask(a, b, imm8) simde_mm512_cmp_epi8_mask((a), (b), (imm8))
#endif
SIMDE_HUGE_FUNCTION_ATTRIBUTES
simde__mmask16
simde_mm512_cmp_ps_mask (simde__m512 a, simde__m512 b, const int imm8)
......@@ -763,6 +862,115 @@ simde_mm512_cmp_ph_mask (simde__m512h a, simde__m512h b, const int imm8)
#define _mm512_cmp_ph_mask(a, b, imm8) simde_mm512_cmp_ph_mask((a), (b), (imm8))
#endif
SIMDE_HUGE_FUNCTION_ATTRIBUTES
simde__mmask32
simde_mm512_cmp_epi16_mask (simde__m512i a, simde__m512i b, const int imm8)
SIMDE_REQUIRE_CONSTANT_RANGE(imm8, 0, 7) {
simde__m512i_private
r_,
a_ = simde__m512i_to_private(a),
b_ = simde__m512i_to_private(b);
switch (imm8) {
case SIMDE_MM_CMPINT_EQ:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i16 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i16), (a_.i16 == b_.i16));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i16) / sizeof(r_.i16[0])) ; i++) {
r_.i16[i] = (a_.i16[i] == b_.i16[i]) ? ~UINT16_C(0) : UINT16_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_LT:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i16 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i16), (a_.i16 < b_.i16));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i16) / sizeof(r_.i16[0])) ; i++) {
r_.i16[i] = (a_.i16[i] < b_.i16[i]) ? ~UINT16_C(0) : UINT16_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_LE:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i16 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i16), (a_.i16 <= b_.i16));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i16) / sizeof(r_.i16[0])) ; i++) {
r_.i16[i] = (a_.i16[i] <= b_.i16[i]) ? ~UINT16_C(0) : UINT16_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_FALSE:
r_ = simde__m512i_to_private(simde_mm512_setzero_si512());
break;
case SIMDE_MM_CMPINT_NE:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i16 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i16), (a_.i16 != b_.i16));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i16) / sizeof(r_.i16[0])) ; i++) {
r_.i16[i] = (a_.i16[i] != b_.i16[i]) ? ~UINT16_C(0) : UINT16_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_NLT:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i16 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i16), ~(a_.i16 < b_.i16));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i16) / sizeof(r_.i16[0])) ; i++) {
r_.i16[i] = !(a_.i16[i] < b_.i16[i]) ? ~UINT16_C(0) : UINT16_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_NLE:
#if defined(SIMDE_VECTOR_SUBSCRIPT_OPS)
r_.i16 = HEDLEY_REINTERPRET_CAST(__typeof__(r_.i16), ~(a_.i16 <= b_.i16));
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i16) / sizeof(r_.i16[0])) ; i++) {
r_.i16[i] = !(a_.i16[i] <= b_.i16[i]) ? ~UINT16_C(0) : UINT16_C(0);
}
#endif
break;
case SIMDE_MM_CMPINT_TRUE:
r_ = simde__m512i_to_private(simde_x_mm512_setone_si512());
break;
default:
HEDLEY_UNREACHABLE();
}
return simde_mm512_movepi16_mask(simde__m512i_from_private(r_));
}
#if defined(SIMDE_X86_AVX512BW_NATIVE)
#define simde_mm512_cmp_epi16_mask(a, b, imm8) _mm512_cmp_epi16_mask((a), (b), (imm8))
#endif
#if defined(SIMDE_X86_AVX512BW_ENABLE_NATIVE_ALIASES)
#undef _mm512_cmp_epi16_mask
#define _mm512_cmp_epi16_mask(a, b, imm8) simde_mm512_cmp_epi16_mask((a), (b), (imm8))
#endif
#if defined(SIMDE_X86_AVX512BW_NATIVE)
#define simde_mm512_mask_cmp_epi16_mask(k1, a, b, imm8) _mm512_mask_cmp_epi16_mask(k1, a, b, imm8)
#else
#define simde_mm512_mask_cmp_epi16_mask(k1, a, b, imm8) (k1) & simde_mm512_cmp_epi16_mask(a, b, imm8)
#endif
#if defined(SIMDE_X86_AVX512BW_ENABLE_NATIVE_ALIASES)
#undef _mm512_mask_cmp_epi16_mask
#define _mm512_mask_cmp_epi16_mask(a, b, imm8) simde_mm512_mask_cmp_epi16_mask((a), (b), (imm8))
#endif
SIMDE_HUGE_FUNCTION_ATTRIBUTES
simde__mmask32
simde_mm512_cmp_epu16_mask (simde__m512i a, simde__m512i b, const int imm8)
......@@ -869,7 +1077,7 @@ simde_mm512_cmp_epu16_mask (simde__m512i a, simde__m512i b, const int imm8)
#endif
#if defined(SIMDE_X86_AVX512BW_ENABLE_NATIVE_ALIASES)
#undef _mm512_mask_cmp_epu16_mask
#define _mm512_mask_cmp_epu16_mask(a, b, imm8) simde_mm512_mask_cmp_epu16_mask((a), (b), (imm8))
#define _mm512_mask_cmp_epu16_mask(k1, a, b, imm8) simde_mm512_mask_cmp_epu16_mask((k1), (a), (b), (imm8))
#endif
SIMDE_END_DECLS_
......
......@@ -32,7 +32,7 @@
#include "types.h"
#include "mov.h"
#include "../f16c.h"
#include "../../simde-f16.h"
HEDLEY_DIAGNOSTIC_PUSH
SIMDE_DISABLE_UNWANTED_DIAGNOSTICS
......@@ -173,7 +173,10 @@ simde_mm512_cvtepi8_epi16 (simde__m256i a) {
simde__m512i_private r_;
simde__m256i_private a_ = simde__m256i_to_private(a);
#if defined(SIMDE_CONVERT_VECTOR_)
#if defined(SIMDE_X86_AVX2_NATIVE)
r_.m256i[0] = _mm256_cvtepi8_epi16(a_.m128i[0]);
r_.m256i[1] = _mm256_cvtepi8_epi16(a_.m128i[1]);
#elif defined(SIMDE_CONVERT_VECTOR_)
SIMDE_CONVERT_VECTOR_(r_.i16, a_.i8);
#else
SIMDE_VECTORIZE
......@@ -199,7 +202,10 @@ simde_mm512_cvtepi32_ps (simde__m512i a) {
simde__m512_private r_;
simde__m512i_private a_ = simde__m512i_to_private(a);
#if defined(SIMDE_CONVERT_VECTOR_)
#if defined(SIMDE_X86_AVX_NATIVE)
r_.m256[0] = _mm256_cvtepi32_ps(a_.m256i[0]);
r_.m256[1] = _mm256_cvtepi32_ps(a_.m256i[1]);
#elif defined(SIMDE_CONVERT_VECTOR_)
SIMDE_CONVERT_VECTOR_(r_.f32, a_.i32);
#else
SIMDE_VECTORIZE
......@@ -287,10 +293,20 @@ simde_mm512_cvtph_ps(simde__m256i a) {
simde__m256i_private a_ = simde__m256i_to_private(a);
simde__m512_private r_;
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.f32) / sizeof(r_.f32[0])) ; i++) {
r_.f32[i] = simde_float16_to_float32(simde_uint16_as_float16(a_.u16[i]));
}
#if defined(SIMDE_X86_F16C_NATIVE)
r_.m256[0] = _mm256_cvtph_ps(a_.m128i[0]);
r_.m256[1] = _mm256_cvtph_ps(a_.m128i[1]);
#elif defined(SIMDE_FLOAT16_VECTOR)
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.f32) / sizeof(r_.f32[0])) ; i++) {
r_.f32[i] = simde_float16_to_float32(a_.f16[i]);
}
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.f32) / sizeof(r_.f32[0])) ; i++) {
r_.f32[i] = simde_float16_to_float32(simde_uint16_as_float16(a_.u16[i]));
}
#endif
return simde__m512_from_private(r_);
}
......@@ -299,6 +315,33 @@ simde_mm512_cvtph_ps(simde__m256i a) {
#define _mm512_cvtph_ps(a) simde_mm512_cvtph_ps(a)
#endif
SIMDE_FUNCTION_ATTRIBUTES
simde__m512i
simde_mm512_cvtps_epi32(simde__m512 a) {
#if defined(SIMDE_X86_AVX512F_NATIVE)
return _mm512_cvtps_epi32(a);
#endif
simde__m512_private a_ = simde__m512_to_private(a);
simde__m512i_private r_;
#if defined(SIMDE_X86_AVX_NATIVE)
r_.m256i[0] = _mm256_cvtps_epi32(a_.m256[0]);
r_.m256i[1] = _mm256_cvtps_epi32(a_.m256[1]);
#elif defined(simde_math_nearbyintf)
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i32) / sizeof(r_.i32[0])) ; i++) {
r_.i32[i] = SIMDE_CONVERT_FTOI(int32_t, simde_math_nearbyintf(a_.f32[i]));
}
#else
HEDLEY_UNREACHABLE();
#endif
return simde__m512i_from_private(r_);
}
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_cvtps_epi32
#define _mm512_cvtps_epi32(a) simde_mm512_cvtps_epi32(a)
#endif
SIMDE_END_DECLS_
HEDLEY_DIAGNOSTIC_POP
......
......@@ -31,6 +31,8 @@
#include "types.h"
#include "mov.h"
#include "storeu.h"
#include "loadu.h"
HEDLEY_DIAGNOSTIC_PUSH
SIMDE_DISABLE_UNWANTED_DIAGNOSTICS
......@@ -362,6 +364,34 @@ simde_mm512_mask_cvtsepi32_epi8 (simde__m128i src, simde__mmask16 k, simde__m512
#define _mm512_mask_cvtsepi32_epi8(src, k, a) simde_mm512_mask_cvtsepi32_epi8(src, k, a)
#endif
SIMDE_FUNCTION_ATTRIBUTES
void
simde_mm512_mask_cvtsepi32_storeu_epi8 (void* base_addr, simde__mmask16 k, simde__m512i a) {
#if defined(SIMDE_X86_AVX512F_NATIVE)
_mm512_mask_cvtsepi32_storeu_epi8(base_addr, k, a);
#else
simde__m256i_private r_ = simde__m256i_to_private(simde_mm256_loadu_epi8(base_addr));
simde__m512i_private a_ = simde__m512i_to_private(a);
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(a_.i32) / sizeof(a_.i32[0])) ; i++) {
r_.i8[i] = ((k>>i) &1 ) ?
((a_.i32[i] < INT8_MIN)
? (INT8_MIN)
: ((a_.i32[i] > INT8_MAX)
? (INT8_MAX)
: HEDLEY_STATIC_CAST(int8_t, a_.i32[i]))) : r_.i8[i];
}
simde_mm256_storeu_epi8(base_addr, simde__m256i_from_private(r_));
#endif
}
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_mask_cvtsepi32_storeu_epi8
#define _mm512_mask_cvtsepi32_storeu_epi8(base_addr, k, a) simde_mm512_mask_cvtsepi32_storeu_epi8(base_addr, k, a)
#endif
SIMDE_FUNCTION_ATTRIBUTES
simde__m128i
simde_mm512_maskz_cvtsepi32_epi8 (simde__mmask16 k, simde__m512i a) {
......@@ -444,6 +474,34 @@ simde_mm512_mask_cvtsepi32_epi16 (simde__m256i src, simde__mmask16 k, simde__m51
#define _mm512_mask_cvtsepi32_epi16(src, k, a) simde_mm512_mask_cvtsepi32_epi16(src, k, a)
#endif
SIMDE_FUNCTION_ATTRIBUTES
void
simde_mm512_mask_cvtsepi32_storeu_epi16 (void* base_addr, simde__mmask16 k, simde__m512i a) {
#if defined(SIMDE_X86_AVX512F_NATIVE)
_mm512_mask_cvtsepi32_storeu_epi16(base_addr, k, a);
#else
simde__m256i_private r_;
simde__m256i_private src_ = simde__m256i_to_private(simde_mm256_loadu_epi16(base_addr));
simde__m512i_private a_ = simde__m512i_to_private(a);
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(a_.i32) / sizeof(a_.i32[0])) ; i++) {
r_.i16[i] = ((k>>i) &1 ) ?
((a_.i32[i] < INT16_MIN)
? (INT16_MIN)
: ((a_.i32[i] > INT16_MAX)
? (INT16_MAX)
: HEDLEY_STATIC_CAST(int16_t, a_.i32[i]))) : src_.i16[i];
}
simde_mm256_storeu_epi16(base_addr, simde__m256i_from_private(r_));
#endif
}
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_mask_cvtsepi32_storeu_epi16
#define _mm512_mask_cvtsepi32_storeu_epi16(base_addr, k, a) simde_mm512_mask_cvtsepi32_storeu_epi16(base_addr, k, a)
#endif
SIMDE_FUNCTION_ATTRIBUTES
simde__m256i
simde_mm512_maskz_cvtsepi32_epi16 (simde__mmask16 k, simde__m512i a) {
......
......@@ -98,6 +98,32 @@ simde_mm_maskz_cvttpd_epi64(simde__mmask8 k, simde__m128d a) {
#define _mm_maskz_cvttpd_epi64(k, a) simde_mm_maskz_cvttpd_epi64(k, a)
#endif
SIMDE_FUNCTION_ATTRIBUTES
simde__m512i
simde_mm512_cvttps_epi32 (simde__m512 a) {
#if defined(SIMDE_X86_AVX512F_NATIVE)
return _mm512_cvttps_epi32(a);
#else
simde__m512i_private r_;
simde__m512_private a_ = simde__m512_to_private(a);
#if defined(simde_math_truncf)
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i32) / sizeof(r_.i32[0])) ; i++) {
r_.i32[i] = SIMDE_CONVERT_FTOI(int32_t, simde_math_truncf(a_.f32[i]));
}
#else
HEDLEY_UNREACHABLE();
#endif
return simde__m512i_from_private(r_);
#endif
}
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_cvttps_epi32
#define _mm512_cvttps_epi32(a) simde_mm512_cvttps_epi32(a)
#endif
SIMDE_END_DECLS_
HEDLEY_DIAGNOSTIC_POP
......
/* SPDX-License-Identifier: MIT
*
* Permission is hereby granted, free of charge, to any person
* obtaining a copy of this software and associated documentation
* files (the "Software"), to deal in the Software without
* restriction, including without limitation the rights to use, copy,
* modify, merge, publish, distribute, sublicense, and/or sell copies
* of the Software, and to permit persons to whom the Software is
* furnished to do so, subject to the following conditions:
*
* The above copyright notice and this permission notice shall be
* included in all copies or substantial portions of the Software.
*
* THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND,
* EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF
* MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND
* NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS
* BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN
* ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN
* CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
* SOFTWARE.
*
* Copyright:
* 2023 Michael R. Crusoe <crusoe@debian.org>
*/
#if !defined(SIMDE_X86_AVX512_CVTUS_H)
#define SIMDE_X86_AVX512_CVTUS_H
#include "types.h"
#include "mov.h"
#include "storeu.h"
#include "loadu.h"
HEDLEY_DIAGNOSTIC_PUSH
SIMDE_DISABLE_UNWANTED_DIAGNOSTICS
SIMDE_BEGIN_DECLS_
SIMDE_FUNCTION_ATTRIBUTES
void
simde_mm512_mask_cvtusepi32_storeu_epi8 (void* base_addr, simde__mmask16 k, simde__m512i a) {
#if defined(SIMDE_X86_AVX512F_NATIVE)
_mm512_mask_cvtusepi32_storeu_epi8(base_addr, k, a);
#else
simde__m256i_private r_ = simde__m256i_to_private(simde_mm256_loadu_epi8(base_addr));
simde__m512i_private a_ = simde__m512i_to_private(a);
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(a_.u32) / sizeof(a_.u32[0])) ; i++) {
r_.i8[i] = ((k>>i) &1 ) ?
((a_.u32[i] > UINT8_MAX)
? (HEDLEY_STATIC_CAST(int8_t, UINT8_MAX))
: HEDLEY_STATIC_CAST(int8_t, a_.u32[i])) : r_.i8[i];
}
simde_mm256_storeu_epi8(base_addr, simde__m256i_from_private(r_));
#endif
}
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_mask_cvtusepi32_storeu_epi8
#define _mm512_mask_cvtusepi32_storeu_epi8(base_addr, k, a) simde_mm512_mask_cvtusepi32_storeu_epi8((base_addr), (k), (a))
#endif
SIMDE_END_DECLS_
HEDLEY_DIAGNOSTIC_POP
#endif /* !defined(SIMDE_X86_AVX512_CVTUS_H) */
/* SPDX-License-Identifier: MIT
*
* Permission is hereby granted, free of charge, to any person
* obtaining a copy of this software and associated documentation
* files (the "Software"), to deal in the Software without
* restriction, including without limitation the rights to use, copy,
* modify, merge, publish, distribute, sublicense, and/or sell copies
* of the Software, and to permit persons to whom the Software is
* furnished to do so, subject to the following conditions:
*
* The above copyright notice and this permission notice shall be
* included in all copies or substantial portions of the Software.
*
* THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND,
* EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF
* MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND
* NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS
* BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN
* ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN
* CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
* SOFTWARE.
*
* Copyright:
* 2023 Michael R. Crusoe <crusoe@debian.org>
*/
#if !defined(SIMDE_X86_AVX512_GATHER_H)
#define SIMDE_X86_AVX512_GATHER_H
#include "types.h"
HEDLEY_DIAGNOSTIC_PUSH
SIMDE_DISABLE_UNWANTED_DIAGNOSTICS
SIMDE_BEGIN_DECLS_
SIMDE_FUNCTION_ATTRIBUTES
simde__m512
simde_mm512_i32gather_ps(simde__m512i vindex, const void* base_addr, const int32_t scale)
SIMDE_REQUIRE_CONSTANT(scale)
HEDLEY_REQUIRE_MSG((scale && scale <= 8 && !(scale & (scale - 1))), "`scale' must be a power of two less than or equal to 8") {
simde__m512i_private vindex_ = simde__m512i_to_private(vindex);
simde__m512_private r_ = simde__m512_to_private(simde_mm512_setzero_ps());
const uint8_t* addr = HEDLEY_REINTERPRET_CAST(const uint8_t*, base_addr);
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(vindex_.i32) / sizeof(vindex_.i32[0])) ; i++) {
const uint8_t* src = addr + (HEDLEY_STATIC_CAST(size_t , vindex_.i32[i]) * HEDLEY_STATIC_CAST(size_t , scale));
simde_float32 dst;
simde_memcpy(&dst, src, sizeof(dst));
r_.f32[i] = dst;
}
return simde__m512_from_private(r_);
}
#if defined(SIMDE_X86_AVX512F_NATIVE) && (!defined(__clang__) || SIMDE_DETECT_CLANG_VERSION_CHECK(10,0,0))
#define simde_mm512_i32gather_ps(vindex, base_addr, scale) _mm512_i32gather_ps((vindex), (base_addr), (scale))
#endif
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_i32gather_ps
#define _mm512_i32gather_ps(vindex, base_addr, scale) simde_mm512_i32gather_ps((vindex), (base_addr), (scale))
#endif
SIMDE_END_DECLS_
HEDLEY_DIAGNOSTIC_POP
#endif /* !defined(SIMDE_X86_AVX512_GATHER_H) */
/* SPDX-License-Identifier: MIT
*
* Permission is hereby granted, free of charge, to any person
* obtaining a copy of this software and associated documentation
* files (the "Software"), to deal in the Software without
* restriction, including without limitation the rights to use, copy,
* modify, merge, publish, distribute, sublicense, and/or sell copies
* of the Software, and to permit persons to whom the Software is
* furnished to do so, subject to the following conditions:
*
* The above copyright notice and this permission notice shall be
* included in all copies or substantial portions of the Software.
*
* THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND,
* EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF
* MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND
* NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS
* BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN
* ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN
* CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
* SOFTWARE.
*
* Copyright:
* 2023 Michael R. Crusoe <crusoe@debian.org>
*/
#if !defined(SIMDE_X86_AVX512_KAND_H)
#define SIMDE_X86_AVX512_KAND_H
#include "types.h"
HEDLEY_DIAGNOSTIC_PUSH
SIMDE_DISABLE_UNWANTED_DIAGNOSTICS
SIMDE_BEGIN_DECLS_
SIMDE_FUNCTION_ATTRIBUTES
simde__mmask16
simde_mm512_kand (simde__mmask16 a, simde__mmask16 b) {
#if defined(SIMDE_X86_AVX512F_NATIVE)
return _mm512_kand(a, b);
#else
return a & b;
#endif
}
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_kand
#define _mm512_kand(a, b) simde_mm512_kand((a), (b))
#endif
SIMDE_END_DECLS_
HEDLEY_DIAGNOSTIC_POP
#endif /* !defined(SIMDE_X86_AVX512_KAND_H) */
/* SPDX-License-Identifier: MIT
*
* Permission is hereby granted, free of charge, to any person
* obtaining a copy of this software and associated documentation
* files (the "Software"), to deal in the Software without
* restriction, including without limitation the rights to use, copy,
* modify, merge, publish, distribute, sublicense, and/or sell copies
* of the Software, and to permit persons to whom the Software is
* furnished to do so, subject to the following conditions:
*
* The above copyright notice and this permission notice shall be
* included in all copies or substantial portions of the Software.
*
* THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND,
* EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF
* MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND
* NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS
* BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN
* ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN
* CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
* SOFTWARE.
*
* Copyright:
* 2023 Michael R. Crusoe <crusoe@debian.org>
*/
#if !defined(SIMDE_X86_AVX512_PERMUTEX_H)
#define SIMDE_X86_AVX512_PERMUTEX_H
#include "types.h"
HEDLEY_DIAGNOSTIC_PUSH
SIMDE_DISABLE_UNWANTED_DIAGNOSTICS
SIMDE_BEGIN_DECLS_
SIMDE_FUNCTION_ATTRIBUTES
simde__m256i
simde_mm256_permutex_epi64 (simde__m256i a, const int imm8) {
simde__m256i_private
a_ = simde__m256i_to_private(a),
r_;
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i64) / sizeof(r_.i64[0])) ; i++) {
r_.i64[i] = a_.i64[(imm8 >> (i*2)) & 3];
}
return simde__m256i_from_private(r_);
}
#if defined(SIMDE_X86_AVX512F_NATIVE) && defined(SIMDE_X86_AVX512VL_NATIVE)
#define simde_mm256_permutex_epi64(a, imm8) _mm256_permutex_epi64((a), (imm8))
#endif
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES) && defined(SIMDE_X86_AVX512VL_ENABLE_NATIVE_ALIASES)
#undef _mm256_permutex_epi64
#define _mm256_permutex_epi64(a, imm8) simde_mm256_permutex_epi64((a), (imm8))
#endif
SIMDE_FUNCTION_ATTRIBUTES
simde__m512i
simde_mm512_permutex_epi64 (simde__m512i a, const int imm8) {
simde__m512i_private
a_ = simde__m512i_to_private(a),
r_;
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.m256i_private[0].i64) / sizeof(r_.m256i_private[0].i64[0])) ; i++) {
r_.m256i_private[0].i64[i] = a_.m256i_private[0].i64[(imm8 >> (i*2)) & 3];
r_.m256i_private[1].i64[i] = a_.m256i_private[1].i64[(imm8 >> (i*2)) & 3];
}
return simde__m512i_from_private(r_);
}
#if defined(SIMDE_X86_AVX512F_NATIVE)
#define simde_mm512_permutex_epi64(a, imm8) _mm512_permutex_epi64((a), (imm8))
#elif defined(SIMDE_STATEMENT_EXPR_)
#define simde_mm512_permutex_epi64(a, imm8) SIMDE_STATEMENT_EXPR_(({\
simde__m512i_private simde_mm512_permutex_epi64_a_ = simde__m512i_to_private((a)), simde_mm512_permutex_epi64_r_; \
simde_mm512_permutex_epi64_r_.m256i[0] = simde_mm256_permutex_epi64(simde_mm512_permutex_epi64_a_.m256i[0], (imm8)); \
simde_mm512_permutex_epi64_r_.m256i[1] = simde_mm256_permutex_epi64(simde_mm512_permutex_epi64_a_.m256i[1], (imm8)); \
simde__m512i_from_private(simde_mm512_permutex_epi64_r_); \
}))
#endif
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_permutex_epi64
#define _mm512_permutex_epi64(a, imm8) simde_mm512_permutex_epi64((a), (imm8))
#endif
#if defined(SIMDE_X86_AVX512F_NATIVE)
#define simde_mm512_mask_permutex_epi64(src, k, a, imm8) _mm512_mask_permutex_epi64((src), (k), (a), (imm8))
#else
#define simde_mm512_mask_permutex_epi64(src, k, a, imm8) simde_mm512_mask_mov_epi64((src), (k), simde_mm512_permutex_epi64((a), (imm8)))
#endif
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_mask_permutex_epi64
#define _mm512_mask_permutex_epi64(src, k, a, imm8) simde_mm512_mask_permutex_epi64((src), (k), (a), (imm8))
#endif
SIMDE_END_DECLS_
HEDLEY_DIAGNOSTIC_POP
#endif /* !defined(SIMDE_X86_AVX512_PERMUTEX_H) */
/* SPDX-License-Identifier: MIT
*
* Permission is hereby granted, free of charge, to any person
* obtaining a copy of this software and associated documentation
* files (the "Software"), to deal in the Software without
* restriction, including without limitation the rights to use, copy,
* modify, merge, publish, distribute, sublicense, and/or sell copies
* of the Software, and to permit persons to whom the Software is
* furnished to do so, subject to the following conditions:
*
* The above copyright notice and this permission notice shall be
* included in all copies or substantial portions of the Software.
*
* THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND,
* EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF
* MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND
* NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS
* BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN
* ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN
* CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
* SOFTWARE.
*
* Copyright:
* 2023 Michael R. Crusoe <crusoe@debian.org>
*/
#if !defined(SIMDE_X86_AVX512_RCP_H)
#define SIMDE_X86_AVX512_RCP_H
#include "types.h"
HEDLEY_DIAGNOSTIC_PUSH
SIMDE_DISABLE_UNWANTED_DIAGNOSTICS
SIMDE_BEGIN_DECLS_
// TODO: "The maximum relative error for this approximation is less than 2^-14."
// vs 1.5*2^-12 for _mm{,256}_rcp_ps
SIMDE_FUNCTION_ATTRIBUTES
simde__m512
simde_mm512_rcp14_ps (simde__m512 a) {
#if defined(SIMDE_X86_AVX512F_NATIVE)
return _mm512_rcp14_ps(a);
#else
simde__m512_private
r_,
a_ = simde__m512_to_private(a);
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.f32) / sizeof(r_.f32[0])) ; i++) {
r_.f32[i] = SIMDE_FLOAT32_C(1.0) / a_.f32[i];
}
return simde__m512_from_private(r_);
#endif
}
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_rcp14_ps
#define _mm512_rcp14_ps(a) simde_mm512_rcp14_ps(a)
#endif
SIMDE_END_DECLS_
HEDLEY_DIAGNOSTIC_POP
#endif /* !defined(SIMDE_X86_AVX512_RCP_H) */
......@@ -64,6 +64,32 @@ simde_mm512_srai_epi16 (simde__m512i a, const int imm8) {
#define _mm512_srai_epi16(a, imm8) simde_mm512_srai_epi16(a, imm8)
#endif
SIMDE_FUNCTION_ATTRIBUTES
simde__m512i
simde_mm512_srai_epi32 (simde__m512i a, const unsigned int imm8) {
simde__m512i_private
r_,
a_ = simde__m512i_to_private(a);
#if defined(SIMDE_VECTOR_SUBSCRIPT_SCALAR)
r_.i32 = a_.i32 >> HEDLEY_STATIC_CAST(int32_t, imm8);
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.i32) / sizeof(r_.i32[0])) ; i++) {
r_.i32[i] = a_.i32[i] >> imm8;
}
#endif
return simde__m512i_from_private(r_);
}
#if defined(SIMDE_X86_AVX512F_NATIVE)
# define simde_mm512_srai_epi32(a, imm8) _mm512_srai_epi32(a, imm8)
#endif
#if defined(SIMDE_X86_AVX512F_ENABLE_NATIVE_ALIASES)
#undef _mm512_srai_epi32
#define _mm512_srai_epi32(a, imm8) simde_mm512_srai_epi32(a, imm8)
#endif
SIMDE_END_DECLS_
HEDLEY_DIAGNOSTIC_POP
......
......@@ -589,6 +589,13 @@ typedef union {
* issue and we'll try to figure out a work-around. */
typedef uint32_t simde__mmask32;
typedef uint64_t simde__mmask64;
#if !defined(__mmask16) && defined(SIMDE_ENABLE_NATIVE_ALIASES)
#if !defined(HEDLEY_INTEL_VERSION)
typedef uint16_t __mmask16;
#else
#define __mmask16 uint16_t;
#endif
#endif
#if !defined(__mmask32) && defined(SIMDE_ENABLE_NATIVE_ALIASES)
#if !defined(HEDLEY_INTEL_VERSION)
typedef uint32_t __mmask32;
......
......@@ -51,6 +51,11 @@ simde_mm_cvtps_ph(simde__m128 a, const int imm8) {
#if defined(SIMDE_ARM_NEON_A32V7_NATIVE) && defined(__ARM_FEATURE_FP16_VECTOR_ARITHMETIC)
r_.neon_f16 = vcombine_f16(vcvt_f16_f32(a_.neon_f32), vdup_n_f16(SIMDE_FLOAT16_C(0.0)));
#elif defined(SIMDE_FLOAT16_VECTOR)
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(a_.f32) / sizeof(a_.f32[0])) ; i++) {
r_.f16[i] = simde_float16_from_float32(a_.f32[i]);
}
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(a_.f32) / sizeof(a_.f32[0])) ; i++) {
......@@ -78,6 +83,11 @@ simde_mm_cvtph_ps(simde__m128i a) {
#if defined(SIMDE_ARM_NEON_A32V7_NATIVE) && defined(__ARM_FEATURE_FP16_VECTOR_ARITHMETIC)
r_.neon_f32 = vcvt_f32_f16(vget_low_f16(a_.neon_f16));
#elif defined(SIMDE_FLOAT16_VECTOR)
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(a_.f32) / sizeof(a_.f32[0])) ; i++) {
r_.f32[i] = simde_float16_to_float32(a_.f16[i]);
}
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(a_.f32) / sizeof(a_.f32[0])) ; i++) {
......@@ -100,10 +110,18 @@ simde_mm256_cvtps_ph(simde__m256 a, const int imm8) {
HEDLEY_STATIC_CAST(void, imm8);
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(a_.f32) / sizeof(a_.f32[0])) ; i++) {
r_.u16[i] = simde_float16_as_uint16(simde_float16_from_float32(a_.f32[i]));
}
#if defined(SIMDE_FLOAT16_VECTOR)
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(a_.f32) / sizeof(a_.f32[0])) ; i++) {
r_.f16[i] = simde_float16_from_float32(a_.f32[i]);
}
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(a_.f32) / sizeof(a_.f32[0])) ; i++) {
r_.u16[i] = simde_float16_as_uint16(simde_float16_from_float32(a_.f32[i]));
}
#endif
return simde__m128i_from_private(r_);
}
......@@ -128,10 +146,17 @@ simde_mm256_cvtph_ps(simde__m128i a) {
simde__m128i_private a_ = simde__m128i_to_private(a);
simde__m256_private r_;
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.f32) / sizeof(r_.f32[0])) ; i++) {
r_.f32[i] = simde_float16_to_float32(simde_uint16_as_float16(a_.u16[i]));
}
#if defined(SIMDE_FLOAT16_VECTOR)
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.f32) / sizeof(r_.f32[0])) ; i++) {
r_.f32[i] = simde_float16_to_float32(a_.f16[i]);
}
#else
SIMDE_VECTORIZE
for (size_t i = 0 ; i < (sizeof(r_.f32) / sizeof(r_.f32[0])) ; i++) {
r_.f32[i] = simde_float16_to_float32(simde_uint16_as_float16(a_.u16[i]));
}
#endif
return simde__m256_from_private(r_);
#endif
......
......@@ -31,6 +31,7 @@
#define SIMDE_X86_SSE_H
#include "mmx.h"
#include "../simde-f16.h"
#if defined(_WIN32) && !defined(SIMDE_X86_SSE_NATIVE) && defined(_MSC_VER)
#define NOMINMAX
......@@ -59,6 +60,11 @@ typedef union {
SIMDE_ALIGN_TO_16 simde_int128 i128 SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
SIMDE_ALIGN_TO_16 simde_uint128 u128 SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
#endif
#if defined(SIMDE_FLOAT16_VECTOR)
SIMDE_ALIGN_TO_16 simde_float16 f16 SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
#else
SIMDE_ALIGN_TO_16 simde_float16 f16[8];
#endif
SIMDE_ALIGN_TO_16 simde_float32 f32 SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
SIMDE_ALIGN_TO_16 int_fast32_t i32f SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
SIMDE_ALIGN_TO_16 uint_fast32_t u32f SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
......@@ -75,6 +81,7 @@ typedef union {
SIMDE_ALIGN_TO_16 simde_int128 i128[1];
SIMDE_ALIGN_TO_16 simde_uint128 u128[1];
#endif
SIMDE_ALIGN_TO_16 simde_float16 f16[8];
SIMDE_ALIGN_TO_16 simde_float32 f32[4];
SIMDE_ALIGN_TO_16 int_fast32_t i32f[16 / sizeof(int_fast32_t)];
SIMDE_ALIGN_TO_16 uint_fast32_t u32f[16 / sizeof(uint_fast32_t)];
......
......@@ -33,6 +33,7 @@
#define SIMDE_X86_SSE2_H
#include "sse.h"
#include "../simde-f16.h"
HEDLEY_DIAGNOSTIC_PUSH
SIMDE_DISABLE_UNWANTED_DIAGNOSTICS
......@@ -52,6 +53,11 @@ typedef union {
SIMDE_ALIGN_TO_16 simde_int128 i128 SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
SIMDE_ALIGN_TO_16 simde_uint128 u128 SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
#endif
#if defined(SIMDE_FLOAT16_VECTOR)
SIMDE_ALIGN_TO_16 simde_float16 f16 SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
#else
SIMDE_ALIGN_TO_16 simde_float16 f16[8];
#endif
SIMDE_ALIGN_TO_16 simde_float32 f32 SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
SIMDE_ALIGN_TO_16 simde_float64 f64 SIMDE_VECTOR(16) SIMDE_MAY_ALIAS;
......@@ -70,6 +76,7 @@ typedef union {
SIMDE_ALIGN_TO_16 simde_int128 i128[1];
SIMDE_ALIGN_TO_16 simde_uint128 u128[1];
#endif
SIMDE_ALIGN_TO_16 simde_float16 f16[8];
SIMDE_ALIGN_TO_16 simde_float32 f32[4];
SIMDE_ALIGN_TO_16 simde_float64 f64[2];
......
......@@ -310,7 +310,7 @@ simde_mm_addsub_ps (simde__m128 a, simde__m128 b) {
#endif
}
#if defined(SIMDE_X86_SSE3_ENABLE_NATIVE_ALIASES)
# define _mm_addsub_ps(a, b) simde_mm_addsub_ps(a, b)
# define _mm_addsub_ps(a, b) simde_mm_addsub_ps((a), (b))
#endif
SIMDE_FUNCTION_ATTRIBUTES
......
Markdown is supported
0%
or
You are about to add 0 people to the discussion. Proceed with caution.
Finish editing this message first!
Please register or to comment