1#ifndef AMPGEN_AVX_TYPES
2#define AMPGEN_AVX_TYPES 1
13extern "C" void _ZGVdN8vvv_sincos(__m256 x, __m256i ptrs, __m256i ptrc);
14#define libmvec_alias(F, O) \
15 extern "C" __m256 _ZGVcN8v_##F(__m256 x); \
16 inline real_v O(const real_v &v) { return _ZGVcN8v_##F(v); }
18#define libmvec_alias(F, O) \
19 inline real_v O(const real_v &v) { \
20 auto arr = v.to_ptr(); \
21 return real_v(std::F(arr[0]), std::F(arr[1]), std::F(arr[2]), std::F(arr[3]), std::F(arr[4]), std::F(arr[5]), std::F(arr[6]), std::F(arr[7])); \
29 static constexpr unsigned size = 8;
39 data = _mm256_set_ps(x7, x6, x5, x4, x3, x2, x1, x0);
44 std::array<scalar_type, 8> b;
51 operator __m256()
const {
return data; }
56 inline __m256i
to_int()
const {
return _mm256_cvtps_epi32(
data); }
94 alignas(32) std::array<int32_t, real_v::size> rt;
95 _mm256_store_si256((__m256i *)&rt[0], v);
104 std::pair<real_v, real_v> rt;
105 sincos(v, rt.first, rt.second);
113 inline real_v abs(
const real_v &v) {
return v & _mm256_castsi256_ps(_mm256_set1_epi32(0x7FFFFFFF)); }
120 const auto *bx = x.
to_ptr();
121 const auto *by = y.
to_ptr();
123 for(
unsigned i = 0; i != real_v::size; ++i) rt.
to_ptr()[i] = std::atan2(by[i], bx[i]);
128 std::array<float, real_v::size> tmp;
131 for(
int i = 0; i != real_v::size; ++i) tmp[i] = real_v::scalar_type(base_addr[ptr[i]]);
132 return real_v(tmp.data());
137 return select(a > 0., r, -r);
142 for(
unsigned i = 0; i != real_v::size; ++i) os << buffer[i] <<
" ";
157#pragma omp declare reduction(+ : real_v : omp_out = omp_out + omp_in)
158#pragma omp declare reduction(+ : complex_v : omp_out = omp_out + omp_in)
real_v operator&(const real_v &lhs, const real_v &rhs)
real_v operator-(const real_v &lhs, const real_v &rhs)
real_v sqrt(const real_v &v)
real_v operator+(const real_v &lhs, const real_v &rhs)
real_v operator||(const real_v &lhs, const real_v &rhs)
real_v abs(const real_v &v)
void sincos(const real_v &v, real_v &s, real_v &c)
real_v operator==(const real_v &lhs, const real_v &rhs)
real_v fmadd(const real_v &a, const real_v &b, const real_v &c)
real_v select(const real_v &mask, const real_v &a, const real_v &b)
real_v operator/(const real_v &lhs, const real_v &rhs)
real_v sin(const real_v &v)
real_v fmod(const real_v &a, const real_v &b)
Complex< real_v > complex_v
real_v tan(const real_v &v)
real_v operator>=(const real_v &lhs, const real_v &rhs)
real_v operator!(const real_v &x)
real_v operator^(const real_v &lhs, const real_v &rhs)
std::array< int32_t, real_v::size > store(const __m256i &v)
real_v operator*(const real_v &lhs, const real_v &rhs)
std::ostream & operator<<(std::ostream &os, const real_v &obj)
real_v exp(const real_v &v)
real_v operator|(const real_v &lhs, const real_v &rhs)
real_v cos(const real_v &v)
real_v operator>(const real_v &lhs, const real_v &rhs)
real_v log(const real_v &v)
real_v gather(const double *base_addr, const real_v &offsets)
real_v operator<(const real_v &lhs, const real_v &rhs)
real_v remainder(const real_v &a, const real_v &b)
real_v operator&&(const real_v &lhs, const real_v &rhs)
real_v sign(const real_v &v)
real_v atan2(const real_v &y, const real_v &x)
real_v operator<=(const real_v &lhs, const real_v &rhs)
real_v operator/=(const real_v &rhs)
real_v operator+=(const real_v &rhs)
const scalar_type * to_ptr() const
real_v(const scalar_type &f)
real_v(const scalar_type &x0, const scalar_type &x1, const scalar_type &x2, const scalar_type &x3, const scalar_type &x4, const scalar_type &x5, const scalar_type &x6, const scalar_type &x7)
scalar_type at(const unsigned i) const
void store(scalar_type *ptr) const
std::array< scalar_type, 8 > to_array() const
real_v operator*=(const real_v &rhs)
real_v(const scalar_type *f)
real_v operator-=(const real_v &rhs)
static constexpr unsigned size