Any of you who are even slightly into politics, or have followed any news lately, have probably seen something about the DNA test Elizabeth Warren took to prove/disprove her Native American ancestry. The test indicates she might have had a Native American ancestor 6 to 10 generations ago. That's a
Uncategorized
There are four widely recognized styles of machine learning: supervised, unsupervised, semi-supervised and reinforcement learning. These styles have been discussed in great depth in the literature and are included in most introductory lectures on machine learning algorithms. As a recap, the table below summarizes these styles. For a comprehensive mapping
What can you learn about wildfires when you provide a room full of analysts with 7 years of US wildfire data and the tools they need to analyze it? A lot. At a recent data dive, we split 35 data scientists into 9 teams, provided multiple data sets containing information
필자는 데이터 전문가와 엔터프라이즈 시스템 컨설턴트로서 오랜 경력을 쌓아왔으며, 저자와 대학 교수로서 교육 활동도 진행하고 있습니다. 그 동안 200여 개의 개인, 50개 이상의 그룹을 위한 데이터 분석 프로젝트를 감독하면서 수많은 분석 프랙티스를 연구해왔는데요. 중요한 한 가지는 분석 프로젝트를 성공적으로 시작하기 위한 단 하나의 청사진은 존재하지 않는다는 것입니다. 하지만 다양한 성공 또는 실패
In a recent article about nonlinear least squares, I wrote, "you can often fit one model and use the ESTIMATE statement to estimate the parameters in a different parameterization." This article expands on that statement. It shows how to fit a model for one set of parameters and use the
Deep learning has taken off because organizations of all sizes are capturing a greater variety of data and can mine bigger data, including unstructured data. It’s not just large companies like Amazon, SAS and Google that have access to big data. It’s everywhere. Deep learning needs big data, and now
What if you could automatically detect supply chain anomalies as they happen, or even predict them in advance? You'd be able to take timely corrective action and help maximize revenue, margins, customer satisfaction and shareholder value. There's no question: Supply chain planning and execution is complex. From design and sourcing, to
"Imagine being told to part with a dear friend or part of your identity. Imagine being told to discard something that results in intense feelings of anxiety, sorrow, or guilt. That’s how it can feel to someone with hoarding issues. " Dr. Annette Perot is a licensed psychologist and has
Think that the company has let up in the last two years? Think again.
Krankenversicherung und neue Technologien – geht das zusammen? Auf alle Fälle! Und das User-Group-Treffen „Analytik in der Krankenversicherung“, das kürzlich in Leipzig stattfand, hat es unter Beweis gestellt. Diese von den Gesundheitsforen Leipzig ausgerichtete Veranstaltung ist ein sehr informatives Forum, auf dem sich analytische Fachexperten aus der Gesetzlichen Krankenversicherung (GKV)
There are several ways to use SAS to get the unique values for a data variable. In Base SAS, you can use the TABLES statement in PROC FREQ to generate a table of unique values (and the counts). You can also use the DISTINCT function in PROC SQL to get
Note: Today’s utility industry is in upheaval. All of the assumptions the business has run on have been turned on their heads. This post is the first in a three-part series looking at how analytics are helping utilities navigate this challenging landscape and find new opportunities for improvements in operations,
近年、クラウドファーストを唱える企業が増加し、データ分析のために、クラウド上に展開されている分析サービスを活用したり、クラウド上に独自に分析アプリケーションを構築するケースも増えています。 しかし、クラウド上にある分析サービスやアプリケーションで分析する対象のデータは、オンプレミス上に蓄積されているケースが大半であり、クラウドからこれらのデータにアクセスできるようにするための作業や環境設定は面倒かつ非効率で、膨大なデータをクラウドとやり取りするなどの運用コストも大きく、かつセキュリティのリスク回避も考慮しなければなりません。 こうした課題を解決するために、SAS ViyaではSAS Cloud Data Exchange (CDE)を提供しています。 SAS Cloud Data Exchange (CDE) は、プライベート/パプリックのクラウド上にあるアプリケーション(=SAS Viya)からファイヤーウォールの後ろにある、顧客のオンプレミス上にあるデータに安全かつ確実にアクセスし、大量のデータをクラウドへ高速に転送することを可能とするデータ接続機能です。 CDEは、SAS Viyaのセルフサービス・データ準備向け製品であるSAS Data Preparationに含まれる機能です。 CDEを使用すれば、クラウド上にあるSAS Viyaからオンプレミス上にある様々なデータソース(Oracle, Teradata, Hadoop etc.)へ最小限の手順で容易かつセキュアにアクセスすることが可能になります。 サポート対象データソース: ・DB2, ODBC, Apache Hive, Oracle, Redshift, SQL Server, Postgres, SAP HANA, Teradata, SAS Data Sets CDEでは、最小限の一つのポート(Https port)を使用し、オンプレミス上にあるデータソースにアクセスするための資格情報(ユーザーID /パスワード)も保護された領域に格納し、使用するため、安全性が高められています。 また、クラウド上のSAS Viyaが複数のワーカーノードで分散構成されている場合には、オンプレミス上のデータを並列で高速にSAS Viya環境へロードすることが可能です。 利用手順概要は以下の通りです。 オンプレミス側にSAS Data Agent
Here in the US, we recently had a new Supreme Court Justice appointed. This is a very important position, and judges usually serve until they retire or die. My buddy Rick gave me a heads-up that there was a table of all the past & present justices on Wikipedia, and
Fest steht: Künstliche Intelligenz (KI) wird unser aller Leben verändern – und tut es schon. Weniger klar ist, in welcher Weise und in welchem Zeitrahmen diese Veränderungen passieren – und was am Ende dabei herauskommt. In vielen Bereichen gibt es wilde Spekulationen. Bei Life Sciences und im Gesundheitssektor lichtet sich
Smart retailers know that omnichannel customer experience isn't just about marketing anymore. It’s about bridging all your digital and physical channels to recognize customers wherever they are, collecting data and understanding the retail customer’s purchasing journey. By taking customer data, product data, and supply chain data - and applying predictive and prescriptive
SAS Press is changing to meet the needs of customers worldwide.
Kennen Sie das? Sie sitzen in einer Kongressveranstaltung, das Programm auf der Bühne ist beeindruckend – und trotzdem werden Sie immer wieder per Mail in Ihren Alltag zurückgeholt. Genau so ging es mir diese Woche bei der SiriusDecisions in London, einer weltweiten Konferenzreihe rund um B2B-Marketing, die allein in London
We hear a lot about data science nowadays, but do you ever wonder how it’s being used to help solve real-world problems? In my first post of this blog series, we heard why two students chose to pursue a STEM field and what appealed to them about data science. Today, we'll hear
前回の記事では、SAS Visual Analytics を用いて時系列データを扱う手法をご説明しました。第7回目となる本記事では、データをグループ分けするクラスタリングについてご紹介します。 クラスタリングとは、多様な特徴を持つデータ群の中から、似通った性質を持つサンプルを抽出しグループ化する機械学習手法です。例えば、顧客をクラスタリングし、各クラスターの特徴(年齢・嗜好等)に合わせた適切なDMを送る、などの活用例があります。本記事では、行政基盤の性質に基づき都道府県をクラスタリングします。本ブログのシリーズの第3回・第5回にて同じデータを異なる手法で分析しておりますので、併せてご参照ください。 本記事では、総務省の「社会・人口統計体系 都道府県データ 社会生活統計指標 :D 行政基盤」のデータを使用しました。 SAS Visual Analytics 8.3 におけるクラスタリング分析 from SAS Institute Japan 本例で作成したクラスターの数は5つですが、オプションから数の変更ができます。特徴量のビンの数も同様に変更可能です。 さて、今回使用した5つの変数は第3回・第5回の記事の分析で、人口増減率に影響を及ぼすとされた要素でした。スライド内クラスター2のラインをご覧ください。財政力指数は低いものの、土木費割合が高いという特徴を共有するクラスターであると読み取れます。これは、第5回の記事のディシジョンツリーを用いた分析によると、財政力が弱いにも関わらず人口増減率が高い自治体の持つ特徴でした。したがってクラスター2内の要素の人口増減率が高い傾向にあることが予想されます。また最も要素数の多いクラスター5についてですが、どのビンにおいても概ね中程度の値を取っており、平均的なクラスターであるとみなせます。このようにクラスタリングによってデータを分類し、各クラスターの特徴に着目することで、データをより分析しやすくすることが可能です。 ここで、SAS Visual Analytics におけるクラスタリングに使われている手法、k-means法の仕組みついてご紹介します。ここではn個のデータをk個のクラスターに分類するとします。 1) n個のデータのうち最初のk個をクラスターの核とし、各データを一番近い核のクラスターに属するように分割します。 2) 各クラスターの重心を求めます。 3) 各データを、それぞれが一番近い重心のクラスターに属するように再分割します。 4) 再分割されたクラスターの重心を求め、(3)の操作をクラスターに変化がなくなるまで行います。 このように、最終的に変動がなくなったクラスターに基づきクラスタリングが行われています。 以上、クラスタリングの手法についてご説明しました。引き続き本ブログのシリーズでは、SAS Visual Analytics を用いた図表・グラフの作成や統計解析の方法について紹介いたします。ぜひご参照ください。 高校生・大学生を対象とした第2回和歌山県データ利活用コンペティションへの参加も募集中ですので、奮ってご参加ください。(追記:募集は締め切られました)
비운의 영화 배우, 파킨슨병 치료를 위해 앞장서다 타임머신과 시간 여행을 다룬 영화 하면 무엇이 가장 먼저 떠오르시나요? 전 세계적으로 가장 크게 흥행한 영화 중 하나는 단연 스티븐 스필버그 감독 제작의 SF 영화 ‘백 투 더 퓨처(Back to the Future)’일텐데요. 1985년에 개봉된 이 영화는 11주 동안 미국 박스 오피스 1위를 차지하고,
인공지능(AI)은 금융 사기 탐지, 보험 비즈니스 모델 다각화, 의료 진단 개선, 스포츠 경기 성과 향상 등 다양한 분야에서 상상을 현실화하고 성과를 도출하고 있습니다. 최근 마케팅 분야도 예측 분석, 추천 엔진 등 다양한 형태의 인공지능 알고리즘을 적극 활용하면서 혁신을 체감하고 있는데요. 대기업은 물론 중소기업에 적합한 여러 인공지능 활용 마케팅 툴이 등장하면서 변화의 속도는 더욱 빨라지고 있습니다.
Nach dem diesjährigen SAS Global Forum in Denver bin ich weiter nach San Francisco gereist. Und wie viele Touristen bin ich auch zur Golden Gate Bridge gefahren und habe sie Fuß überquert. In der Mitte der Brücke, bemerkte ich einen Windsurfer in der Bucht von San Francisco, der sich der
This article shows how to use SAS to fit a growth curve to data. Growth curves model the evolution of a quantity over time. Examples include population growth, the height of a child, and the growth of a tumor cell. This article focuses on using PROC NLIN to estimate the
第3回のブログでは、SAS Visual Analytics の活用例として統計解析のひとつである線形回帰を紹介しました。その続きのブログとなる今回は、ロジスティック回帰について説明します。 回帰分析は変数どうしの関係を分析することができます。そのなかでも以前紹介した線形回帰はシンプルでよく利用されますが、すべての場合において最も適当な分析手法であるとは限りません。たとえば、目的変数が離散的な場合(例:喫煙の有無、就業状態、移住の意思)には、ロジスティック回帰のほうが当てはまりのよい結果を得ることができます。本記事では、ロジスティック回帰を用いて待機児童の有無に影響を与える変数の分析を紹介します。 このスライドでは、厚生労働省が公開している保育所等関連状況取りまとめ(平成30年4月1日)から申込者の状況についてのデータと、総務省が公開している平成28年度地方公共団体の主要財政指標一覧から全市町村の主要財政指標を利用しました。データのインポートについてスライド内でも説明していますが、インポートの際の注意点など詳細に関してはこちらのブログを参考にしてください。 SAS Visual Analytics 8.3 におけるロジスティック回帰の利用 from SAS Institute Japan ロジスティック回帰オブジェクトでは、自動的に最適なモデルが選択されます。オブジェクトを最大化し、詳細を表示すると使用したモデルを確認することができます。 スライド内の分析では、ロジットモデルを使用していました。 また、詳細からは当てはめの統計量、パラメータ推計値などの情報を確認することができます。 今回の分析結果の解釈として、待機児童の有無に影響を与えている要因は「財政力指数」「経常収支比率」「ラスパイレス指数」「実質公債費比率」でした。それぞれの変数についてパラメータ(効果量)推定値をみると、「財政力指数」が最も大きい正の値(2.49)となっており、「財政状況のよい市区町村ほど待機児童が発生しやすい」といえます。対して「申込者数」の推定値は(5%有意であるものの)0.000094と非常に小さく、申込者数の多寡が待機児童の有無に与える影響は小さいと言えます。ここから、自治体規模の大小と待機児童の有無は関係していないと推測できます。 そのほかのパラメータをみても、財政状況がよいほど待機児童がいることが分かりますが、ここから単純に「待機児童を減らすためには、財政状況を悪化させればよい」ということにはなりません。たとえば、待機児童が多い自治体では共働きが多く、結果として住民税収が増加し財政状況がよくなるなど、さまざまなストーリーを想定することができます。回帰分析から因果関係を主張するときには注意が必要です。 この分析では、財政指標を利用しましたが、他にも女性の就業率、出生率、世帯構成などのデータを利用するとより効果的な分析ができるでしょう。データセット内に2値の変数がない場合でも、スライド内の例のように自分で基準を決めることで新しい変数を作成することができます。これによって分析の幅が広がりますが、レポートには必ず変数の定義を記述してください。 引き続き本ブログのシリーズでは、図表・グラフの作成や統計解析の方法について紹介いたします。 第2回和歌山県データ利活用コンペティションへの参加も募集中ですので、高校生・大学生のご参加をお待ちしています。(追記:募集は締め切られました)
全世界のSASユーザーが集う年次のイベント SAS Global Forum。 次回は2019年4月28日から5月1日まで、米国テキサス州ダラスで開催予定です。 現在、SAS Global Forum 2019での発表演題を募集しています。 本イベントは、600を超えるセッションでワークショップ、プレゼンテーション、e-ポスター、デモおよび交流プログラムが用意されており、アナリティクス活用についての事例やテクノロジーが多数紹介されます。昨年は5400人もの登録者があり、世界中のデータサイエンティストと情報交換が可能です。(2017年の様子を過去のブログで紹介しています。その1, その2, その3) 学生向けのプログラムも用意されており、多くの大学生・教育関係者が参加します。 Student Ambassador Program ... 「学生大使」として無料でイベントに招待(旅費や宿泊代もサポートされます!) Student Symposium ... 学生がチームで戦うコンテスト。ファイナリストはイベントに招待されます。 Academic Summit ... 学生と教育関係者向けの講演と交流プログラム。昨年、参加した日本の学生によるレポートはこちら。 ビジネスやアカデミアのユーザーが一堂に会するグローバルイベントで、学生が自身の分析・研究・提案を発表することで、ビジネスやアナリティクスの専門家からのフィードバックにより自身のアイデアを深めると同時に、国際的にネットワークを広げることができます。 まずは、10月22日の締切までにアブストラクトを投稿しましょう! SAS Japan アカデミア推進室では、投稿に向けて学生の皆さんをサポートいたします。 興味のお持ちの方は JPNAcademicTeam@sas.com までご連絡ください。
An abundance of data does not equal an abundance of wisdom. At the SAS Government Leadership Forum, leaders from federal, state and local agencies will discuss how analytics can bridge the gap between data and wisdom to make meaningful changes in how government operates. Analytics, however, is not just about
Focus on data governance, quality and storage if you want to do data management for analytics right.
The SAS INFILE statement can read multiple text files in a single DATA step. Use file name wildcards (like * and ?) and a special FILENAME= option to keep track of which records come from which files.
This Fall 2018 issue of Foresight, our 51st, opens with Fotios Petropoulos’s review of Paul Goodwin’s latest book, How to Profit from Your Software: A Best-Practice Guide for Sales Forecasters. Fotios notes that the author doesn’t single out any one software system, but keeps the discussion general and so applicable to many products.