Cuộc thi khoa học dữ liệu MUFG là gì
Cạnh tranh về độ chính xác dự đoán của mô hình học máy Python
Cuộc thi khoa học dữ liệu là một cuộc thi trên toàn MUFG, trong đó người tham gia sử dụng Python (*1) để phát triển các mô hình máy học cho một vấn đề kinh doanh nhất định và cạnh tranh về độ chính xác của chúng Ngoài việc cung cấp chương trình học trực tuyến giải thích các lý thuyết cơ bản, cuộc thi này còn bao gồm phần Hỏi đáp với người hướng dẫn sử dụng Slack và hội thảo ở giai đoạn trung cấp, tạo ra một môi trường mà ngay cả những người không có kinh nghiệm về phân tích dữ liệu cũng có thể tham gia Sự kiện này đã thu hút nhiều người tham gia từ nhiều bộ phận, bao gồm cả văn phòng bán hàng, cũng như nhân viên từ các công ty thuộc Tập đoàn MUFG, những người chịu trách nhiệm phân tích dữ liệu hàng ngàyChủ đề của buổi thứ ba là ``Dự đoán hủy đặt phòng khách sạn'' dành cho Cơ bản và ``Dự đoán sản phẩm đặt hàng tiếp theo'' dành cho Nâng cao Sự cạnh tranh trở nên khốc liệt khi những người tham gia làm việc chăm chỉ để cải thiện mô hình học máy của họ
*1Python: Ngôn ngữ lập trình đa năng cấp cao có thể được sử dụng cho nhiều mục đích khác nhau, từ tính toán số đến phát triển ứng dụng web và phát triển AI
Hạng 1 cơ bản: Hiroji Mizutani nhận định soi kèo bóng đá hôm nay Khoa Công nghệ thông tin MUIT GCMS
Biến công nghệ máy học và AI trở nên phổ biến trong MUFG
QVui lòng cho chúng tôi biết lý do bạn tham gia cuộc thi này
Mr MizutaniTôi hiện phụ trách phát triển hệ thống cung cấp dịch vụ ngân hàng giao dịch (*2) cho những khách hàng đang mở rộng kinh doanh trên toàn cầu Trong khi các dịch vụ sử dụng công nghệ máy học và AI đang trở nên phổ biến trong lĩnh vực này, đặc biệt là ở Châu Âu và Hoa Kỳ, chúng tôi cảm thấy rằng hệ thống của chúng tôi vẫn chưa đạt đến trình độ đó Học hỏi những công nghệ tiên tiến này là điều cần thiết để cải thiện chất lượng dịch vụ của chúng tôiHơn nữa, trong sáng kiến ``hiện đại hóa phát triển'' mà tôi chịu trách nhiệm trong bộ phận của mình, chủ đề là cải thiện độ phức tạp của phân tích dữ liệu và chúng tôi đang phân tích lượng dữ liệu nhật ký khổng lồ được lưu trữ trong hệ thống và xem xét khả năng cải thiện dịch vụ của chúng tôi Cho đến nay, chúng tôi vẫn tiếp tục mà không sử dụng công nghệ máy học hoặc AI, nhưng để tiến lên, chúng tôi tin rằng việc dự đoán và phân cụm (*3) bằng máy học là điều cần thiết Vì lý do này, chúng tôi đã mời các thành viên trẻ có cùng sáng kiến tham gia cuộc thi này
※2Một tổ chức trung gian tài chính cung cấp dịch vụ tài chính bằng cách sử dụng thông tin cứng như báo cáo tài chính※3Một loại máy học chia dữ liệu thành các nhóm dựa trên mức độ giống nhau giữa chúng
Q Bạn đã tiến hành việc học của mình như thế nào? Ngoài ra, bạn đã làm gì để cải thiện độ chính xác chưa?
Ông MizutaniVì đây là lần đầu tiên tôi tham gia nên tôi đã học từ đầu bằng e-learning Ngay cả sau khi cuộc thi bắt đầu, tôi đã xem lại bài học trực tuyến nhiều lần để hiểu sâu hơn Ngoài ra, tôi còn thu thập được những kiến thức cần thiết khi sử dụng Udemy, nội dung bài giảng tại các cuộc họp tiếp theo trong thời gian thi đấu và trao đổi thông tin trên SlackTrong thời gian thi đấu kéo dài ba tháng, nửa tháng đầu và tháng cuối cùng được dùng để xem xét dữ liệu và tìm ra các đặc điểm Ngoài việc phân tích dữ liệu dùng để học và dự đoán, chúng tôi còn tập trung phân tích kết quả dự đoán của các mô hình mà chúng tôi tạo ra Tôi nghĩ việc này tương đối dễ dàng đối với tôi vì tôi đã quen với việc phân tích dữ liệu nhật ký và tìm kiếm các sự cố bảo mật trong công việc hàng ngày của mìnhTrong thời gian thi đấu, tôi có cơ hội học hỏi nhiều thứ nên ý thức không bị cuốn hút vào một lĩnh vực nào cả Khi gặp khó khăn, tôi đã bỏ cuộc sớm và bắt đầu làm việc khác, điều này cuối cùng đã giúp tôi tìm ra cách hiệu quả để cải thiện độ chính xác và tôi nghĩ điều đó đã dẫn đến kết quả này
Q Hãy cho chúng tôi biết về kết quả và những bài học mà bạn thu được qua cuộc thi
Khám phá lớn của tôi là bất kỳ ai cũng có thể xây dựng một mô hình máy học ở một mức độ nhất định và mang tính thực tế Học máy và AI có xu hướng được coi là những công nghệ mới và khó, nhưng chúng dễ học hơn bạn tưởngCá nhân tôi cũng rất vui khi một học sinh trung học thấy tôi cống hiến hết mình cho cuộc thi và nói: ``Tôi muốn trở thành một nhà khoa học dữ liệu trong tương lai''
(Phòng Công nghệ thông tin nhận định soi kèo bóng đá hôm nay MUIT GCMS Hiroji Mizutani)
Q Bạn muốn sử dụng kinh nghiệm của mình từ cuộc thi này như thế nào trong tương lai?
Tôi muốn sử dụng công nghệ máy học để cải thiện hoạt động kinh doanh và đề xuất các dịch vụ mới Ví dụ: cho đến nay chúng tôi vẫn do dự trong việc đưa ra các đề xuất dựa trên việc sử dụng hệ thống của khách hàng, nhưng qua cuộc thi này, chúng tôi đã học được rằng không có rào cản cao nào cả Chúng tôi muốn bắt đầu nỗ lực để hiện thực hóa mục tiêu này ngay lập tứcTôi cũng nghĩ sẽ rất thú vị nếu sử dụng máy học làm chủ đề để các thành viên trẻ tích lũy kinh nghiệm triển khai Tôi muốn phổ biến các phương pháp triển khai và ví dụ sử dụng cả trong và ngoài công ty, đồng thời biến nó thành công nghệ chung mà mọi người đều có thể sử dụng
Q Xin vui lòng gửi lời nhắn tới những người đang cân nhắc tham gia cuộc thi trong tương lai
Tôi cảm thấy rằng ngôn ngữ lập trình đang trở thành một công nghệ có thể được sử dụng dễ dàng hơn chứ không phải là khả năng bắt buộc của các chuyên gia cụ thể Ví dụ: giống như bạn sử dụng Excel để sắp xếp dữ liệu trong công việc hàng ngày một cách hiệu quả, tôi muốn bạn thoải mái học ngôn ngữ lập trìnhCuộc thi khoa học dữ liệu mang đến một môi trường nơi bạn có thể học máy học, phân tích dữ liệu, lập trình, vv từ những điều cơ bản Chúng tôi đặc biệt khuyến nghị những người mới bắt đầu nên sử dụng cuộc thi này như một cách để nâng cao các kỹ năng liên quan đến kỹ thuật số của họ
Vị trí số 1 nâng cao: Hitoshi Kasai nhận định soi kèo bóng đá hôm nay Trust và Phòng Nhân sự Ngân hàngVị trí thứ 2 nâng cao: Hiroyuki Hoshii nhận định soi kèo bóng đá hôm nay Morgan Stanley Phòng Kiểm toán nội bộ chứng khoán
Hướng đến một môi trường có thể sử dụng tự do lượng lớn dữ liệu tiềm ẩn tiềm năng
QHãy cho chúng tôi biết lý do bạn tham gia cuộc thi này
Ông KasaiTôi đã có kinh nghiệm nghiên cứu vật lý ứng dụng ở trường cao học và tôi gia nhập nhận định soi kèo bóng đá hôm nay Trust and Banking vì tôi muốn tham gia vào công việc giải quyết các vấn đề bằng cách sử dụng phân tích dữ liệu và phân tích toán học Tuy nhiên, trong công việc mà tôi đã trải nghiệm cho đến nay, tôi chưa có nhiều cơ hội như vậy và tôi luôn cảm thấy rằng một ngày nào đó tôi muốn thử phân tích dữ liệu toàn diện Tôi tham gia cuộc thi này vì tôi nghĩ đây là cơ hội tốt để đánh giá định lượng khả năng của mình, đạt được kết quả sẽ có lợi cho sự phát triển nghề nghiệp sau này của tôi
Ông HoshiiTrước đây tôi làm việc tại một công ty phát triển hệ thống ngân hàng, sau khi chuyển việc, tôi phụ trách bộ phận CNTT tại bộ phận vốn chủ sở hữu hiện tại của nhận định soi kèo bóng đá hôm nay Morgan Stanley Securities Vì công việc của mình, tôi đặc biệt quan tâm đến khoa học dữ liệu và AI trong lĩnh vực CNTT và trong khoảng bốn năm nay, tôi thỉnh thoảng tham gia các cuộc thi khoa học dữ liệu bằng cách sử dụng nền tảng khoa học dữ liệu và học máy có tên Kaggle Tuy nhiên, Kaggle rất tiến bộ và khó vào học nên tôi đang tìm kiếm những cơ hội tốt khác thì tình cờ thấy cơ hội tuyển dụng này và quyết định tham gia
(Bộ phận kiểm toán nội bộ của nhận định soi kèo bóng đá hôm nay Morgan Stanley Securities Hiroyuki Hoshii)
Q Bạn có gặp khó khăn gì trong cuộc thi này không?
Ông HoshiiĐối với cuộc thi này, chúng tôi phải xử lý một lượng dữ liệu khổng lồ, bao gồm 7 triệu mẩu dữ liệu gốc và khoảng 70 triệu mẩu dữ liệu mà chúng tôi đã xử lý cho mục đích học tập Lượng dữ liệu này cực kỳ khó khăn Tôi tham gia cuộc thi bằng máy tính cá nhân nhưng phải mất nhiều giờ để chạy một dự đoán Tôi đưa ra dự đoán vào buổi sáng, kiểm tra kết quả sau giờ làm việc và dựa trên những kết quả đó, tôi đưa ra một dự đoán khác vào buổi tối, rồi kiểm tra vào sáng hôm sau Quá trình này được lặp lại đều đặn
Ông KasaiTôi đã gặp khó khăn trong việc thiết kế và xử lý dữ liệu làm đầu vào cho mô hình học máy Khi dự đoán tương lai bằng machine learning, bạn cần chuẩn bị “dữ liệu học” cho mô hình học và “dữ liệu dự đoán” để nhập vào mô hình đã huấn luyện để đưa ra dự đoán Trong Basic, cả hai dữ liệu đều được chuẩn bị trước Mặt khác, trong Nâng cao, chỉ có dữ liệu lịch sử đơn hàng thô được cung cấp và tôi phải tự mình thiết kế và xử lý "dữ liệu học tập" và "dữ liệu dự đoán", điều này rất khó khăn Mục đích của dự án này là tạo ra một mô hình có chức năng “gợi ý” để dự đoán những sản phẩm mà một cửa hàng rượu ở Iowa sẽ đặt hàng trong tháng tới, vì vậy tôi đã dành rất nhiều thời gian và công sức để tìm hiểu lý thuyết và công nghệ liên quan đến gợi ý Cụ thể, bạn có thể tìm hiểu loại công cụ đề xuất nào được sử dụng trên các trang web và trang web thương mại điện tử thực tế, tham khảo các giải pháp được những người chiến thắng hàng đầu sử dụng trong các cuộc thi đề xuất Kaggle và đọc các bài viết về các chương trình có thể hữu ích khi triển khai logic đề xuất trong Python Bằng cách sử dụng nhiều phương pháp khác nhau để nâng cao kiến thức của mình về các khu vực xung quanh, tôi đã có thể thực hiện đượcTôi cũng đã tham gia cuộc thi này năm ngoái và đã giành được vị trí thứ 5 ở phần Cơ bản Sau khi tham gia cả Basic và Advanced, tôi nhận thấy Advanced khó hơn rất nhiều, lúc đầu tôi thấy bối rối Tuy nhiên, điều đó thật thú vị vì nó mang lại cho tôi nhiều tự do và không gian hơn để nghĩ ra nhiều ý tưởng khác nhau
Q Hãy cho chúng tôi biết điều gì đã thúc đẩy bạn khi tham gia cuộc thi
Mr HoshiiTôi được khích lệ bởi điểm số của chính mình và tiến bộ Trong thời gian thi đấu, bạn có thể kiểm tra điểm số và thứ hạng tạm thời của mình, nhưng khi đã lên đến đỉnh, tôi đã tự động viên mình và nói: ``Tôi không muốn tụt hạng từ đây, tôi muốn lên cao hơn''
Mr KasaiTôi cũng vậy Ban đầu, tôi đã chiến đấu chống lại chính mình và tiến về phía trước mà không phải lo lắng về những người tham gia khác Tuy nhiên, khi đã lọt vào top 10 của bảng xếp hạng tạm thời, tôi bắt đầu cảm thấy mình không muốn thua những thí sinh khác Những người tham gia hàng đầu đã tăng số lượng kết quả dự đoán mà họ gửi với tốc độ nhanh chóng và sự nhiệt tình của họ có thể được cảm nhận ngay cả qua màn hình Gần cuối cuộc thi, tôi nhìn thấy tên anh Hoshii và biết anh là một thí sinh giỏi
Ông HoshiiCó đoạn bị vượt, bị vượt
QBạn đã làm gì để cải thiện độ chính xác chưa?
Ông HoshiiTôi đã học trên Udemy và bổ sung những kỹ năng mà tôi thấy cần thiết khi vượt qua cuộc thi Bản thân chủ đề này đã tương đối quen thuộc nên rất dễ dàng để tiếp tục
Ông KasaiĐiều tôi luôn cố gắng làm là "xem xét kỹ" dữ liệu Thời gian thi đấu kéo dài ba tháng, nhưng trong khoảng tháng đầu tiên, tôi không xây dựng mô hình mà chỉ tập trung vào việc quan sát dữ liệu Vì lượng dữ liệu rất lớn, khoảng 7 triệu mục, nên tất nhiên điều quan trọng là phải hình dung nó bằng nhiều biểu đồ khác nhau và hiểu xu hướng chung Tuy nhiên, tôi nhận ra nhiều điều khi xem xét từng phần dữ liệu một cách chi tiết và cẩn thậnVí dụ: tôi thấy lạ khi có một số hàng có "tên công ty sản xuất" khác nhau mặc dù chúng là cùng một sản phẩm Khi tôi nhìn vào lịch sử quá khứ trên trang chủ của sản phẩm, tôi phát hiện ra rằng công ty sản xuất đã thay đổi giữa chừng trong quá trình mua lạiTôi cũng nhận thấy rằng có nhiều hàng có các mục số không nhất quán Ví dụ: ``tổng số lít đồ uống có cồn được đặt hàng'' phải khớp với giá trị thu được bằng cách nhân ``dung tích chai rượu'' với ``số chai được đặt hàng'', nhưng vì lý do nào đó có thể có sự khác biệt Khi tôi xem xét kỹ hơn, tôi thấy rằng một giá trị hoàn toàn khác đã được nhập cho "Dung tích chai rượu" Chúng tôi tin rằng điều này là do người nhập dữ liệu ở Iowa đã nhập sai thông tin đặt hàng rượu Vì đây là một cuộc thi nên tôi không thể xác nhận thêm bất kỳ sự thật nào, nhưng nếu đó là vấn đề thực tế, tôi muốn phỏng vấn người đã nhập dữ liệu để làm rõ nguyên nhânChúng tôi tin rằng độ chính xác đã được cải thiện nhờ quá trình xử lý trước dữ liệu đều đặn và tạo ra các tính năng dựa trên nhiều thông tin chi tiết khác nhau thu được theo cách này
(Phòng Nhân sự Ngân hàng và Ủy thác nhận định soi kèo bóng đá hôm nay Hitoshi Kasai)
Q Hãy cho chúng tôi biết về kết quả và những bài học mà bạn thu được qua cuộc thi
Mr KasaiKhi thực hiện các thử thách Nâng cao có độ khó cao, tôi cảm thấy kỹ năng lập trình của mình đã được cải thiện đáng kể và kiến thức về học máy của tôi đã sâu sắc hơn kể từ khi kết thúc cuộc thi năm ngoái Thoạt nhìn, thế giới AI và khoa học dữ liệu có xu hướng có một hình ảnh tuyệt vời và thông minh, nhưng tôi đã có thể tận mắt trải nghiệm rằng trên thực tế, có rất nhiều công việc khó khăn liên quan Và tôi nghĩ phần thưởng là tôi nhận ra rằng sự ổn định là điều quan trọng
Mr HoshiiTôi đã học được rất nhiều điều từ việc xử lý lượng lớn dữ liệu Ngoài ra, mặc dù đây không phải là cuộc thi duy nhất diễn ra ở cuộc thi này nhưng tôi thấy rất thú vị khi khám phá nhiều điều khác nhau không chỉ từ góc độ kỹ thuật mà còn từ góc độ nghiên cứu dữ liệu mục tiêu
Q Bạn muốn tận dụng kinh nghiệm của mình trong cuộc thi này như thế nào?
Mr HoshiiTôi làm việc trong lĩnh vực kiểm toán nội bộ và thúc đẩy hoạt động phân tích dữ liệu và phân tích dữ liệu Vì vậy, tôi muốn áp dụng những ý tưởng và cách tiếp cận liên quan đến khoa học dữ liệu vào công việc phân tích dữ liệu trong kiểm toán nội bộ Tôi nghĩ rằng chỉ cần tên kiểm toán nội bộ được nhắc đến trong cuộc thi này là cơ hội để thu hút sự quan tâm của mọi người trong và ngoài bộ phận kiểm toán nội bộ, vì vậy tôi muốn nhân cơ hội này để thúc đẩy mạnh mẽ khoa học dữ liệu
Ông KasaiTôi cảm thấy để tiến tới giai đoạn tiếp theo cần phải tích lũy kinh nghiệm thực tế MUFG có nền văn hóa khuyến khích những người nhiệt tình và có khả năng đương đầu với thử thách Vì vậy, tôi muốn sử dụng những kỹ năng và sự tự tin có được qua cuộc thi này làm bước đệm để tích cực tham gia vào các lĩnh vực thúc đẩy AI và DX
QBạn nghĩ điểm mạnh và thách thức của MUFG từ góc độ dữ liệu là gì?
Ông HoshiiTôi nghĩ thử thách đầu tiên là "căn chỉnh dữ liệu" Dữ liệu ở mỗi công ty là khác nhau nhưng vẫn chưa có cơ sở dữ liệu nhất quán về chứng khoán nên chúng tôi phải tự thu thập dữ liệu từ nhiều nguồn khác nhau Đó là trở ngại đầu tiênThứ còn lại là "môi trường" Tôi nghĩ sẽ khó có thể tạo ngay một môi trường nội bộ giống như môi trường được sử dụng trong cuộc thi khoa học dữ liệu này Tôi phụ trách kiểm tra hệ thống và khuyến nghị đảm bảo an ninh, nhưng tôi không thể nói rằng chúng tôi hiện có một môi trường mà các nhà khoa học dữ liệu có thể làm việc hài lòng Tôi cảm thấy rằng chúng ta cần nghĩ ra những cách để cân bằng việc thiết lập an ninh với việc tạo ra một môi trường trong đó lượng lớn dữ liệu có thể được xử lý một cách tự do
Ông KasaiMUFG có bộ sưu tập dữ liệu lớn lớn nhất ở Nhật Bản, từ dữ liệu truyền thống như tiền gửi, tín dụng, chứng khoán, thanh toán thẻ, lương hưu, bất động sản và tài sản thừa kế cho đến dữ liệu liên quan đến tài sản kỹ thuật số sử dụng công nghệ mới nhất Dữ liệu này có nhiều khả năng khác nhau và tôi nghĩ nó có thể nói là một thế mạnh lớnNiềm tin đặc biệt quan trọng trong các tổ chức tài chính Vì vậy, khi sử dụng dữ liệu, cần xây dựng vững chắc các phương pháp bảo vệ dữ liệu và cân nhắc quyền riêng tư Mặc dù đây là một nhiệm vụ khó khăn nhưng tôi nghĩ nó quan trọng
Hồ sơ
*Các cơ quan liên kết và chức danh tính đến thời điểm phỏng vấn

Phòng Công nghệ thông tin nhận định soi kèo bóng đá hôm nay MUIT GCMS
Hiroji Mizutani
Sau khi làm SIer, gia nhập Ngân hàng nhận định soi kèo bóng đá hôm nay vào năm 2013, sau đó chuyển sang Công nghệ thông tin nhận định soi kèo bóng đá hôm nay Chịu trách nhiệm quản lý trực tiếp, người phát triển các hệ thống hỗ trợ hoạt động kinh doanh ngân hàng giao dịch

Phòng Nhân sự Ngân hàng và Ủy thác nhận định soi kèo bóng đá hôm nay
Hitoshi Kasai
Sau khi hoàn thành chương trình thạc sĩ, anh gia nhập nhận định soi kèo bóng đá hôm nay Trust and Banking vào năm 2008 Sau đó, anh được biệt phái sang nhận định soi kèo bóng đá hôm nay Trust System Chịu trách nhiệm phát triển hệ thống quản lý chứng khoán nước ngoài Năm 2016, ông trở lại nhận định soi kèo bóng đá hôm nay Trust and Banking và phụ trách công tác hoạch định nguồn nhân lực

Phòng Kiểm toán nội bộ của nhận định soi kèo bóng đá hôm nay Morgan Stanley Securities
Hiroyuki Hoshii
Sau khi làm việc tại một công ty phát triển hệ thống ngân hàng, ông gia nhập Tokyo Mitsubishi Securities (sau đó là Tokyo Mitsubishi Securities) vào năm 1999 Kể từ đó, ông chủ yếu phụ trách các công việc liên quan đến CNTT trong bộ phận vốn cổ phần Trực thuộc Phòng Kiểm toán nội bộ từ năm 2012, nhiệm vụ hiện tại bao gồm kiểm toán hệ thống và phân tích dữ liệu



