Kaggle上位陣が実証、推論AIの精度は「検証可能な思考」で決まる
NVIDIAが開催した推論モデルの改善コンペティションに、5000人以上のKaggle参加者が挑んだ。参加者は同一のモデルと計算資源を使い、推論の正確さを競った。その結果、最終回答の正しさだけ
読む →研究を理解するための重要テーマ。
研究を理解するための重要テーマ。
研究を理解するための重要テーマ。
研究を理解するための重要テーマ。
Latest Articles
NVIDIAが開催した推論モデルの改善コンペティションに、5000人以上のKaggle参加者が挑んだ。参加者は同一のモデルと計算資源を使い、推論の正確さを競った。その結果、最終回答の正しさだけ
読む →
連合学習(Federated Learning)の研究現場では、「次に何を試すべきか」という問いが常につきまとう。データを一箇所に集めずに機械学習モデルを訓練するこの手法は、プライバシー保護と
読む →
NVIDIAは、自動運転(AV)開発の複数工程を単一モデルで横断する「Alpamayo 2 Super」を公開した。340億パラメータのオープンな推論VLAモデルであり、軌道生成から評価用デー
読む →
企業がAIを本格導入しようとするとき、多くの開発現場では「テキスト用」「画像用」「コード用」と、用途ごとに異なるモデルをつなぎ合わせる必要があった。この複雑なパイプラインが、開発速度の足かせに
読む →
この記事を一言でいうと NVIDIAが公開した大規模言語モデル「Nemotron 3 Ultra」は、総パラメータ数550Bの専門家混合モデルであり、実際に動くパラメータは55Bに抑えられてい
読む →
OpenAIは2026年6月、AIが科学研究で直面する曖昧な状況下での判断力を測る新ベンチマーク「GeneBench-Pro」を公開した。ゲノム解析や創薬などの現実データを使い、AIの「研究セ
読む →
NVIDIAは同社のAIネイティブストレージ向けプロセッサ「Vera BlueField-4 STX」のベンチマーク結果を開発者ブログで公開した。x86 CPUと比較してデータ完全性チェックで
読む →
生命科学の実務7領域を評価、OpenAIがベンチマークを発表 2026年6月、OpenAIは生命科学研究におけるAIの実用度を測る新たなベンチマーク「LifeSciBench」を公開した。単な
読む →Anthropicは2026年7月20日、AI for Scienceプログラムの一環として、希少遺伝性疾患に特化した研究助成の募集を発表した。採択者には最大5万ドル相当のClaude API
読む →
大規模言語モデル(LLM)単体の性能向上だけでは、企業におけるAI導入はスケールしない。そんな問題意識にもとづき、IBM Researchが「エージェントロジック」と呼ぶ概念の必要性をあらため
読む →
GPT-4級のAI推論コストが1年で50分の1以下に下落し、実質的に「無料の知能」が目前に迫っている。カリフォルニア大学バークレー校の研究チームは、この変化がデータベースやデータシステムの根本
読む →
金属3Dプリンターの最大の課題は、溶けた金属をいかに均一に混ぜるかだ。米国国立標準技術研究所(NIST)の研究チームは、レーザー照射によって溶融金属をその場で撹拌する手法を開発し、これまで製造
読む →ビジネスの現場で使われる音声AIアシスタントの評価が、いま大きな転換点を迎えている。航空券の予約変更なら完璧にこなすAIが、社内ヘルプデスクの福利厚生の質問で混乱する。そんな「領域による得意不
読む →
この記事を一言でいうと NVIDIAがCVPR(コンピュータビジョン・パターン認識の国際会議)で、現実世界で動くAIの開発を加速する「物理AIエージェント」向けの新技術群を発表した。 なぜ話題
読む →大規模言語モデル(LLM)の開発では、学習に使うデータの「量」だけでなく「質」が問われる段階に入った。NVIDIAは、公開タスクの訓練データを「種」として使い、モデルに構造的な学習信号を与える
読む →「コードが正しく動くか」より「AIエージェントが迷わず使えるか」が問われるようになってきた。Hugging Faceの研究チームは、同社の機械学習ライブラリ「transformers」を題材に
読む →
OpenAIが2026年6月30日に公開した「GeneBench-Pro」内部資料からは、生物医学の難度の高い推論能力を評価するベンチマークの具体的な中身が明らかになった。腫瘍ゲノムの構造変異
読む →
より大きなAIがより広い領域を制する。その常識に数学と進化生物学が「否」を突きつけている。2026年に発表されたGoldfeder、Wyder、LeCun、Shwartz-Zivらの論文は、最
読む →
機械学習モデルの追加学習(SFT)において、高い推論能力を維持したまま特定領域の性能を向上させる手法がAWSより公開された。同社のモデル「Amazon Nova 2」を用いた検証では、算数問題
読む →
工場や倉庫の映像解析を担うVision AI Agentの精度を高める手法として、NVIDIAがOmniverseプラットフォーム上で合成データとファインチューニングを段階的に組み合わせる3つ
読む →
Apple Machine Learning Researchは、複数被験者の脳活動データから共通信号源を推定する手法MVICAD2を公開した。時間的な遅延に加えて信号の伸縮まで扱えるようにし
読む →
米国立標準技術研究所が、ナノ材料の特性評価において広く見られるデータ分析上の誤りを特定し、その実用的な数学的補正手法を発表した。この発見は、ナノ粒子のサイズ測定に内在する誤差が製品性能の見極め
読む →
IBM ResearchがエンタープライズJavaアプリケーションのフレームワーク移行をAIに解かせるベンチマーク「ScarfBench」を公開した。34のアプリケーションと204の移行タスク
読む →
医薬品研究の現場では、論文、実験記録、遺伝子データベースに点在する知識の分断が、新薬発見の大きな障害となっている。アマゾン ウェブ サービス(AWS)は、グラフデータベースと生成AIを組み合わ
読む →企業や個人が自前データで大規模言語モデルを調整するとき、今や「LoRA」を使うことが常識になっている。しかし、その当たり前に異議を唱える検証が、AIプラットフォームを運営するHugging F
読む →
NVIDIAの大規模言語モデル「Nemotron 3 Ultra」が、AIエージェント構築プラットフォーム「LangChain」との組み合わせで、既存の商用モデルを上回る価格性能比を記録した。
読む →
工場で同じ動作をくり返すだけだったロボットが、一度も触れたことのない物体をその場で認識し、初見の部屋でも迷わず目的の棚へ向かう。そんな自在な動きを実現するうえで最大の障壁は、計算のなかで完璧に
読む →
導入 AIエージェントを業務に導入しても、その性能が上がっているのか、それとも劣化しているのかを正確に判断するのは難しい。日々変わる実トラフィックだけを眺めていても、一喜一憂するだけで本当の進
読む →
Databricksは2025年、大規模言語モデル「GPT-5.5」を自社のエンタープライズ向けAIエージェントワークフローに統合した。この動きは、同モデルが企業の事務処理能力を測るOffic
読む →
国立情報学研究所(NII)が、学術情報基盤の研究開発を担う特任研究員の公募を開始した。今回の募集は、単なる研究職の求人にとどまらず、AIやIoTの社会実装に不可欠な「クラウド人材」の重要性が国
読む →
テキストから映像と音声を同時に生成する「Text-to-Sounding-Video(T2SV)」技術が、実用化に向けた構造的課題を克服しつつある。中国人民大学と元Apple研究者を含むチーム
読む →
検索やレコメンドの現場で、機械学習モデルが時間経過とともに予測スコアを変動させる「時間的不安定性」が課題となっている。この問題に対し、Appleの研究チームは、原因となる特徴量を特定し除去する
読む →
Appleの機械学習研究チームは2025年7月、生成AIが出力するトークン単位で残りの生成長を予測するフレームワーク「Length Value Model(LenVM)」に関する論文を公開した
読む →
LangChainのAnthropic連携パッケージが更新され、推論トークンが利用メタデータとして報告されるようになった。これまで把握しづらかったClaudeモデルの思考プロセスにかかる消費量
読む →
LangChainのOpenAI統合パッケージ「langchain-openai」がバージョン1.5.1として公開された。今回の更新では、ストリーミング配信時に暗号化された推論内容が失われる問
読む →
NVIDIAが単一の軽量モデルで画像・音声・動画・テキストを同時処理する「Nemotron 3 Nano Omni」を発表した。これにより、これまで複数モデルを組み合わせていたエージェント推論
読む →
Appleの機械学習研究部門が公開した新たな理論論文は、関数の特性と分布の特性が「テスト」では密接に関連するにもかかわらず、「検証」においては明確に分離されることを証明した。対話証明の枠組みで
読む →
健康基盤モデルが大量の生体データから獲得した表現は、もはやブラックボックスではない。ICML 2026の解釈性ワークショップに採択された研究は、学習済みモデルから健康状態に紐づく「シンボル(解
読む →
サカナAIは、中央制御なしに多数の単純な物理モジュールが協調して形状を認識するシステムを開発し、論文が英科学誌Nature Communicationsに受理された。各モジュールは同じ小規模ニ
読む →
Strands社が発表したエージェント構築フレームワークは、大規模言語モデルを活用したアプリケーション開発の工程を根底から短縮する設計思想を持つ。同社の技術資料によれば、これまで複数のAPI呼
読む →
LangChainのOpenAI統合パッケージが更新され、推論モデルの出力を扱う際の境界管理が改善された。あわせて、APIゲートウェイから返されるメタデータの抽出機能も追加されている。小規模な
読む →
いま、ロボットや自動運転車が「現実世界をどう理解するか」という根本的な課題に、生成AIの応用が急速に進んでいる。NVIDIAが発表した「Cosmos 3」は、テキストや画像だけでなく、物理法則
読む →
Appleの機械学習研究チームは2026年7月、大規模言語モデル(LLM)が長期推論を安定的に遂行するための新手法LEADを論文で公開した。問題を細かく分解する戦略自体は有効だが、分解が過ぎる
読む →
Appleの機械学習研究部門が、入力データのごく一部を読むだけで証明を生成できる「Doubly Sub-linear Interactive Proofs of Proximity(dsIPP
読む →
大規模言語モデル(LLM)が複雑な問題を解く際、その推論過程はしばしば不安定で、多様な思考パターンを獲得しにくい。UCLA中心の研究チームがICML 2026で発表した「Ctrl-R」は、強化
読む →
国立情報学研究所(NII)の相澤彰子教授と東京大学の山内悠輔氏による研究が、自然言語処理のトップカンファレンスACL 2026でBest Theme Paperを受賞した。感情を円環上に配置す
読む →
サイバーエージェントが、2026年8月に長崎で開催される画像認識の国内最大級会議「MIRU2026」のプラチナスポンサーとなる。29件に及ぶ研究成果の発表は、広告・メディア企業によるコンピュー
読む →
企業のIT運用をAIエージェントに任せる未来は、想像以上に遠いのかもしれない。2025年7月、分析機関Artificial AnalysisとIBM Researchが共同で発表したベンチマー
読む →
生成AIの活用がチャットボットから自律型エージェントへ移行するなか、誰でも参加できる公開評価基盤「Open Agent Leaderboard」が登場した。Kong社が2025年6月に発表した
読む →
ジョンズ・ホプキンス大学などの研究チームは、大規模言語モデルが推論に使う計算資源(トークン数)と回答精度のバランスを自動調整するフレームワーク「Conformal Thinking」を発表した
読む →
大規模言語モデル(LLM)の中核を担うトランスフォーマーの解釈性向上は、近年のAI技術進歩の根幹に関わる課題だ。2026年7月に発表された論文「MemoryLLM」は、自己注意機構とフィードフ
読む →AIの調達現場で、スケール(規模)を追求する意思決定が運用コストの最大70%を浪費している実態が明らかになった。意思決定者の8割以上が汎用モデルの大きさを評価基準に据える一方、実際の業務適合性
読む →
国立情報学研究所(NII)は、学術研究データを収集・蓄積する新たな解析基盤の開発を担う技術専門員の募集を開始した。日本の学術AIインフラを支える学認クラウドの運用強化が目的だが、応募締切日より
読む →
Appleの機械学習研究チームは、学習データが少ない言語向けに、対訳コーパスや翻訳システムを使わずに知識を移転する手法「LINK」を発表した。高資源言語の事前学習データに低コストの語彙置換を施
読む →
AIによる機械学習研究の自動化が、1000人を超える開発者による異例のコンペティションで現実味を帯びてきた。「Parameter Golf」と名付けられたこの企画は、極めて厳しい計算リソース制
読む →
研究の世界では今、AIを活用して膨大な生物医学データをどう統合し、意味のある発見につなげるかが大きな課題になっている。特に患者数が少なく、研究リソースが限られる希少がん領域ではその重要性が際立
読む →
この記事を一言でいうと 開発者が複数のAIエージェントを連携させ、信頼性の高いリサーチワークフローを構築できる新手法が、Amazon Bedrock AgentCoreを通じて提供開始された。
読む →
AWSは、Amazon SageMaker AI Studio上で生成AI推論の推奨構成をUIで提供する機能を公開した。これまではAPI経由でプログラム的に取得する必要があり、パラメータ設定や
読む →
IBMが2026年4月15日、企業環境におけるAIエージェントの推論能力を評価する新ベンチマーク「VAKRA」の詳細を発表した。従来の個別スキルテストと異なり、複数ステップにわたるワークフロー
読む →
OpenAIは2026年4月22日、臨床医向けに特化した「ChatGPT for Clinicians」を米国内の認証済み医師、NP、PA、薬剤師に対して無償で提供開始した。これは、増大する事
読む →
OpenAIは2026年4月23日、次世代大規模言語モデル「GPT-5.5」を正式リリースした。同モデルは、単なる対話を超え、複雑なタスクを自律的に計画・実行する「エージェントAI」の基準を塗
読む →
アラビア語対応大型言語モデル(LLM)の評価基準に新たな転換点が生じた。研究者グループが2026年4月に発表した新リーダーボード「QIMMA(キンマ)」は、既存の評価手法における品質問題を厳格
読む →
サイバーエージェントのAI研究組織「AI Lab」は、ロボティクス分野のトップカンファレンス「IROS 2026」に論文が採択されたと発表した。本論文は、人間の非言語行動を自律ロボットが認識し
読む →
国立情報学研究所の相澤彰子教授と東京大学の山内悠輔氏による感情表現の幾何学的構造を解明した研究が、自然言語処理のトップカンファレンスACL 2026でBest Theme Paperを受賞した
読む →
スイス連邦工科大学ローザンヌ校(EPFL)とAppleの研究チームは、動画を粗い情報から細かい情報へと段階的に圧縮する新たな動画トークン化手法「VideoFlexTok」を発表した。動画の抽象
読む →
機械学習の国際会議ICMLで2026年7月に発表された論文で、事前学習済みの生体信号基盤モデルを多様なデバイスレイアウトに適応させる新手法「Device Passport」が提案された。異なる
読む →
Appleの機械学習研究チームが、未知のデータ分布に対する第三者分析の真偽を、分析の再実行よりも少ない計算資源で検証する理論的枠組みを構築した。本成果は、データ分析の外部委託やAI推論のアウト
読む →
Amazon SageMaker AIは、推論最適化のための推奨ジョブとベンチマークジョブで得られるメトリクスやパラメータを、MLflow上に自動ストリーミングする連携を開始した。この統合によ
読む →
大学共同利用機関法人自然科学研究機構は、AIとロボットを活用し実験の設計から解析までを一体化する大規模スマートクラウドラボ「iLIS」を愛知県岡崎市に整備する。総事業費約95億円を投じ、令和1
読む →
国立情報学研究所(NII)が2026年度版の要覧を日本語で刊行した。ネットワーク、ソフトウェア、コンテンツなど情報関連分野の理論から応用までを総合的に研究開発する同研究所の最新の体制と活動範囲
読む →
国立情報学研究所(NII)が知識コンテンツ科学研究センターの特任研究員を募集している。公募情報からは、同センターが大規模言語モデルやAIエージェント、知識グラフを活用した知識基盤の開発に着手し
読む →
サイバーエージェントのAI研究開発組織「AI Lab」の2本の論文が、コンピュータ・ビジョン分野のトップカンファレンス「ECCV 2026」に採択された。一つは3D復元の計算安定性を高める手法
読む →
サイバーエージェントのAI研究組織「AI Lab」と国立情報学研究所の研究チームによる論文が、理論計算機科学の最高峰会議「FOCS 2026」に採択された。AIや大規模システムが最適な状態から
読む →
サイバーエージェントのAI研究組織「AI Lab」と東京科学大学の研究チームによる共著論文が、進化計算分野のトップカンファレンス「PPSN 2026」に採択された。数式で予測の根拠を示すシンボ
読む →
国立情報学研究所(NII)は2026年6月22日、学術認証基盤「学認」に対応したIdP(認証プロバイダ)ホスティングサービスをIDaaS(Identity as a Service)として再構
読む →
国立情報学研究所(NII)は、2026年度の市民講座「情報学最前線」の概要と日程を公開した。ネットワーク、ソフトウェア、コンテンツなどの情報関連分野における理論から応用までの研究成果を一般向け
読む →
国立情報学研究所(NII)の黒岩稜助教が、The 19th International Symposium on Combinatorial Search (SoCS) の Best Revi
読む →
国立情報学研究所(NII)が、全国の大学で利用が進む研究データ基盤「NII Research Data Cloud」のセキュリティ運用を担う特任技術専門員の募集を開始した。この募集は、学術デー
読む →
IBMは2024年10月、企業の文書処理に特化した小型マルチモーダルAIモデル「Granite 4.0 3B Vision」を発表した。パラメータ数わずか30億でありながら、表やグラフを含む複
読む →
ローカルLLM実行環境Ollamaに、推論プロセスを保持するための新フラグ「--reasoning-preserve」が追加された。今回のプルリクエスト 25105の着目点は、一見すると小さな
読む →
大規模言語モデル(LLM)の推論を高速化するオープンソースエンジン「vLLM」がバージョン0.24.0を公開した。今回のリリースでは、複数の専門家モデルを組み合わせるMoE(Mixture o
読む →